混合乳腺X线摄影数据集并不能改善筛查AI:当模型学到的是数据集的「签名」而非癌症
加拿大纽芬兰纪念大学的一个团队检验了一个被视为理所当然的假设:把来自公开数据库、经活检确诊的癌症病例添加到真实筛查数据集中,应当能改善乳腺X线摄影的分诊模型。作者先用NLBSD筛查数据集(5997次检查,1.29%为可疑病例)训练同一个分类器,再加入CBIS-DDSM和CMMD的阳性病例,结果却相反:每加入一次,性能就下降一次;一项诊断性实验揭示了原因——模型几乎完美地按图像的数据集来源加以区分(AUC 0.9998),证明它学到的是数据集的「签名」而非病理。
背景
乳腺X线筛查是在健康人群中寻找罕见的癌症:在受检年龄段的女性中,真正可疑发现的患病率约为1%。这正是该任务对机器学习模型如此困难的原因——待检测的信号罕见、细微,并被压倒性多数的正常检查所淹没。要训练一个分诊AI(把「正常」与「可疑」区分开),就需要与这一现实相似的数据。而这类数据极其稀缺:大多数公开的乳腺X线数据集——如CBIS-DDSM或CMMD——都是「异常富集」的集合,由已经活检的病例构建而成,其中癌症众多且往往清晰可见,几乎没有正常的筛查检查。
由此产生了一个看似合乎常理、并被到处援引的想法:既然阳性病例稀少,何不用这些来自别处的确诊癌症来补充自己的筛查数据集?阳性越多,检测器越好。纽芬兰纪念大学团队用一项不寻常的资源来检验这一直觉:NLBSD(Newfoundland and Labrador Breast Screening Dataset),它是少数几个代表真正筛查队列的公开数据集之一,带有「正常/可疑」标注和低患病率。确切的问题是:向NLBSD加入CBIS-DDSM和CMMD的癌症,能否改善在NLBSD上的检测?为衡量,作者使用AUC(ROC曲线下面积),这是0.5到1之间的分数,表示模型把可疑病例与正常病例区分开的能力:0.5为随机,1为完美。
方法
该设置刻意简单且受控——目标不是刷新纪录,而是分离出一个原因。作为特征提取器,作者采用以Mammo-CLIP权重(一个专门在乳腺X线上预训练的模型)初始化的EfficientNet-B5,并将其冻结:其参数不再变动。只在其上训练一个小的线性分类头——这一设置称为线性探针(linear probe),用来检验模型冻结后的表征中已经包含了什么,而不对其针对任务重新调整。这是一个有力的方法学选择:如果出现某种信号,那它是刻印在通用表征之中的,而非由投机性的再调整所制造。
三个数据集登场。NLBSD提供5997次筛查检查(双乳的CC与MLO投照),可疑病例患病率为1.29%(5997例中的149例)——现实的写照。CBIS-DDSM(1644例,来自数字化的胶片)和CMMD(1775名患者的3712幅图像,原生数字)只贡献其经活检确诊的异常病例。关键之处在于:在所有实验中,阴性病例都仅来自NLBSD;外部数据集只用于增加阳性。
所有数据集都经过完全相同的预处理:相同的DICOM转换、逐幅图像归一化到同一尺度、乳房裁剪、统一朝向。其用意是中和「表层」差异,使任何性能差距都反映真正的域差异,而非格式伪影。训练/验证/测试的划分(70/10/20)在患者层面进行,使同一个人的图像不会同时出现在训练与测试中——这正是避免数据泄漏(data leakage)的预防措施,这种偏差会让模型通过在测试中重见训练时已见过的病例来「作弊」。性能以图像层面的AUC衡量,配以自助法(bootstrap)置信区间和DeLong检验比较,并对多重比较作Holm校正。最后,一项诊断性实验重新利用同一套设置:不再预测「正常/可疑」,而是要求模型猜出每幅图像来自哪个数据集。
结果
最好的模型是那个什么都没添加的模型。仅在NLBSD上训练和评估时,它达到0.737的AUC(95%置信区间0.686–0.785)。添加外部阳性每次都会使性能下降,且愈加严重:加入CMMD的癌症为0.644(−0.093),加入CBIS-DDSM为0.640(−0.097),两者合并为0.620(−0.117)。下降是单调的——加入的来源越多,损失越大——且具有统计学显著性(Holm校正后p=0.015、0.005和<0.001)。在包含外部阳性的「混合」测试集上评估也无法扭转:0.653、0.651、0.648,始终不超过基准。
临床层面的转译才是真正的警示。在固定决策阈值下,基准模型平衡了敏感性与特异性(各为0.66)。富集后的模型保持其特异性,但敏感性跌至0.53–0.55——也就是说,它们漏掉了约45%到47%的可疑病例,而基准为34%。在筛查中,这恰恰是错误的方向:人们希望尽可能少漏掉癌症,哪怕代价是多召回几名女性。因此,盲目添加数据既降低了判别力,又把工作点推向了危险的一侧。
为什么?诊断性实验毫不含糊地展示了这一点。当被要求预测数据集来源而非病理时,模型几乎完美地区分了三个数据集:每个数据集的F1都高于0.98,平均AUC为0.9998,混淆矩阵对角线为99.7 / 98.8 / 100.0%。尽管预处理严格相同,每个数据集都携带着一种网络闭着眼睛都能读出的「签名」。这正是捷径学习(shortcut learning)的定义:模型不去学习那个困难的概念——筛查人群中细微的癌症——而是抓住一个容易且无关的线索:图像来自哪里。作者援引了如今已成经典的先例:一个胸片模型能够识别出图像来自哪家医院,并正因如此而泛化不佳。
值得肯定之处
一个分离出原因的方案。一切都保持恒定——架构、优化、预处理——只有训练数据的构成在变化。患者层面的划分干净地排除了数据泄漏,而选择冻结编码器强化了结论:数据集近乎完美的可分性并非由针对任务的再调整所制造,它已存在于一个通用的乳腺X线表征之中。因此可以断言一个原因——所添加数据的域——而单纯比较模型则会含糊不清。
诚实的临床锚点。作者从一个真正的筛查队列(NLBSD)出发,而非更省事的富集数据集,并如实地为自己的工作定位:在没有乳腺X线预训练的情况下,一项在先的工作在NLBSD上最高只达到0.6209的AUC(而在经过整理的小型INbreast数据集上为0.905);从Mammo-CLIP出发,他们得到一个更稳固的基准(0.737),并以此为起点。因此比较对象是明确且有时间标注的,而非稻草人。
把失败转化为示范。作者没有只是指出性能不佳便就此打住,而是构建了「猜数据集」这一测试,精确指出了机制所在。这是良好的规范:为失败模式命名(捷径学习),对其加以测量,并把它与医学影像其他领域已被记录的现象联系起来。
不足之处
单一模型,单一训练方式。一切都依赖于一个冻结的EfficientNet-B5 + Mammo-CLIP,配以线性探针和普通的交叉熵。作者承认:对编码器进行完整微调、采用多视图模型,或使用为类别不平衡而设计的目标函数,行为可能有所不同。而且绝对性能仍然一般——0.737的AUC不是可部署的工具,而是一个测试台。该结果针对的是「这一套设置」,而非所有乳腺X线AI。
需谨慎对待的数字。作者自己指出,图像层面的检验把同一次检查的四个相关投照当作相互独立,这使p值「略显乐观」——这是经典的误导性指标,此处被诚实地化解,但提醒人们不要过度解读显著性阈值(不过,结果的单调排序并不依赖这一假设)。至于来源测试0.9998的AUC,它衡量的是数据集的可分性,而非临床结局:令人瞩目,但不应被读作诊断性能。
泛化性尚待确立。NLBSD虽然珍贵,却只反映单一人群、单一设备群、单一区域方案(纽芬兰与拉布拉多)。目前没有任何证据表明同样的退化会出现在其他真正的筛查队列上,也不清楚它如何在各亚组(年龄、乳腺密度、设备)间分布——这种人群偏差没有被绘制出来。没有前瞻性验证,而且这是一篇尚未经过同行评议的预印本,已投稿至期刊但未发表。
它带来的改变
对研究界而言,信息很明确:堆叠异质数据集并非没有代价,往往适得其反。数据数量无法弥补其域上的错配;在指望来自别处的癌症真正有所帮助之前,需要明确的策略——强度协调、域自适应、以中心为条件的模型、模拟采集变化的数据增强。顺带地,该研究解释了为何众多乳腺X线数据集始终各自为岛:由于缺乏跨越采集边界的方法,它们无法构成单一资源。
对临床医生和决策者而言,这是对一种常见推销说辞的解毒剂。供应商宣称某模型「在来自多个数据集的数万张乳腺X线片上训练」并不能保证什么:如果这些数据集与受筛查人群并不相似,添加它们可能在最要紧之处降低敏感性。正确的问题不是「有多少病例?」,而是「这些病例是否与我的患者相似、是否用我的设备采集?」。筛查工具必须在筛查分布上加以验证。
对患者和公众而言,该研究拆穿了「数据越多」等于「AI越安全」的观念。一个模型看上去在学习癌症,实际上却可能在学习识别设备或图像的来源——一种在真实条件下会崩溃的隐形捷径。筛查AI的安全性无法从其训练规模推断:它必须在真正相关的人群上得到证明。
延伸阅读
预印本《Dataset-Origin Signatures and Shortcut Learning in Screening Mammography AI: A Cross-Dataset Case Study》可在arXiv(2607.15416)获取,于2026年7月16日由Parham Hajishafiezahramini、Matthew Hamilton、Oscar Meruvia-Pastor和Edward Kendall(加拿大纽芬兰纪念大学)提交,并投稿至Computerized Medical Imaging and Graphics;该工作由该校的Seed, Bridge, and Multidisciplinary Fund资助,无已申报的利益冲突。数据均为公开(NLBSD通过Federated Research Data Repository;CBIS-DDSM和CMMD通过The Cancer Imaging Archive)。关于乳腺X线AI与泛化的盲点,参见我们对按乳腺密度评估肿块检测、对医学影像中按亚组隐藏的偏差,以及对foundation model的稳健性与泛化的解读。
编辑透明度说明:法文版由Tatakoto编辑部在阅读该预印本后撰写并署名。英文、西班牙文和中文译本借助AI协助完成并经过审校。