胸片结核筛查:一旦把健康对照换成患病对照,医学视觉-语言模型便大幅失准
印度理工学院印多尔分校(Indian Institute of Technology Indore)的三位研究者,用来自四个公开数据集的 12 200 张胸部 X 光片,对四个视觉-语言模型——三个医学模型(BioMedCLIP、CheXficient、MedSigLIP)和一个通用模型(OpenCLIP)——进行了结核病筛查审计,每次只改变一个条件:队列、文本措辞、对照类型、设定患病率、决策阈值。模型排名经不起考验:把健康对照换成患有其他疾病的患者,AUROC 下降 0.075 至 0.306;面对肺炎或肺部肿瘤时,三个医学模型都跌破 0.5,即随机水平;一个在内部验证中达到 0.999 的监督网络,在两个外部队列上跌至 0.629。这篇论文没有提出任何新模型,这恰恰是它的价值:它表明基准分数不是模型本身的属性,而是一整套评估设定的属性。
背景
结核病仍是全球主要的感染性致死原因之一,而胸部 X 光是目前最便宜的大规模筛查工具。自 2021 年起,世界卫生组织接受计算机辅助检测(CAD)作为人工阅片的替代方案,用于 15 岁及以上人群的筛查和分诊。多款商业软件已在放射科医生短缺的高负担国家投入使用。
这些软件属于监督式分类器:用成千上万张标注为"结核"或"非结核"的图像训练而成。视觉-语言模型(VLM)则承诺另一种方式。图像编码器和文本编码器在图像-说明文字配对上共同训练,把一张 X 光片和一句话映射到同一个数学空间中。于是可以做零样本(zero-shot)分类,即无需任何重新训练:写下"显示结核的胸片"和"无结核的胸片"两句话,看图像更接近哪一句。对于缺乏本地标注数据的筛查项目,这个思路很有吸引力。
问题在于基准到底测量了什么。一个很高的 AUROC 并不说明对照组是哪些患者、分类器由哪句话定义、在别处设定的阈值能否在此处奏效。作者用七个要素来描述任何一次评估——模型、文本、队列、阴性定义、患病率、阈值、指标——改变其中任何一个,就等于在评估另一个系统。
方法
数据。四个公开数据集。Montgomery(美国,58 例结核,80 例正常)和深圳(Shenzhen,中国,336 例结核,326 例正常),是美国国家医学图书馆(National Library of Medicine)的两个经典数据集。TBX11K 难得地区分三类:结核、健康、以及患病但非结核;其验证集包含 200 例结核、800 例健康、800 例患病。最后是 VinDr-CXR 测试集(来自越南两家医院的 3 000 张图像,由五位放射科医生共识标注),它给出了竞争性诊断的名称:164 例结核、2 051 张无异常胸片、210 例肺炎和 73 例不伴结核的肺部肿瘤。
模型全部冻结。OpenCLIP 在二十亿张网络图像上训练,作为通用对照。BioMedCLIP(Microsoft)从生物医学文献中的 1 500 万对图-文说明中学习。CheXficient(Stanford AIMI)专门面向胸部 X 光——而 VinDr-CXR 明确列在它的训练数据中,作者在全文中始终标注这一点。MedSigLIP(Google)覆盖多个医学专科。
提示词(prompt)。五个措辞家族,全部逐字公开:一个"临床"家族,每类四句,事先指定为主分析;另有四个单句变体(报告风格、存在/不存在等)。总计 244 000 个评分。
分析在查看结果之前就已确定。用 AUROC 衡量区分能力——即一张结核图像得分高于一张非结核图像的概率;0.5 相当于随机。用 Brier 分数(评分与真实结果之间的均方误差)和校准误差(声称概率与观察频率之间的差距)衡量评分可靠性。随后是两项面向实际操作的检验:对类别重新加权以模拟不同患病率;以及把在 TBX11K 上为达到 95 % 灵敏度而选定的阈值原样迁移到其他队列。最后,用 TBX11K 训练的常规监督式 ResNet-50(五个随机种子)作为参照;作者还用感知哈希排查数据集之间的近似重复图像。
结果
没有哪个模型处处领先。使用临床提示词时,MedSigLIP 在 Montgomery(0.976 对 0.969)和 TBX11K(0.800 对 0.795)上略胜 CheXficient,但差异在统计上并不确定;CheXficient 在深圳数据集上明显领先(0.950 对 0.907)。在 VinDr-CXR 上,CheXficient 为 0.878,MedSigLIP 0.829,BioMedCLIP 0.713,OpenCLIP 0.528——但 CheXficient 训练时见过这个数据集。在 TBX11K 上,两者 AUROC 几乎相同,而 CheXficient 的 Brier 分数却好了将近一倍(0.099 对 0.171)。
文本是模型的一部分。更换提示词家族,在 48 项比较中有 21 项的 AUROC 发生显著变化(经多重检验校正)。在同一批 TBX11K 图像上,CheXficient 用"报告"措辞时为 0.835,用"存在/不存在"措辞时降至 0.622。
核心结果:对照组。在 200 例结核图像不变的情况下,把 800 例健康对照换成 800 例患病对照,所有模型的 AUROC 都下降:MedSigLIP 从 0.953 降到 0.647,BioMedCLIP 从 0.872 降到 0.611,CheXficient 从 0.865 降到 0.725。在 VinDr-CXR 上更为明显。对照为无异常胸片时,CheXficient 达到 0.945;对照为肺炎时为 0.466;对照为肺部肿瘤时为 0.372。MedSigLIP 和 BioMedCLIP 降至 0.31 到 0.38 之间。换句话说,面对另一种疾病时,这些模型更常给肺炎图像而不是结核图像打出较高的"结核"分数。
阈值无法迁移。在 TBX11K 上为 95 % 灵敏度设定的阈值,在 16 次迁移中只有 4 次保住了这一灵敏度。即便保住了,有时也是靠把几乎所有人都判为阳性:OpenCLIP 在深圳数据集上保住灵敏度时,特异度只有 0.043。CheXficient 在 VinDr-CXR 上灵敏度 97.6 %、特异度 35.4 %;面对肺炎,210 例中只正确排除了 1 例,73 例肿瘤一例都没有排除。
临床换算(Tatakoto 根据上述数字自行计算,并非作者的估计):以 VinDr-CXR 中观察到的患病率(5.5 %)计,每 1 000 张胸片,这一设定能发现 55 例结核中的约 54 例,但也会让约 610 名非结核者去做确诊检查。作为对照,世卫组织对分诊检测的目标产品特征要求灵敏度至少 90 %、特异度至少 70 %。
监督学习也无法解决问题。ResNet-50 在内部验证中达到 0.997(五个种子的集成为 0.999),而在深圳和 Montgomery 上都只有 0.629。感知哈希筛出 249 对可疑图像,涉及 313 张;剔除后重新训练,深圳从 0.633 提升到 0.733,Montgomery 从 0.627 提升到 0.678,但约 0.27 和 0.32 的差距仍未弥合。
做得好的地方
配对比较,只隔离一个因素。健康对照与患病对照的比较保持完全相同的 200 例结核图像和相同的患病率(20 %),唯一改变的是阴性样本的性质。正因如此,AUROC 的下降可以归因于对照组的疾病谱,而不是阳性人群的变化。四项差异经 Holm 校正后均显著(p ≈ 0.0004)。
对可能扭曲审计的因素保持了少见的透明。提示词逐字公开;四个模型中有两个给出了确切的权重版本号;CheXficient 对 VinDr-CXR 的暴露在每张表中都有标注;作者还说明了他们对 MedSigLIP 的预处理与开发者不同(使用 PIL 而非 TensorFlow 缩放),因此其数字并不复现模型卡(model card)上的结果。
把文献中常被混为一谈的三种结论分开。"这个模型排序准确"、"它的评分可靠"、"它的阈值在别处仍能保持灵敏度"是三个不同的命题,审计表明同一个模型在这三点上可能结论不一。例如:设定患病率为 50 % 时,MedSigLIP 在三个队列上的 Brier 分数都优于 CheXficient;设定为 10 % 时,顺序反转——而没有任何一个评分发生变化。
做得不够的地方
标签并非微生物学金标准。四个数据集都没有提供统一的细菌学确诊;VinDr-CXR 依据的是放射学印象。面对肺炎时的部分"失败",可能反映的是确实模棱两可的图像或有争议的标注,而非模型错误。作者也承认:低于 0.5 的 AUROC 描述的是排序,而不是临床误诊率。这是经典的疾病谱偏倚,只不过作用在参考标准本身。
分析单位是图像,而非患者。数据清单没有把同一患者的图像关联起来;重复图像筛查不包括 VinDr-CXR,也无法证明这些模型的预训练中没有用到任何评估图像——它们的语料部分并不公开。因此数据泄漏(data leakage)的风险只是被限定,而未被排除,置信区间也可能偏窄。尤其是监督模型 0.999 → 0.629 的落差仍有解释空间:作者表明剔除可疑的近似重复图像有一定帮助,但无法确定哪些是真正的重复。
审计止步于临床问题之前。没有读片者研究,没有按性别或年龄的公平性分析,也没有评估在本地重新校准的系统——而任何严肃的筛查项目都会这样做。对照模型是通用 VLM 和一个 ResNet-50,而不是实际用于结核筛查的商业 CAD 软件:审计无法说明后者面对同样的患病对照时表现如何。最后,所审阅的版本中没有关于资助、利益冲突或代码公开的任何说明,因此无法原样复现分析。
这改变了什么
对研究界,这篇论文提供了一份可直接复用的清单:任何零样本医学 VLM 的论文都应给出确切的提示词和阴性定义,并报告针对具名患病对照、而不仅仅是健康对照的表现。这是对一个已知问题——隐性分层(hidden stratification)——的工具化呈现:VinDr-CXR 上 0.878 的总体 AUROC,可以与面对肺炎时差于随机的排序并存,因为 2 051 张正常图像主导了分母。同样的机制也出现在我们对儿科胸片模型可迁移性以及MIMIC-CXR 标签审计的解读中。
对临床医生和筛查项目,信息很实际。在真实人群中,接受筛查的人并非"要么结核、要么健康":许多人有肺炎、陈旧性病变或癌症。一个在 Montgomery 或深圳数据集上取得漂亮 AUROC 的模型——这两个数据集只把结核与正常肺对比——对这种场景没有提供任何证据。阈值也绝不能原样照搬:必须在本地重新设定和验证,并同时报告灵敏度和特异度。
对患者和公众,一个把肺炎与结核混淆的工具,会让实验室被确诊检测挤满,并延误其他诊断。零样本的承诺——一个无需本地数据、到处可用的模型——在这里并未在结核病上得到证明。
延伸阅读
论文:Beyond Benchmark Scores: Auditing Medical Vision-Language Models for Chest X-Ray Tuberculosis Screening,Mushir Akhtar、M. Tanveer、Mohd. Arshad(Department of Mathematics, Indian Institute of Technology Indore),arXiv:2609.21763(cs.CV),2026 年 9 月 18 日提交,DOI 10.48550/arXiv.2609.21763。预印本,未经同行评审。
数据集:Montgomery 与深圳(National Library of Medicine)、TBX11K、VinDr-CXR v1.0.0(PhysioNet)。关于世卫组织框架:结核病筛查综合指南(2021)。关于另一个与数据来源相关的虚假关联案例:乳腺 X 线摄影中的捷径学习。