报告衍生标签对比重新阅片:在 MIMIC-CXR 的心脏扩大上,一致性几近于零
Yesika Alexandra Agudelo-Londoño 及其同事请放射科医师重新阅读了 MIMIC-CXR 中的 2160 份胸部 X 线检查——这个公开数据库是当今胸部影像 AI 的基石——并把这一阅片结果与数据库自带的标签作了比对,后者是从放射学报告中自动抽取的。就心脏扩大而言,二者的一致性几近于零:Cohen kappa 仅为 0.011,标签只找回了专家确认病例的 1.3%,而绝大多数分歧源自报告中的未提及,而非明确否定。这一结果并非指控文本抽取工具:它表明放射学报告并不是影像上所见内容的清单,把它当成清单,等于让模型去学习一个界定不清的目标。
背景
今天,胸片 AI 研究几乎全部建立在少数几个公开数据库之上:MIMIC-CXR、CheXpert、ChestX-ray14、PadChest。它们共同提供了数以百万计的图像及其病变标签,既用于训练分类器,也用于预训练基础模型(foundation model,可通过微调复用的大型通用模型)和视觉—语言模型。
这些标签几乎从不来自对图像的重新阅读。它们由自然语言处理工具从报告文本中自动抽取——CheXpert labeler 和 NegBio,它们识别某一征象是否被提及,并判断该征象是被肯定、被否定,还是不确定。没有这套流程,任何这种规模的数据库都不会存在。
问题出在工具的上游。放射学报告并非详尽的记录,而是回应开单医生所提问题的临床文书。在急性期住院场景中,放射科医师记录的是本次检查的动因以及发生了变化的部分;一颗十年来一直偏大但稳定的心脏,完全可能只字未提。由此得出的标签,因而既编码了影像的现实,也编码了书写的惯例。这一落差此前已被指出过——VisualCheXbert,以及关于隐性分层的文献——但实践并未改变:数据库标签依然被当作图像层面的金标准。
方法
作者提出了一个名为 Repository Supervision Auditing(RSA,数据库监督信号审计)的框架,其审视对象不是模型,而是监督信号本身,并且在任何训练之前。共四个阶段。
建立图像层面的专家参考标准。取自 MIMIC-CXR 的 2160 份唯一检查(一名患者、一次住院),限定为非移动式后前位胸片,来自未转入重症监护的住院患者。有资质的放射科医师结合报告,使用全部可用投照体位重新阅读了每一份 DICOM 检查,并依据标准化术语体系(RadLex、SNOMED CT、Fleischner Society)进行标注。
审计本身。数据库标签(CheXpert 与 NegBio)按一条刻意宽松的规则二值化:"不确定"计为阳性,"未提及"计为阴性。Cohen kappa 衡量两位评估者之间扣除偶然一致后的一致程度:0 表示"不优于随机",1 表示完全一致。PPA 即标签的灵敏度——在专家看到的病例中,数据库标出了多大比例;NPA 是其特异度,PPV 则是标签的精确率。之所以选心脏扩大作为索引征象,是因为它首先由图像上心影的形态学界定;胸腔积液和肺不张则作为对照。
刻画分歧的来源。每一个假阴性都在文本层面被重新归入三类:报告中的明确否定、被赋予"No Finding"(无异常)标签、或在记录了其他异常的情况下未提及该征象。这一区分是全文的核心:它把文本解读错误与书写惯例分开。
重建队列,然后训练模型。从 14200 份重新标注的检查出发,所有经确认的病例按十项协变量与阴性对照配对。以标准化均数差衡量的最大不平衡由 0.87 降至 0.005。直接在 DICOM 文件上实施的质量控制剔除了非正位、带标注或曝光不良的检查。最终队列为 2072 份检查,1020 例阳性、1052 例阴性,按患者不重叠划分为 1453 / 311 / 308。一个在七个公开数据集上预训练的 DenseNet121,在这些专家标签上被完整微调。决策阈值(0.436)仅在验证集上确定。
结果
数据库标签找不回图像上可见的心脏扩大。Cohen kappa:0.011(95% CI 0.004–0.019),与随机不可区分。在放射科医师看到心脏扩大的 1080 份检查中,数据库标出了 14 份——PPA 为 1.3%。CheXpert、NegBio 及二者的并集给出完全相同的结果。反过来,PPV 达到 0.875:数据库一旦说"心脏扩大",几乎总是对的。因此这个标签极为精确却近乎失明,这是"目标被截断"而非"目标含噪"的典型特征。不过这一缺陷并不均匀:胸腔积液的 kappa 为 0.319(PPA 21.7%),肺不张为 0.120(PPA 7.9%)——更好,但离可接受的一致性仍很远。
分歧来自未提及,而非否定。在 1066 个假阴性中,只有 55 个(5.2%)对应明确的否定。其余 1011 个(94.8%)源自未提及,其中 979 个被归入"No Finding"标签。换句话说:在数据库宣称无异常的 1998 份检查中,专家在 979 份里看到了心脏扩大——接近一半。文本抽取工具尽到了本职;是文本本身没有这条信息。
在经过审计的队列上,一个标准模型是可行的。DenseNet121 在留出测试集上取得 0.853 的 ROC-AUC(95% CI 0.803–0.893)与 0.824 的 PR-AUC,灵敏度 0.862、特异度 0.705。校准中等(Brier 分数 0.162,期望校准误差 0.099),按年龄和性别未见显著差异,Grad-CAM 热力图把注意力集中在心影而非植入设备上。
临床解读。若有 1000 张 X 线片,其心脏扩大比例与本队列相同——约二分之一,远高于真实工作流——模型将在 500 例中标出约 431 例、漏掉 69 例,代价是在 500 份正常检查中产生 148 个假阳性。对照极为悬殊:面对同样这 500 例,数据库标签只会标出六到七例。
好的方面
在建模之前审计监督信号,并把它量化。"报告衍生标签并不完美"这一说法作为泛泛的提醒已流传多年。在这里它变成了一次测量,有置信区间,也有明确的流程。
对分歧的分解为抽取工具洗清了嫌疑。把明确否定、"No Finding"与未提及区分开来,把一个现象变成了一个诊断。94.8% 源自未提及这一结论转移了靶心:改进报告的自然语言处理,对心脏扩大而言解决不了任何问题,因为信息在源头就已缺失。正是这种精确,才让人免于在错误的地方投入十年功夫。
骰子已被做得偏向数据库,它仍然失败。把"不确定"计为阳性,是对数据库标签最有利的规则。
不足之处
范围狭窄,不宜过度解读。一个数据库、一家来源医院、一个被深入审计的索引征象,以及一个被筛选过的人群:非移动式后前位胸片、未转入重症监护的住院患者。专家参考标准涵盖 52 个征象,但只分析了三个。没有任何证据保证,心脏扩大上观察到的崩塌会在书写惯例不同的 CheXpert 或 PadChest 上原样重现——这里的人群偏倚恰恰不利于把这一结论本身推广开来,作者对此也说得很清楚。
模型缺少对照。0.853 的 AUC 悬空而无参照:没有任何以数据库标签训练的模型与之对比。作者的解释是坦诚的——PPA 只有 1.3%,在同一队列里几乎没有阳性样本可供训练这样一个模型——但后果依旧:审计的实际收益是被假定的,而非被证明的。对照缺失是一种比"对照偏弱"更隐蔽的失效模式,同样掣肘。
队列过于干净,审计本身目前也无法核验。这 2072 份检查经过配对、按 50/50 平衡,并在 DICOM 层面做了清洗。为隔离所研究的效应,这在方法上是稳妥的,但它产生的分布已不再像临床工作流——在真实工作流中,低得多的患病率会大幅压低阳性预测值。既没有外部验证也没有前瞻性评估,校准仍属中等,而且没有任何迹象表明专家标注、入选检查清单或代码会被公开——这使得这项审计本身很难被第三方复现。关于利益关系:该工作在 SURA 的影像 AI 计划内完成,多位作者是该机构的雇员或受训人员,一位共同作者受雇于 IBM Research,算力由 Microsoft Azure 提供,未申报外部资助。
它改变了什么
对研究界而言,这是一份重读整片文献的邀请。一个在 MIMIC-CXR 心脏扩大任务上取得 0.9x AUC 的模型,学到的并不是测量心胸比:它学到的是预测放射科医师会不会提到这个征象。两项任务只是部分重叠,而已发表的分数衡量的是后者。这一推论对以图文配对方式预训练的视觉—语言模型影响尤深,因为它们的监督信号正是这些文本——我们曾解读过一项工作,显示在这类模型中文本远远压倒图像。
对临床医生而言,今天什么都没有改变:本文并未评估任何已部署的设备。但它提供了一个可以向任何胸片阅读工具供应商提出的问题——这个模型是在什么金标准上训练的,是报告,还是重新阅片?对于由可见形态学界定的征象,这个答案绝不是技术细节。
对患者和公众而言,教训更为普遍:一个医疗 AI 的表现,受限于它被教去模仿的东西的质量。当一份新闻稿宣称某模型"以 95% 的准确率检出异常"时,真正的问题不是这个数字,而是它是与什么作比较得出的——正如影像数据集中的隐形偏倚一样,我们曾在关于弱势亚组以及关于乳腺 X 线摄影中数据集来源特征的解读中谈到过。
延伸阅读
预印本:Yesika Alexandra Agudelo-Londoño 等,When Repository Labels Are Not Image-Level Truth: A Supervision Auditing Framework for Chest Radiograph AI,arXiv:2608.10084(2026),已被 MICCAI 2026 的 EMERGE 研讨会接收为口头报告。被审计的数据库:MIMIC-CXR-JPG,通过 PhysioNet 的认证访问获取。受到质疑的抽取工具:CheXpert 与 NegBio。