CRS-Bench:用四个维度而非 AUROC 评价医学图像编码器,105 组两两比较中有 21 组发生反转,但对跨医院迁移的预测反而更差
范德堡大学医学中心(Vanderbilt University Medical Center)的 Xingtao Lin、Hangqi Ren、Caiwan Sun 与 You Chen,在皮肤科、眼科与胸部放射三个领域中,通过 17 575 次严格配对的实验比较了十五类预训练图像编码器,并用四个维度而非单一 AUROC 为每类打分。他们的综合分数 Clinical Reliability Score(CRS)把仅用 AUROC 得到的 105 组两两比较中的 21 组翻转过来,平均绝对位次移动为 1,87 位。但在预测另一家医院上的表现时,这一综合分数(rho = 0,529)反而不如它意在补充的原始 AUROC(rho = 0,864)——而报告这一点的正是作者本人。
关于背景
图像编码器是几乎所有医学影像人工智能系统中看不见的那一半:它把一张皮肤病变照片、一张眼底图或一张胸片转换成几百个数字组成的向量。其后的分类器——说出是黑色素瘤还是不是的那部分——相比之下往往非常简单。而编码器的选择本身已经成为一项独立的建模决策,因为可选项已经分化为三大类。通用型,在网络图像上训练(ResNet-50、ViT-B/16、CLIP、SigLIP、DINOv2、MAE)。广义医学型,在生物医学文献插图或医学图文语料上训练(BiomedCLIP、LLaVA-Med、MedSigLIP、MedGemma)。专科型,只在皮肤(PanDerm)、视网膜(RETFound)或胸部(RAD-DINO、BioViL、CheXzero)图像上训练。
今天人们如何取舍?在绝大多数论文里,只看表格中的一行:干净测试集上的 AUROC。AUROC(ROC 曲线下面积)表示模型给随机抽取的阳性样本打出高于随机阴性样本分数的概率——1,0 为完美,0,5 为纯随机。它是衡量排序能力的好指标,却对临床上重要的三件事视而不见。模型声称的置信度诚实吗?达到这一水平需要多少专家标注?当图像模糊、被压缩,或者来自另一家医院时会怎样?本文正是从这一观察出发,试图把它变成可测量的实验方案。
关于方法
数据。四个公开数据集。CheXpert(191 229 张胸片,14 个标签,多标签)用于放射科;ISIC 2019(25 331 张皮肤镜图像,8 个类别)用于皮肤科;APTOS 2019(3 662 张眼底照片,糖尿病视网膜病变的 5 个有序分级)用于眼科。MIMIC-CXR 作为机构迁移目标:在 CheXpert 上训练的探针不经再训练直接应用于其上;两个数据库共享同样的 14 个标签,但在机构、人群、成像流程与标注方式上均不相同。
实验方案。所有编码器均冻结。特征一次性提取,用训练集统计量标准化,然后在其上拟合带 l2 正则的逻辑回归——这就是所谓的线性探测(linear probing),目的是衡量表示本身的质量,而非优化器的质量。两个对照探针(两层感知机、k = 5 的最近邻)用于验证结论不依赖于分类器。五个共享随机种子,相同的数据划分、相同的标签子采样、相同的扰动种子、相同的超参数预算。总计:17 575 次运行与 3 515 行按种子聚合的指标,覆盖 45 个编码器-数据集组合中的 43 个(BioViL 与 CheXzero 没有 APTOS 单元格,因为其发布接口专用于胸片;缺失值从不插补)。
四个维度。判别力为宏平均 AUROC。校准用 ECE(期望校准误差,15 个分箱)衡量:模型声称的置信度与实际正确率之间的平均差距——ECE 为 0,15 意味着平均而言,当模型说 90 % 时,它大约只有 75 % 的时候是对的。标注效率是用 1 %、5 %、10 %、25 % 标签得到的 AUROC 与全标签 AUROC 之比的平均值;因此它衡量的是保持能力,而非绝对水平。鲁棒性综合了五种扰动(高斯模糊、JPEG 压缩、对比度降低、莱斯噪声、视野裁剪)在三个强度下 AUROC 的平均下降与最差下降,另外对 CheXpert 还加入迁移到 MIMIC-CXR 时观测到的真实下降。
综合分数。CRS 用固定锚点归一化这四个维度,并由三个部分组成:帕累托支配(该编码器在所有维度上同时优于面板中多少个同行)、与理想画像的接近度,以及最差维度上的表现,权重分别为 0,60、0,25 与 0,15。作者说明这些权重是明确的设计参数,而非学习得到的临床效用。一个重要之处:由于锚点固定,新编码器的加入不会改变已经发表的分数。
关于结果
前沿取决于所用指标。按聚合 AUROC,MedGemma 与 MedSigLIP 领先(0,909 与 0,908)。按聚合 CRS,领先的是 PanDerm(0,703)与 MedSigLIP(0,701)——相差 0,002,几乎等于没有差别。在 10 000 次按种子配对的自助重采样中,PanDerm 与 MedSigLIP 位居第一的概率分别为 0,664 与 0,336,其配对差值的 95 % 区间 [-0,097 ; 0,017] 包含零。因此作者拒绝指定唯一赢家,而是称之为一个稳定的领先梯队:PanDerm、MedSigLIP、MedGemma 三者进入前三的概率均为 1,000,其余十二个则恰好为零。
AUROC 与 CRS 之间被量化的分歧。在十五个编码器上,Kendall tau = 0,600,Spearman rho = 0,811,105 组两两选择中有 21 组发生反转,平均绝对位次移动 1,87 位,前三名重合度为 0,667。个别变化很说明问题:CheXzero 从第 11 位升到第 5 位,LLaVA-Med 从第 5 位降到第 11 位,PanDerm 从第 4 位升到第 1 位,DINOv2 从第 6 位降到第 9 位。
校准可以修复,判别力不能。在六项主要测试中,事后重新校准(温度、向量、保序或 Dirichlet 方法,在预留的校准子集上拟合)使 ECE 降低 54 % 至 77 %——绝对下降均值 0,067,95 % 置信区间 [0,024 ; 0,110]——且不改变 AUROC(平均变化约 +0,001)。例如:DINOv2 在 APTOS 上从 0,150 降到 0,034;MedSigLIP 在 APTOS 上从 0,121 降到 0,028。实际含义是:一个排序能力好但概率报得糟糕的编码器并不是坏编码器,只是还没有人给它做过重新校准,而这项工作只需要几百个带标注的病例。
图像质量下降先破坏置信度,再破坏排序。在扰动下,LLaVA-Med 在 APTOS 上的 ECE 平均上升 0,128,峰值达 0,418;在 ISIC 上,MedGemma 与 MedSigLIP 的 ECE 分别上升 0,113 与 0,094,而判别力依然良好。在全部 43 个单元格上,判别力损失与校准损失只是中等程度相关(r = 0,63)。换句话说,一张略微模糊的图像可能几乎不改变患者的排序,却让显示出来的概率明显失真——对于一个会展示百分比的临床决策支持工具而言,这恰恰是最危险的失效模式。
机构迁移。从 CheXpert 迁移到 MIMIC-CXR 且不再训练时,医学预训练编码器保持 0,717 的宏平均 AUROC,而通用型编码器只有 0,540(Welch 检验,p = 0,0029)。0,540 这个数字值得按字面理解:在二分类排序任务上,这已经接近随机。而且仅有医学出身并不足够——LLaVA-Med 跌至 0,504。
两个有用的次要结果。在仅用 1 % 标签时,MedGemma 在 APTOS 上已达到 0,884 的 AUROC;在 ISIC 上,MedSigLIP、MedGemma 与 PanDerm 分别达到 0,819、0,815 与 0,806;在 CheXpert 上,六个医学预训练编码器在 1 % 标签处就追平 ViT-B/16,而 MAE 与 ResNet-50 始终没有追上。此外,在 8 次深度扫描中,中间层有 5 次胜过最后一层:RAD-DINO 在约 50 % 深度处获得 1,3 至 1,6 个 AUROC 百分点,DINOv2 更偏好 75 % 深度。因此,transformer 的最后一个模块并不自动就是最好的临床表示。
做得好的地方
配对做得认真,而这很少见。相同的数据划分、相同的标签子采样、由图像标识符的 SHA-256 哈希生成的扰动种子——从而保证同一张退化图像会送到每一个编码器。相同的探针容量、相同的超参数预算、相同的计算时长上限。大多数已发表的编码器比较在这些方面完全没有配对,其 0,01 的 AUROC 差距与实验方案噪声无法区分。
作者亲手推翻了自己的一个候选指标。他们证明最常用的标注效率度量——学习曲线下面积(AULC)——本质上只是全标签 AUROC 的另一种写法:编码器层面 rho = 0,986,43 个单元格层面 rho = 0,977。而他们采用的相对保持率把这些相关系数降到 0,339 与 -0,342。这是被量化的自我批评,也让公式的选择有了论证而非假定。
参照系不变性是被证明的,而不是被宣称的。在 30 次把三个新编码器插入十二个编码器面板的试验中,按队列重新归一化会使已发表的分数平均移动 0,053,最大移动 0,167;而固定锚点规则给出的移动恰好为零。这正是一份半年后仍可引用的排名与一份每有新模型发布就变动的排名之间的区别。
做得不够好的地方
综合分数的外部效度偏弱——并且不如 AUROC。把 MIMIC-CXR 从 CRS 的计算中移除,再用 CRS 去预测 MIMIC 上的 AUROC,得到 rho = 0,529,而仅用 CheXpert 的 AUROC 则为 0,864。在留一数据集交叉验证中,ISIC / APTOS / CheXpert 的 rho 分别为 0,550 / 0,709 / 0,271,且被留出数据集的冠军在任何一折中都没有被还原出来。作者说得很明确:CRS 是基准层面的比较性摘要,而不是对未知任务 AUROC 的预测器。这很诚实,但也大大限制了人们最想拿它来做的事——为一个不属于这三者中任何一个的项目挑选编码器。
冻结状态下的排名在微调后并不成立,而现实中没有人部署冻结的编码器。使用参数高效微调 LoRA(秩 8,alpha 16,八个训练轮次,三个种子)后,判别力普遍提升(ISIC / APTOS / CheXpert 分别为 +0,026 / +0,030 / +0,010),但顺序改变了:Kendall tau 为 0,829 / 0,667 / 0,448,且三个领域的领先者全部易主(ISIC 与 APTOS 上 MedGemma 让位于 MedSigLIP,CheXpert 上 MedSigLIP 让位于 RAD-DINO)。与冻结状态的 CRS 相比,微调后的四维比较给出 tau = 0,562、平均位次移动 2,0 位,其中 BiomedCLIP 从第 4 位跌至第 13 位。前三名保持不变,而中段完全重排。这里触及的是比较基准偏倚:实验方案衡量的是一种(冻结编码器)并非实际使用的工作状态。
合成扰动既不模拟人群也不模拟病理,且只观测到一次真实迁移。作者自己写道:这些扰动模拟的是采集过程与图像质量,而不是解剖结构、病理或人群的变化。该基准中唯一真实的机构迁移是 CheXpert 到 MIMIC-CXR,即两家美国教学医院——这使得人群偏倚完全未被触及,而这在 ISIC 2019 上尤其关键,其深肤色样本的不足已被记录多年。实验方案中没有任何亚组分析、没有工作点选择、没有人机交互,作者对此予以承认。还应补充两点他们没有提出的保留意见:莱斯噪声是磁共振幅值图像特有的噪声模型,把它施加于皮肤镜、眼底照相与数字 X 线摄影在物理上是可疑的;此外,论文既没有代码仓库链接,也没有资助声明和利益冲突声明,而它所排名的模型中包含由 Google(MedSigLIP、MedGemma)与 Microsoft(BiomedCLIP、RAD-DINO、BioViL)发布的模型。
这带来什么改变
对研究界。最可复用的结果不是排名,而是被量化地证明:AUROC 与多维画像之间的分歧是结构性的而非边缘性的——105 组中有 21 组反转,tau 为 0,600。发布四维画像而不是单一标量,从此站得住脚。而固定锚点的思路——一份不会因每个新模型而重新归一化的排名——值得被其他医学基准借鉴,因为在目前的做法下,新增一个竞争者会改变此前所有模型的分数。
对临床医生与部署团队。有两条立即可行且成本很低的推论。第一,如果一个工具会显示概率,就应当在本地队列上检查并在必要时修复其校准:ECE 下降 54 % 至 77 % 而排序能力不受损失,是本文中投入产出比最高的一步。第二,图像质量下降本身就应当被单独监测,因为它可能在排序几乎不变的情况下让显示的百分比失真——这是任何基于 AUROC 的监控面板都察觉不到的静默失效模式。
对患者与公众。今天没有任何改变:十五个模型中没有一个在此接受了临床条件下的评估,论文中也没有讨论任何模型的监管状态,作者更明确地把前瞻性验证排除在其实验方案之外。本文对公共讨论的贡献更为朴素也更为持久:不说明是在哪个维度上,模型 X 胜过模型 Y 这句话就没有意义;而一个医疗工具所显示的置信度百分比,是一个可以被测量、可能出错、也可以被纠正的量。
延伸阅读
预印本:CRS-Bench: A Reference-Relative Reliability Benchmark for Medical Image Encoders,arXiv:2608.22059,于 2026 年 8 月 22 日提交,采用 CC BY 4.0 许可,投稿至 WACV 2027。所用数据集全部公开:ISIC 2019、APTOS 2019、CheXpert 与 MIMIC-CXR。截至目前,论文中未给出任何代码仓库。