病理基础模型的稳健性:一个"扰动加分布偏移"的评测基准如何揭示它们的脆弱
华威大学的三位研究者,让十二个数字病理基础模型以及两个作为参照的卷积网络,接受十一种贴近临床的图像扰动,并接受一个专为打破训练集与测试集相似性而设计的验证方案。这些大模型比旧网络更耐受,但其稳健性远在十亿参数之前就已见顶,而且一旦面对真正不同的分布,所有模型都会掉精度。一个有用的提醒:临床可靠性将取决于训练数据的质量与多样性,而非模型的大小。
背景
数字病理——即对高分辨率扫描的组织切片进行分析——已成为医学人工智能最活跃的领域之一。近两年来,一类新工具在此占据主导:基础模型(foundation models),这是在海量语料上通过自监督学习预训练的超大型网络(模型无需标签,靠给自己设定预测任务,学会表征数百万张组织图像),随后可复用于大量诊断任务。GigaPath、UNI、Virchow、Phikon:这些模型几乎在所有分类、分割与预后基准上都拉高了分数。
但在一个干净的测试集上取得高分,并不能说明其在真实条件下的可靠性。在病理中,同一种癌症的两张切片可能在染色、扫描仪、实验室流程、患者人群上各不相同。一个稳固的模型必须能抵御这些变化——这就是稳健性的问题——并在部署数据与训练数据不同时仍保持性能——这就是分布外泛化。这份来自华威大学组织图像分析中心(Tissue Image Analytics Centre)团队的预印本,正面提出三个问题:这些模型能否抵御临床上可能出现的图像改动?在不同分布面前能否站得住?以及,对规模的追逐是否还在带来改进,还是已经触及天花板?
方法
作者评测了十二个病理基础模型,从中等规模的 transformer 编码器(Hibou、Phikon-v1/v2、EXAONEPath、UNI,参数量在 8000 万到 3 亿之间),到超过十亿参数的模型(GigaPath、H-Optimus-0/1),再到中间档位(Virchow、Virchow2、UNI2,6 亿到 7 亿)。两个经典卷积网络(ResNet18 与 ResNet50)作为"上一代"的对照。所有编码器都被冻结:不对模型再训练,只在其上加一层线性分类层,并为每项任务训练它(即所谓线性探测(linear probing)技术,用以在不改动表征的前提下检验其质量)。
四个公开数据集充当试验场,全部切成小的图像图块:NCT(结直肠组织,简化为肿瘤/非肿瘤的二分类任务)、PANDA(按 Gleason 评分分级的前列腺活检,简化为癌/良性)、PanNuke(肿瘤细胞核检测)以及 PatchCamelyon(约 33 万张淋巴结图块,判断有无转移)。基线性能以 ROC-AUC 衡量(受试者工作特征曲线下面积:将一个阳性病例正确排在一个阴性病例之上的能力,0.5 = 随机,1.0 = 完美)。
两项别出心裁的设计构成了评测的骨架。其一是一套十一种贴近现实的扰动,由自研工具(REET)生成,分为三类:像素层面(噪声、亮度、JPEG 压缩)、染色层面(色调变化、在组织学颜色空间中的混合)以及几何层面(模糊、旋转、裁剪、缩放)。作者用一个指标——PPI(扰动性能指数)——概括每个模型的耐受度,它随扰动强度上升对 AUC 进行积分:PPI 为 1 = 完美稳健,数值越低 = 退化越重。其二是一个非冗余验证方案(NR-Kfold):不再把图块在训练与测试之间随机分配,而是把在表征空间中相互相似的图像聚成一组,再把整组分配到不同的折。由此强制训练集与测试集之间产生不相似,从而模拟从一家医院、一台扫描仪或一个人群切换到另一处的情形。
结果
在扰动方面,层次分明。像素层面的改动——噪声、亮度、JPEG 压缩——最具破坏性,PPI 约为 0.4 至 0.6。染色变化造成中等损害(PPI 约为 0.6 至 0.75)。几何变换(模糊、旋转、裁剪、缩放)最能被容忍(PPI 约为 0.8 至 1.0),表明这些模型很好地学到了空间不变性。在各模型中,EXAONEPath、Virchow2、UNI2 与 Phikon-v2 始终名列前茅;更小或更旧的基础模型(Hibou、Phikon-v1)以及 ResNet 则落后,尤其在像素或染色的压力下。
核心结果关乎规模。尽管最小与最大模型之间相差三个数量级,参数量与稳健性之间的相关仍然很弱(视数据集而定,系数在 0.15 到 0.55 之间)。从小模型到中等模型确有真实改进,随后在 3 亿到 6 亿参数之上明显饱和:超过十亿参数的模型(H-Optimus、GigaPath)不再带来任何额外收益,有时反而下降。换言之,起作用的是预训练的多样性与质量,而非一味求大。
泛化测试则暴露出一种隐藏的脆弱。一旦用 NR-Kfold 方案打破训练集与测试集的相似性,所有模型都会掉精度:AUC 的下降从 NCT 上的 −0.02 到 PanNuke 上的 −0.23 不等,后一个数字暴露出该数据集惯常的划分曾在训练与测试之间共享了患者与切片——一个数据泄漏的典型案例。大型与中型基础模型(Virchow2、UNI2、H-Optimus)承受得最好,平均损失约 −0.07 的 AUC,且折间波动很小(标准差为 0.09 至 0.12)。更旧的 transformer 与 ResNet 掉得更多(AUC 最多降 −0.36),并变得不稳定(标准差高于 0.15)。这里规模同样帮助有限:参数量与分布外 AUC 之间的整体相关很弱且不显著(系数为 0.22,p = 0.096),平滑后的趋势在 6 亿参数之上甚至略有下降。
做得好的地方
一个系统而开放的评测基准。据作者所知,这是第一项在同一批模型上同时结合扰动稳健性分析与分布外泛化分析的评测。十四个模型、四个数据集、十一种扰动、两套方案,外加一个公开的工具箱(pfm-robustness-toolkit 代码库):这项工作可复现,也可被其他团队直接复用——在一个人人各自在各自划分上报告各自数字的文献中,这一点尤为稀缺。
一个揪出数据泄漏的方案。非冗余验证并非花架子:通过强制训练集与测试集之间的不相似,它揭示出惯常的随机划分高估了性能。PanNuke 上的 −0.23 AUC,正是那种在标准评测中始终隐形的下降,把它显现出来是对该领域的贡献——一种在任何部署之前,廉价地检测模型对自身数据过度乐观的手段。
一个有据可依、反对一味求大的信息。面对主导基础模型领域的"越大越好"反射,作者以数字为凭,表明稳健性在数亿参数附近便已饱和。这是一个有用而反直觉的结论,它把努力方向从对规模的追逐转向预训练数据的多样性——因而也转向一种更省算力的人工智能。
做得欠佳的地方
一项与临床始终保持距离的评测。一切都在孤立的图块上进行,编码器被冻结,其上只加一层线性层。然而,病理诊断是在整张切片上作出的,且往往在对模型微调之后。因此,该基准衡量的是表征的质量,而非一个真正部署的系统的性能。尤其是,NR-Kfold 只是分布偏移的一个合成代理:把在表征空间中相似的图像聚在一起,并不等同于在一家真实的第二医院上测试,那里有它自己的扫描仪与人群。人群偏倚——医学人工智能的首要失败模式——在此仅在试管中被测试。
二分类任务抬高了数字。把 NCT 的九类组织简化为"肿瘤/非肿瘤",或把 PANDA 的 Gleason 评分简化为"癌/良性",抛弃了最有用的临床粒度——正是分级之间的区别在指导前列腺癌的治疗,而不仅仅是有无肿瘤。这些被简化的任务更容易,产出讨喜的 AUC:这已逼近误导性指标。激进的下采样(NCT 上取 10% 训练数据、2.5% 至 10% 测试数据)还削弱了比较的统计功效。
对所测差距缺乏任何临床转译。文章止步于机器学习指标——ROC-AUC、PPI、AUC 下降——却从不说明 0.07 至 0.23 的 AUC 损失,换算成误分类的图块、漏诊的转移、需要复看的切片,究竟意味着什么。缺少在某个工作阈值上的敏感度与特异度,而这才是对临床医生真正有意义的数字。最后,尽管捷径学习——模型抓住染色或扫描仪的伪影而非肿瘤本身——是这些下降的隐含原因,却没有任何归因图来展示模型实际盯住的是什么。
它改变了什么
对研究界而言,其贡献是方法论上的、也是立竿见影的:稳健性评测与不相似性测试应当成为任何基础模型发表前的必经环节,与 AUC 同等重要。NR-Kfold 提供了一个廉价的探针,用以检测数据泄漏与过度乐观。而对规模天花板的证明是一个强烈信号,促使重新分配算力:瞄准数据来源的多样性、多模态与领域对齐,而非仅仅把模型吹大。
对临床医生与实验室而言,这里没有任何可部署之物,却有一句具体的警示。一个在某中心切片上验证过的基础模型,在另一中心的扫描仪与染色上可能损失相当一部分性能——而只要不显式测试分布偏移,这种损失就始终隐形。实用的教训是:在对一个已发表的数字给予哪怕一丁点信任之前,先要求在自己的切片上进行多中心验证。
对患者与公众而言,这一信息与任何医疗人工智能工具无异:在实验室里取得的一个亮眼分数,并不保证在你所在医院的切片上同样可靠。好消息是,这一领域正在为自己配备衡量自身脆弱的工具——而这正是一个值得信赖的数字病理的前提。
延伸阅读
预印本见 arXiv(2607.04401),由 Dhyey Yajnik、Amina Asif 与 Fayyaz Minhas(华威大学组织图像分析中心,英国)于 2026 年 7 月 5 日提交,尚未经过同行评审。工具箱发布于 GitHub(DhLYa/pfm-robustness-toolkit)。关于病理领域的基础模型及其局限,参见我们对GigaPath(本文评测的模型之一)、用于病理基础模型的专家蒸馏以及用探测法评测肿瘤学中的多模态基础模型的解读。
编辑透明度说明:法文版由 Tatakoto 编辑部在阅读预印本后撰写并署名。英文、西班牙文和中文译文在 AI 协助下完成并经审校。