医学影像基础模型可以互换吗?对 25 个编码器的受控解剖如何揭示表征"收敛"的真相

一支德国学术团队检验了一个已成常识的观念:随着规模增大,医学图像编码器会收敛到一种共享表征,从而变得可以互换。作者对 25 个开源权重编码器(18 个图像、7 个文本)进行解剖,参数量从 700 万到 270 亿,覆盖五种成像模态和 650,982 张胸部 X 光片,结果表明:收敛确实存在但很有限,其驱动力是自监督训练目标,而非规模或临床监督,并且它无法重现放射科医生判断两个病例相似度的方式。

关于背景

医学影像基础模型(foundation model)本身并不是诊断器:它首先是一个编码器(encoder),一个经过预训练的神经网络,把一张图像——X 光片、CT 切片、病理切片——转换成一串数字向量,即一枚概括其内容的紧凑"指纹"。随后在其上接一个小型分类器来完成具体任务(检测肺炎、结节、骨折)。其吸引力在于:一个训练良好的编码器,只需少量带标注的数据,就能服务于数十种任务。

两年来,医院和厂商像更换可互换的积木一样调换这些编码器——把一个换成另一个,假设它们"看到"的是同一样东西。这种直觉建立在机器学习中一个流行的假说之上,有时被称为柏拉图表征假说(Platonic Representation Hypothesis):随着模型规模变大、训练数据变多,其内部表征会收敛到同一种共享的几何结构。如果这在医学中成立,就能为把两个不同编码器视为等价提供依据。作者强调,问题有两个方面:从未有人在医学影像中妥善验证这种收敛是否真实存在;而测量它的工具——表征相似度度量——是出了名的脆弱,也就是说,同一对模型看起来是非常相近还是相距甚远,取决于所选的度量方法。

关于方法

这项工作是一次受控解剖,而非性能基准测试。作者汇集了 25 个开源权重(open-weight,权重公开、本地运行、因而可复现)编码器:18 个图像编码器和 7 个文本编码器,参数量从 700 万到 270 亿,覆盖五种成像模态。在胸部 X 光方面,实证基础十分庞大:来自六个不同数据集的 650,982 张图像。

研究比较了三类训练目标。自监督(self-supervised learning):模型仅从图像本身学习,无需标签,通过求解内部任务(重建被遮挡的区块、把同一图像的两个视角拉近)来学习。标签监督:模型被训练去预测带标注的诊断。以及图文学习:模型像 CLIP 那样对齐图像和报告。为了不把相关当作因果,作者不止步于比较现有模型:他们自行训练仅在训练目标上不同、而数据、架构和规模完全相同的编码器,然后在一个合成的玩具模型中重现这一效应。这是整套方案中最关键的部分:它把导致收敛的因素隔离出来。

收敛通过一种表征对齐度量来量化(衡量两个编码器在多大程度上把相同的图像组织成相似的邻域),并与一个"随机基线"相比较——即纯粹靠碰运气所能达到的对齐水平。最后是一项临床可用性测试:在某个编码器的表征上训练一个线性分类器(尽可能简单:对指纹各维度的加权组合),然后测量当把它迁移到另一个编码器、以及五家训练中从未见过的医院时,还能保留多少性能。

关于结果

收敛确实存在,但很有限:高于随机基线,仅此而已。更重要的是,产生它的并非人们所以为的东西。是配对的自监督编码器对齐得最好——在胸部 X 光上为 40.4%——远远领先于标签监督模型(21.1%)和图文模型(3.3%)。换言之,训练目标几乎决定了一切,而临床监督(诊断标签)带来的对齐更少,而非更多。

第二个意外:收敛不随规模增长。参数量与对齐度之间的相关性不显著(Spearman 0.302,p = 0.223)。因此更大的模型并不会机械地比小模型更"收敛"——"规模终将统一一切"的论点在此站不住脚。收敛还是模态内的:它并不把图像与临床语言联系起来,而且——这一点至关重要——它无法重现放射科医生判断两个病例是否相似的方式。模型的共享几何结构与专家的相似度判断并不吻合。

然而,有一个结果指向相反方向,为整体图景增添了细微差别:在某个编码器上训练的线性分类器可以迁移到其他编码器以及五家未见过的医院,同时保留约 85% 的"本地"性能。用运营的话来说:把一个决策头从一个编码器或一个中心移到另一个,代价约为 15% 的相对性能。对于筛查工具而言,这并非微不足道——如果"本地"敏感度为 90%,相对下降 15% 会把它拉到约 76%,即每七个被标记为阳性者中就有一个滑入假阴性。可移植性存在,但既不免费也无保证,且需要本地重新验证。

值得肯定之处

因果性方案,而非仅仅描述性。大多数关于"收敛"的工作只是测量现有模型之间的相似度——这把训练目标、数据、架构和规模的影响混在了一起。而在这里,作者训练了在目标上不同、其余全部保持不变的编码器,并在一个受控的合成模型中重现该效应。这种实验纪律支撑了一个因果论断——"是目标产生了对齐"——这是相关性研究无法给出的。

规模与透明。25 个本地运行的开源权重编码器,参数量从 700 万到 270 亿,五种模态,来自六个来源的 650,982 张胸部 X 光片:基础广泛且可复现,选择公开权重也避免了专有 API 的黑箱。该预印本采用开放的 CC BY 4.0 许可。

对度量脆弱性的坦诚。作者的出发点正是表征相似度度量的脆弱——他们没有回避这个问题,而是把它作为工作的核心:他们检验收敛的临床可用性(分类器迁移、与放射科医生判断的比较),而不是止步于一个抽象的对齐数字。把自己的度量拿去接受现实检验,而不是把它当作真理来呈现,正是人们所期待的态度。

值得商榷之处

一个绝对意义仍具误导性的度量。"40.4% 的对齐"没有直接的临床含义:它只是相似度量表上的一个位置,取决于所选的估计方法,而我们并不知道哪个阈值才能使两个编码器"在临床上等价"。即便经过受控,这个误导性度量也不能说明某位患者会被更好还是更差地分类——它只能说明两种几何结构部分相似。风险与它所批评的正相对称:匆忙的读者会把"收敛"读成"已证明可互换",而文章说的恰恰相反。

对临床最重要的一点被断言,却少有实测支撑。作者的结论是,必须"在共享几何结构最薄弱之处、跨患者亚组"进行验证。这是正确的建议,但人群偏倚——在亚人群(年龄、性别、族群、设备、医院)上性能崩塌——并未在工作正文中被详细绘制,正文高度集中于胸部 X 光和以西方为主的公开数据集。研究测量的是一种几何结构和一个平均迁移,从未测量按亚组划分的临床结局,也没有前瞻性验证。

从表征到患者,路还很长。"保留 85%"的迁移是相对于编码器内部性能而言的,并非某个已部署任务上的绝对敏感度或特异度。研究评估的是指纹的一种属性和一个线性探针,而非真实条件下的设备;因此"可与任何编码器协同工作"的互操作性承诺,在临床上和前瞻性上都未得到证明。最后,这是一篇尚未经过同行评审的预印本。

它改变了什么

对研究界而言,这项研究埋葬了一条舒适的捷径:不,规模和临床监督并不会自动让医学编码器收敛到一种共同表征。支配对齐的是预训练目标,而自监督的贡献大于标签。实际后果是:模型之间的互操作性并非规模的馈赠,而是一种需要去设计的属性——通过训练目标——然后要恰恰在共享几何结构最薄弱之处加以验证。顺带一提,这项工作也提醒人们,对于常被当作真理引用的相似度度量,必须保持应有的谨慎。

对临床医生而言,没有可直接部署的东西,但有一个有用的警示:在"引擎盖之下"把一个基础模型换成另一个,并非中性之举。厂商若声称其工具"可与任何编码器协同工作"或"可移植到任何医院",那是一个本研究提醒你要逐个中心、逐个亚组去核实、而非轻信的承诺。正确的问题不是"这些模型会收敛吗?",而是"它们能在我的人群上保持我的敏感度吗?"。

对患者和公众而言,这项研究淡化了那种"所有 AI 都在向之收敛的单一伟大'医学大脑'"的形象。来自不同实验室的模型并非暗地里是同一个,它们内部的相似也不重现放射科医生的判断。具体而言,一件影像工具的安全性不能由它与另一件工具的"亲缘关系"推导出来:它必须在实地、在真正相关的人群上得到证明。

延伸阅读

预印本见 arXiv(2607.20274),由 Soroosh Tayebi Arasteh、Sebastian Ziegelmayer、Mahshad Lotfinia、Lisa Adams、Sven Nebelung、Jakob Nikolas Kather 和 Daniel Truhn(德国放射学与医学信息学的大学团队)于 2026 年 7 月 22 日提交;采用 CC BY 4.0 许可,尚未经过同行评审。关于影像基础模型及其盲区,参见我们的解读:组织病理学基础模型的稳健性与泛化肿瘤学基础模型的多模态探针与置信度,以及医学影像中按亚组隐藏的偏倚

编辑透明度声明:法文版由 Tatakoto 编辑部在阅读预印本后撰写并署名。英文、西班牙文和中文译本借助 AI 协助生成并经过审校。