肺癌筛查:微调后的 MedGemma 对阵十二位 Lung-RADS 放射科医生——更稳定,但更不敏感
法国公司 Median Technologies(瓦尔博讷)的团队,将谷歌的医学视觉-语言模型 MedGemma 与十二位放射科医生进行了比较:医生们对美国国家肺癌筛查试验(National Lung Screening Trial,NLST)中 481 名患者的 CT 按 Lung-RADS v2022 分类,其中 132 人确诊癌症。直接使用时,模型的 AUC 为 0.70;用另外 7 585 名 NLST 患者微调后升至 0.83,而放射科医生平均为 0.90(因人而异,0.80 至 0.94),但此时模型只检出 63% 的癌症,医生为 85%。论文强调模型相对于人类差异的稳定性;这是一个真实的问题,但稳定的模型也可能稳定地出错,而且这里的一切都局限在一个已有二十年历史的单一数据库之内。
背景
用低剂量 CT 进行肺癌筛查可降低重度吸烟者的死亡率:这是 NLST(美国,2011)和 NELSON(荷兰,2020)两项试验的结论。为了把每次检查转化为决策,美国放射学会(American College of Radiology)制定了 Lung-RADS:这套分级把每次 CT 归入 1 类(无可疑)到 4X 类(高度可疑),每一类对应一种处理方式——一年后复查、六个月后、三个月后,或活检。它减少了假阳性,却没有消除阅片者之间的分歧:两位放射科医生经常把同一个结节归入不同类别,也就是把患者送上不同的诊疗路径。
专用 AI 模型——谷歌 2019 年发表的三维网络、MIT 2023 年的 Sybil——在 NLST 上表现良好。新变化是基础模型(foundation model)的出现:在海量语料上预训练的通用模型,旨在适配多种任务。谷歌 2025 年发布的 MedGemma 是一个视觉-语言模型(读取图像、生成文本),能以连续切片序列的形式处理 CT 容积。论文的问题很简单:这样的模型能否完成 Lung-RADS 分类?微调能带来多少提升?与放射科医生之间的差异相比,它处于什么位置?
方法
数据。481 名患者,来自同一团队此前标注并发布在 The Cancer Imaging Archive 上的 NLST 子集。132 例癌症(27.4%),在 CT 后一年内经活检确诊;349 例非癌症,经至少三年无肿瘤随访确认。因此这是一个富集队列:据作者称,NLST 人群中的癌症比例约为 4%。每名患者一次 CT,薄层(小于 5 mm),来自多家厂商。
阅片者。十二位持证放射科医生,分为低年资(执业不足三年)和高年资,均不知晓真实结果和临床资料。每名患者由三位不同的医生独立阅片,共 1 443 次阅片;每位医生约看 120 例。一个重要细节:没有任何既往影像可供参考,而 Lung-RADS 在很大程度上依赖结节随时间的变化。
原生模型。MedGemma 1.5 的 40 亿参数版本,不做任何再训练(零样本,zero-shot)。CT 被切分为每块 25 张连续切片、步长为 5 的片段。对每个片段,一个"由粗到细"的提示词(coarse-to-fine prompt)先要求整体分析肺部,再描述结节,最后给出 Lung-RADS 类别——类别由模型赋予各类别的概率读出。患者得分取所有片段中的最大值,这一选择有利于灵敏度。
微调模型。同一模型,用 QLoRA 适配:不重新训练全部 40 亿参数,而是把模型压缩为 4 位并冻结,只学习少量附加的小矩阵。训练数据:另外 7 585 名 NLST 患者(393 例癌症),含 21 533 个人工标注的结节。只有包含恶性结节的片段被标为阳性,并用焦点损失(focal loss,一种给难例更高权重的损失函数)来弥补类别不平衡。
评估。放射科医生和模型都在同一个 Lung-RADS 有序量表上给分。作者先计算 AUC(癌症病例得分高于非癌症病例的概率;0.5 为随机,1 为完美),再在使 Youden 指数(灵敏度 + 特异度 − 1)最大的阈值处计算灵敏度和特异度。置信区间由 5 000 次自助重抽样得出。医生之间的一致性用 Fleiss kappa 和组内相关系数(ICC)衡量。
结果
放射科医生之间并不一致。Fleiss kappa 为 0.33,属于"一般"一致;ICC 为 0.68,属于"中等"可靠性。高年资医生之间更一致(kappa 0.38),低年资为 0.24。平均而言,两位阅片者相差不到一个类别。
区分能力。放射科医生:AUC 0.90 [0.88-0.92],最低 0.80,最高 0.94。原生 MedGemma:0.70 [0.64-0.75]。微调 MedGemma:0.83 [0.78-0.87]。在表现最差的那位医生所读的约 120 例上,微调模型为 0.84,医生为 0.80,但区间都很宽(0.76-0.92 与 0.67-0.92):差异并未得到证明。
工作点。在 Youden 阈值下,放射科医生的灵敏度为 85%,特异度为 90%。微调模型:63% 与 91%。原生模型:75% 与 58%。微调主要提升的是特异度。
临床换算。按作者给出的约 4% 患病率,把这些数字套到 1 000 名受检者身上,即 40 例癌症。放射科医生约能发现 34 例、漏掉 6 例,假阳性约 96 人。微调模型能发现 25 例、漏掉 15 例,假阳性约 86 人。原生模型能发现 30 例,但会产生 400 多个假阳性。这一估算偏乐观:阈值是在测试数据本身上选定的。
做得好的地方
真实的人类对照,并展示其离散程度。十二位放射科医生、每名患者三次独立阅片、共 1 443 次阅片,均为盲读,并使用临床实际采用的分级。许多论文只把模型和"一位放射科医生"或平均值比较;这里可以看到人类表现的整个区间,并把模型放进去,这更诚实。
可靠的金标准,并如实报告失败。癌症经活检确诊,非癌症经三年随访确认。作者也明确报告:直接使用的 MedGemma(0.70)达不到临床可用水平。面对"通用模型无需适配即可处处适用"的说法,这是很有价值的信息。
承认局限,代码开放。论文自己点明了队列富集、缺乏外部验证、可能对 NLST 过拟合以及没有消融实验。代码和流程已在 GitHub 公开,标注子集也已存放在 The Cancer Imaging Archive。
做得不够的地方
没有外部验证,且未排除数据泄漏。模型在 NLST 上微调、在 NLST 上测试:同一年代(2000 年代初)、同一批中心、同一批扫描仪。论文没有明确说明 481 名测试患者与 7 585 名训练患者互不重叠,作者自己也写道无法排除过拟合。这正是数据泄漏(data leakage)和人群偏倚的典型场景:在单一数据库内部取得 0.83 的 AUC,并不能说明它在欧洲或亚洲当今的扫描设备上表现如何。
对照组处于劣势,指标偏向有利。放射科医生阅片时没有既往检查,而结节生长是 Lung-RADS 的核心:这是一个有偏的对照,尽管对所有医生都一样。更重要的是,Youden 阈值是在测试数据上优化的,而 27% 的富集患病率让准确率具有误导性。与"表现最差的医生"相比的有利结果,只基于约 120 例且区间大幅重叠:如果把它理解为"相当",就是一种误导性指标。而 63% 的灵敏度与人类的 85% 仍相距甚远。
稳定不等于可靠,而且作者既是运动员又是裁判。模型对相同输入总给出相同答案,是因为温度被设为零:这只是机械的可重复性,而非鲁棒性。论文承认,没有针对提示词、重建方式或扫描仪变化做任何测试。一个稳定地每三例漏掉一例癌症的模型,并不比一位表现有波动的医生更安全。最后,所有作者都隶属于 Median Technologies,该公司开发 eyonis 系列筛查辅助软件;预印本未详细说明资金来源或利益冲突。
这改变了什么
对研究界,论文提供了一个有用的参照:一个 40 亿参数、经轻量微调的视觉-语言基础模型,在结构化筛查任务上仍明显落后于放射科医生,差距主要体现在灵敏度上。把人类差异与性能并列衡量是个好思路,但它要求做对称的实验:在真实扰动下测量模型自身的波动,并与现有专用模型(Sybil、三维网络)比较——这些在分析中都缺席了。
对临床医生,目前没有任何改变。一个在 40 例癌症中会漏掉 15 例、而医生只漏 6 例的工具,既不能独立阅片,也不能充当安全网。所谓"在专业力量不足的地区提供支持"并未得到证明:这需要一项让放射科医生分别在有、无该工具辅助下阅片的研究。
对患者和公众,信息应当谨慎:大型通用医学模型尚不能独立解读肺癌筛查 CT。放射科医生之间的分歧是真实的,也是寻找辅助工具的充分理由;但一个稳定却更不敏感的工具,还不是答案。
延伸阅读
论文:Performance vs Consistency: Evaluating a Foundation Model in Lung-RADS Screening,Benjamin Renoust、Pierre Baudot、Tiffany Foriel、Yousra Haddou、Charles Voyton、Pierre-Henri Siot、Ezequiel Geremia、Danny Francis、Jean-Christophe Brisset、Valérie Bourdès、Sylvain Bodard、Benoit Huet(Median Technologies,瓦尔博讷;其他单位:University of Osaka、AP-HP Necker、Memorial Sloan Kettering、Massachusetts General Hospital、Sorbonne Université),arXiv:2609.22281(cs.CV),2026 年 9 月 13 日提交,MICCAI CAPTION 2026 研讨会,DOI 10.48550/arXiv.2609.22281。预印本,未经同行评审。
代码:EYONIS-AIDS-DS/medgemma-miccai。基础模型:MedGemma(Sellergren 等,2025,arXiv:2507.05201)。分级标准:ACR Lung-RADS v2022。关于低剂量 CT 肺癌筛查,另见我们关于 CT 合成退化与结节影像组学的解读。