Percival:面向CT的视觉-语言模型,在Penn Medicine BioBank的436,787个容积上做对比学习意味着什么

宾夕法尼亚大学的研究团队训练了Percival模型,让它学会把三维CT扫描与对应的放射科报告配对,训练数据来自Penn Medicine BioBank的436,787个CT容积。与两个不使用文本训练的对比模型相比,它学到的表征能更好地预测诊断和预后,但提升并不均衡:在胸部CT测试的702个诊断中,Percival仅在279个诊断上是四种方法中表现最好的。应把它看作一个有前景的研究模型,其验证几乎完全局限于单一医疗系统。

背景

CT(计算机断层扫描)是由数百万个点组成的三维容积。分析CT的AI模型通常针对单一狭窄任务训练:检测肺结节、分割肝脏、测量冠状动脉钙化。每项任务都需要专家标注,成本高昂。

近年出现的替代思路是构建foundation model(基础模型):一个不针对具体任务、只训练一次的大模型,其内部表征随后可作为许多应用的起点。CT领域此前有两类。"纯视觉"模型(如CT-FM)只从图像中学习;多器官分割模型(如TotalSegmentator)被训练去勾画几十种解剖结构。Percival探索第三条路:把放射科医生已为每次检查写好的报告当作免费的监督信号。这就是CLIP的思路,被迁移到三维医学影像上。

方法

Percival是一个双分支的视觉-语言模型(VLM)。图像分支是vision transformer(ViT),这种架构把图像切成小块,再学习各块之间的关系。这里的小块是16 x 16 x 8体素的立方体(体素即三维容积中的"像素"),输入的CT被标准化为平面352 x 352像素、128层。模型有三种规模:Tiny(600万参数)、Small(2200万)和Base(8600万)。文本分支是CXR-BERT,一个在放射学文本上预训练的语言模型。

训练采用对比学习:对每一批检查,模型要在共同的数学空间中把每份CT与它自己的报告拉近,把不匹配的配对推远。模型从未被告知"去找胰腺癌",它只是借助放射科医生写下的内容,学习区分不同检查。

数据来自Penn Medicine BioBank(PMBB),涵盖该医疗系统的多家医院:训练集为51,966名参与者的436,787个容积,验证集为20,599名参与者的123,603个容积,共72,565名参与者。划分似乎是在参与者层面进行的,这可以减少两个集合之间的数据泄漏。检查涵盖多种解剖部位、增强期相和扫描仪类型。

随后模型被冻结,并通过线性探针评估:只在其表征之上训练一个非常简单的分类器。如果这个分类器表现好,说明有用的信息本来就在表征里。"标签"是phecode,即电子病历中诊断编码的归类:胸部CT为702个,腹盆腔CT为624个。

结果

机器学习指标。在胸部CT上,平均AUC(模型把一个阳性病例排在随机阴性病例之上的概率)在循环系统疾病为0.84,呼吸系统为0.83,肿瘤为0.84,不同诊断之间差异很大(循环系统从0.65到0.98)。几个例子:冠状动脉粥样硬化0.85(TotalSegmentator为0.79),胰腺癌0.91(对比0.84),射血分数保留的心力衰竭0.91。

按诊断计数比平均值更有信息量。在702个胸部phecode中,Percival在555个上优于简单的人口学模型(年龄、性别),在512个上优于CT-FM,在315个上优于TotalSegmentator,约占45%。它在279个诊断上是四种方法中最好的。腹盆腔CT的数字相近:624个中的511个、442个和272个,其中230个诊断排名第一。

在预后方面(Cox模型,用于估计事件随时间发生的风险),平均一致性指数(C指数;0.5为随机,1为按事件发生时间对患者完美排序)在胸部CT为0.68,TotalSegmentator为0.65,CT-FM为0.61,人口学模型为0.61。腹盆腔CT则分别为0.70、0.66、0.63和0.62。

其他分析:表征与诊断之间有1,022个在Bonferroni校正后仍显著的关联(PheWAS,即覆盖全部诊断的分析),以及与39项实验室指标的113个关联在第二个队列中得到重复。相比之下,直接预测实验室数值仍然较弱:64项指标的平均R²为0.04(R²表示被解释的方差比例),最高为白蛋白(0.40)和血红蛋白(0.30)。在外部验证方面,公开数据集CT-RATE(1,564例胸部CT,18个标签)上,作者报告性能与在该领域内训练的模型"相当"。

临床转化。单看AUC为0.84,无法得知假阳性的数量:这取决于该诊断的常见程度和所选阈值。一个纯属示意的例子:对于患病率为1%的疾病,若阈值对应90%的敏感度和90%的特异度,那么每1,000名患者中,会发现10名患者中的9名,漏掉1名,并产生99次误报。本文报告的结果没有给出这类数字,这对表征模型而言属正常,但会限制临床解读。

关于来源的说明:以上数字来自预印本版本(medRxiv,第5版)。2026年9月29日发表在npj Digital Medicine上的正式版本,本次分析未能读取全文,可能存在差异。

做得好的地方

三维影像中少见的规模。超过436,000个CT与其报告配对,涵盖多家医院、多个解剖部位和多种扫描方案,而许多CT模型只用单一类型的几千例检查训练。

评估范围广,并且如实呈现胜负数量。作者测试了702个和624个诊断,而不是挑三种有利的疾病;论文让读者能看到模型并非处处取胜。PheWAS结果做了多重比较校正,实验室关联在第二个队列中的重复(153个中的113个)是一项有用的检验。

具体的开放程度。代码、三种规模的权重、训练流程和下游分类器都已发布在GitHub和Hugging Face上;2026年5月发布了2.0版本。仓库还包含在CT-RATE上的评估,便于用公开数据复现。

做得不够好的地方

人群偏倚与外部验证薄弱。数据来自美国单一医疗系统,报告的唯一外部验证是胸部(1,564例CT),而结果还涉及腹盆腔CT和1,300多个诊断。作者自己也指出,缺少带有实验室数据和纵向诊断的公开队列。详细的人口学构成和排除标准,在我们能查阅的摘录中没有出现。

捷径学习与通过语言产生的泄漏。模型被训练去与放射科医生的文字对齐。作者承认,无法区分哪些来自图像,哪些来自报告所用的措辞。报告多数描述正常检查,且一份报告有时概括同一次就诊的多个容积。此外还有两个风险:索引事件偏倚(检查是因为怀疑有问题才开的,因此临近检查的诊断在一定程度上已经是已知的),以及标签来自病历编码而非经过裁定的诊断。

限制结论范围的对照与指标。对照的是其他范式(纯视觉、分割),而不是其他CT视觉-语言模型;平均预后提升(C指数0.68对TotalSegmentator的0.65)也较为有限。随访时长未说明(在病历最后一次接触时截尾),没有给出风险比,置信区间也很少。最后,代码许可为CC BY-NC 4.0,即非商业用途,未经另行协议不能用于生产环境。资金方面:美国国立卫生研究院(NIH)和Penn Medicine的基金会;有一位作者声明与制药公司有咨询关系。

这带来了什么改变

对研究界而言,Percival为与文本对齐的CT模型提供了一个公开、有文档的起点,附带大规模评估方案和已发布的下游分类器。后续研究需要检验其在其他医院的可迁移性,并把Percival与其他视觉-语言模型作比较。

对临床医生而言,目前没有任何改变:这是一个研究工具,没有前瞻性验证,也没有监管地位。长远看,从因其他原因做的CT中提取风险信号(所谓"机会性"读片)是可能的,但必须证明对患者有益,而不仅仅是AUC。

对患者和公众而言,信息应当审慎:CT包含的信息多于报告所保留的,模型正开始利用这些信息。这些信息能否改善诊疗,还有待逐家医院去证明。

延伸阅读

论文(发表版本):Generalizable CT vision-language modeling for population health and disease risk,Cameron A. Beeche、Joonghyun Kim、Walter R. Witschey等(University of Pennsylvania),npj Digital Medicine,2026年9月29日,DOI 10.1038/s41746-026-03257-2。预印本:medRxiv,第5版。代码与权重:github.com/cams2b/percival(CC BY-NC 4.0)。

关于两种模态之间的对比对齐,另见我们关于恰加斯病中心电图与心脏MRI的解读。关于影像编码器的可靠性,另见我们对CRS-Bench的解读。