胰腺癌该不该开刀:一个CT+临床数据的多模态模型究竟学会了怎么分诊
巴塞尔大学、阿劳州立医院(Kantonsspital Aarau)和伦敦皇家自由医院的一个团队训练了一个深度学习模型,把增强3D CT与17个临床变量融合,将159名胰腺导管腺癌患者归入NCCN的三个可切除性类别。AUC在内部交叉验证中达到0.86,在阿劳52名患者的独立外部队列上同样为0.86——这在该领域是罕见的外部验证。但参考标准只是一个多学科肿瘤会诊的共识,队列小且全部为瑞士人,也没有任何研究在真实条件下把模型与放射科医生做比较。
关于背景
胰腺导管腺癌(PDAC)是最致命的癌症之一:它占胰腺癌的90%以上,五年生存率低于10%。唯一的治愈手段是完整的手术切除(所谓R0),但符合条件的患者不足20%。决定谁能开刀——即"可切除性"——首先取决于肿瘤与增强CT上可见的胰周大血管之间的关系:肠系膜上动脉(SMA)、肠系膜上静脉(SMV)、门静脉和腹腔干。美国NCCN框架定义了三个类别:直接可切除、临界可切除(borderline)和局部晚期。其中利害重大:临界可切除的患者一般先接受新辅助化疗再手术,而局部晚期者则转向非手术治疗。
问题在于,这一判断的可重复性很差:即便采用标准化标准,关于可切除性的观察者间一致性也常常低于70%。因此才有了把判读自动化的想法。以往的工作要么局限于分割器官,要么仅凭图像预测,而不整合在肿瘤会诊中举足轻重的临床变量(合并症、CA 19-9等肿瘤标志物)。许多方法还要求在推理时提供分割掩码,这使部署更复杂。本文提出了一个端到端框架,把图像与临床背景结合起来,并且一旦训练完成就不再需要掩码。
关于方法
模型的核心是Swin-UNETR:一个编码器-解码器网络,其编码器是一个"移位窗口"transformer——transformer这种架构在处理数据时会对各元素的相对重要性加权——适配于3D,尤其擅长勾画细小的血管结构。训练时,解码器学习一项辅助任务,即分割16个解剖类别(胰腺、肿瘤、门静脉、SMV、SMA、腹腔干、主动脉、腔静脉、肝动脉、扩张的胰管、胆总管……)。这种监督迫使编码器产生"感知血管"的表示。编码器的瓶颈输出一个256维向量。
与此同时,17个常规临床变量(年龄、性别、BMI、Charlson合并症指数、ASA评分、糖尿病、吸烟、饮酒、基线CA 19-9及其变化量与新辅助治疗后的数值、CEA、血糖、HbA1c、胆红素、组织学分级、新辅助状态)经过一个小型多层感知机(MLP),产生一个32维向量。两个向量拼接成288维表示,然后由一个分类头预测三个NCCN类别。训练采用动态多任务目标:分割与分类的相对权重根据肿瘤的Dice(预测分割与真实分割的重叠率)自动调整——先学解剖,再转向决策。对实践而言有一个重要细节:掩码只在训练时使用;在推理时,模型无需分割任何东西即可预测可切除性。CT被重采样到1毫米各向同性、裁剪为160×160×160体素并归一化,编码器则在公开的腹部数据集BTCV上预训练。
主队列包含159名经组织学确诊的PDAC患者,来自巴塞尔大学医院和St. Clara医院(影像来自三家机构):85例直接可切除(53.5%)、47例临界可切除(29.5%)、27例局部晚期(17%)。NCCN标签是在多学科肿瘤会诊中决定的,随后由一名独立医生复核。一个由阿劳州立医院52名患者(28/14/10)组成、从未用于开发的外部队列,用作泛化检验。内部评估采用分层嵌套五折交叉验证:每个外折留出20%数据作为测试,其余用于训练和调参。性能以AUC(ROC曲线下面积:模型正确区分两个类别的概率)、宏F1(三个类别上精确率与召回率的平衡平均)和准确率来衡量。
关于结果
在内部交叉验证中,多模态模型达到0.86的AUC、0.79的宏F1和0.85的准确率。在阿劳外部队列上它依然稳住:AUC 0.86、宏F1 0.81、准确率0.87——跨中心的稳定性不同寻常。辅助分割方面,胰腺的Dice为0.82,肿瘤为0.71,大血管为0.67:并不完美,但足以引导编码器。模型胜过作者重新实现的两个对照:一种基于分割和几何测量的方法(Viviers,内部AUC 0.79)和一个对纹理敏感的transformer(TAT,0.83)。消融实验很有启发:仅图像的模型得0.82,仅临床数据的模型只有0.74,而"knockout"分析(把某一模态替换为其均值)表明信号的绝大部分来自图像(去掉临床为0.83,去掉图像为0.77)。图像承载诊断,临床数据加以细化。
此处的临床解读至关重要,因为这三个类别既非同等容易混淆,混淆的后果也非同等严重。分类别的F1为可切除0.83、临界0.78,但在局部晚期上跌至0.70——这是最罕见的类别(内部27例,外部10例)。而这恰恰是后果最重的边界:错把局部晚期患者判为可切除,可能让他接受无用且有创的手术;反之则可能使他被拒绝一次可能治愈的手术。准确率0.85意味着大约每七名患者中就有一名被误分——这个数字要与本身常低于70%的人类一致性相比较,但它足以禁止任何自主使用。作者还加了一项常识性核查:从预测的分割出发,他们复原出与NCCN定义一致的肿瘤-血管接触角(动脉接触≥180° ↔ 局部晚期),表明模型学到的是一种可信的几何,而非某种捷径。
做得好的地方
一次外部验证,难能可贵。大多数影像AI模型从未在其发源中心之外测试过——而那正是它们崩塌之处。这里,在训练中从未见过的阿劳队列上性能保持不变(AUC 0.86),且嵌套交叉验证设计得当(测试集与超参数调优隔离)。一个值得注意的细节:外部队列的临床数据完整、无需插补,这表明对训练集所做的插补没有引入可检测的偏差。
无掩码推理,为临床而设计。分割在训练时充当教学脚手架,随后即被撤除:最终模型直接从CT预测可切除性,无需人工分割步骤。这正是以往流程一直背负的部署障碍。自适应多任务目标(随着肿瘤Dice提升而从解剖转向决策)是一个简单且经过充分消融的想法。
诚实的对照与消融。作者并不只展示自己最好的数字:他们重新实现了两种竞争方法,测试了仅图像、仅临床,以及每种模态的"knockout"。人们能精确看到信号来自何处(图像),并发现简单拼接的融合已足够——更复杂的交叉注意力机制毫无增益,且在这种队列规模下会破坏训练稳定性。代码公开,CC BY 4.0许可。
做得欠佳的地方
参考标准是人的决定,而非手术结果。这是最深层的局限。NCCN标签是在肿瘤会诊上确定的,并未经手术或病理(实际R0切除)证实。因此模型学到的是复现一个肿瘤会诊会说什么——连同它的偏差,以及作者自己用来立论的那30%观察者间分歧中的相当一部分。一个模仿不完美共识的工具,从构造上就不可能做得比该共识更好;它最多能把共识同质化。这是一种对照有偏的失效模式:参照并非硬事实,而是一个判断。
队列小且地域狭窄。159+52名患者,全部为瑞士人,"局部晚期"这一类别缩减到27例和10例——由此产生较宽的区间和该关键类别上0.70的F1。阿劳的"外部"验证共享同一个国家、同样的指南和相近的设备:其领域偏移很小。没有任何证据表明模型能在另一大洲的扫描仪、其他造影方案或不同人群上稳住。这是一种误导性指标与人群偏倚相叠加的失效模式:在三个不平衡类别上的高宏AUC,抹平了在最要紧的少数类别上的弱点。
没有阅片者研究,没有前瞻性评估。本文没有在标准化条件下把模型与放射科医生或外科医生相比较,没有测量它是否真正减少了观察者间分歧,而且仍是回顾性的。分割掩码是半自动的(由多达五名医生复核),而血管Dice仅为0.67:所谓"感知血管"的表示,恰恰建立在对血管本身不完美的勾画之上。可解释性被推给未来的工作。换言之,这是一个扎实的概念验证,而非一个经过验证可用于决策的工具。
它改变了什么
对研究界而言,本文清晰地证明:把"感知血管"的3D图像与结构化临床变量融合、并做到无掩码推理,是可行的,并能在两家瑞士中心之间泛化。这套配方(辅助解剖监督+自适应多任务加权+简单融合)可复现,代码也开放。下一步必不可少的有两件:在异质扫描仪上做跨大洲验证,尤其是把参考标准锚定到真实的手术与病理结果上,而不仅仅是会诊的裁决。
对临床医生而言,今天的实践没有任何改变。至多,我们瞥见一个未来的、用于标准化可切除性判读的辅助工具——之所以有用,正是因为人类一致性很弱——但首先需要一项前瞻性阅片者研究,证明它能减少错误而不引入新的错误,尤其是在临界/局部晚期这一决定是否手术的边界上。
对患者和公众而言,信息是给热情降温:"AUC 0.86"并不意味着"由AI决定谁开刀"。它意味着一个模型,在一个受限的瑞士人群上,相当好地复现了一组专家的分类——而这组专家自己在大约三分之一的争议病例上会判断错误。是否为胰腺癌开刀,仍然、并将在很长时间内,是一项集体性的人类决定。
延伸阅读
预印本《Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning》(已被MIDL 2026接收)可在 arXiv(10.48550/arXiv.2607.13826)获取,作者为Vincent Ochs、Christoph Kuemmerli、Florentin Bieder、Julia Wolleb、Joël L. Lavanchy、Julia Ruppel、Jan Liechti、Stephanie Taha-Mehlitz、Christian A. Nebiker、Beat Müller、Giuseppe K. Fusai、Joerg-Matthias Pollok、Anas Taha、Philippe C. Cattin和Sebastian Staubli(巴塞尔大学生物医学工程系;Clarunis大学消化健康中心,巴塞尔;阿劳州立医院;伦敦皇家自由医院)。资助:巴塞尔大学青年研究者研究基金、瑞士国家科学基金(P5R5PM 21766)、诺华医学-生物学研究基金会(23C162)、Vontobel基金会;无申报利益冲突。代码以CC BY 4.0许可公开(github.com/vincentochs/pancreas_resectability),数据与权重可应要求提供。关于AI肿瘤学中的分割与多模态融合,参见我们关于前列腺癌PSMA PET/CT的UNETR分割与生存预测、关于肿瘤学中foundation model的多模态融合,以及关于用于肿瘤分类的深度放射组学特征的解读。
编辑透明度:法文版由Tatakoto编辑部在阅读预印本后撰写并署名。各项指标(内部与外部AUC均为0.86,宏F1为0.79/0.81,局部晚期类别F1为0.70)为作者在159例和52例队列上报告的数值。英文、西班牙文和中文译本在人工智能协助下生成并经过校对。