让同一个模型在 CT 与 MRI 上通吃胰腺分割:对抗式模态对齐展示了什么,又始终没有测量什么

西北大学放射科的团队,联合西北大学与梅奥诊所佛罗里达院区的两位消化科医师,用 4 604 例混合的 CT 与 MRI 训练了一个单一网络来分割胰腺,并给模型加了一条明确约束:不许再分辨出图像来自哪一种模态。内部测试的重叠度达到 87.31%,在四个外部数据集上保持在 84.20% 至 88.09% 之间;由此学到的表征,还能在从未见过任何 CT 亚区标注的前提下,把 CT 上的胰腺划分为头、体、尾。问题出在别处:论文的两张结果表里只有所提方法本身,没有任何数值对照,没有标准差,没有统计检验——而被作者视为最值得注意的那项结果,只建立在十七例由一位阅片者标注的扫描之上。

关于背景

胰腺是分割算法最容易失手的腹部器官。它位于腹膜后,也就是紧贴腹腔后壁、藏在胃的后方;其形态与位置在不同人之间差异很大;与十二指肠、脾脏及周围血管之间的对比度又很低。这里所说的分割,是指给体积扫描中的每一个体素(三维空间中的"像素")打上"胰腺"或"非胰腺"的标签。它是其余一切工作的基础构件:测量体积、随访囊肿、放疗前勾画轮廓、提取纹理特征。

临床上有两种模态并存。CT 仍是胰腺肿瘤学的参考标准。MRI 在囊性病变(尤其是导管内乳头状黏液性肿瘤,IPMN)的随访中份额不断上升,因为它没有辐射,而这类检查往往要连做很多年。两种图像在强度层面毫无共同点:CT 中一个体素的数值是物理上可重复的亨氏单位;MRI 中则取决于序列、机器与参数设置,没有绝对单位。

通常的做法是做两个模型,一种模态一个。这在标注上代价高昂,而且学不到任何关于解剖结构的共同知识。把两个数据集简单混在一起训练,通常反而会掉点:网络转而去利用各模态特有的强度签名,而不是器官的形状——这是捷径学习(shortcut learning)的教科书式案例,即模型抓住了与答案相关的旁路线索,而非真正要找的结构。域适应文献早就提供了解法:Ganin 等人提出的对抗式域训练,经 Kamnitsas 在脑病灶上引入医学影像,再由 SIFA 用于 CT–MRI 迁移。作者还把 PaNSegNet 称为当前胰腺 MRI 分割的最先进方法。请记住这个名字:它不会再出现。

关于方法

一个共享编码器、一个判别器,以及一层会翻转梯度的结构。骨架是标准的 3D nnU-Net——到 2026 年,这仍是医学分割中难以撼动的编码器-解码器参考架构。编码器把体积压缩成抽象表征,解码器再把它展开成掩膜。这里两种模态共用同一套编码器-解码器,分割损失由 Dice 损失与交叉熵组合而成。

真正的贡献接在网络的瓶颈处,也就是表征最紧凑的位置。作者在那里加了一个小分类器,即域判别器,任务只有一个:猜这张图是 CT 还是 MRI。在编码器与该判别器之间,插入一层梯度反转层——前向传播时信息原样通过,反向传播时把梯度的符号翻转。结果是:判别器学着区分模态,而编码器被推着去让它失败。达到平衡时,表征中就不再携带模态签名。总损失用系数 lambda 对两个目标加权,lambda 从 0 起步并逐步升到 0.5;这条上升曲线的具体安排,作者自己称之为"凭经验设计"。

训练细节。分两阶段:先用混合的 CT 与 MRI 做 2 000 轮纯分割训练,再加入判别器做 1 000 轮。patch 大小 80 × 160 × 192 体素,Adam 优化器、初始学习率 0.001,z-score 归一化,滑窗推理,硬件为八卡 A6000 服务器。参数量、判别器结构、批大小以及数据增强细节均未报告。

亚区迁移。这是论文的后半部分,思路很干净。编码器训练完成后将其冻结,再接上一个新的解码器,训练它把胰腺切分为头、体、尾——但只用 MRI 的标注,即 Cyst-X 数据集的标注,四个训练集中只有它提供这种划分。然后把整套模型用到 CT 上。如果编码器真的对模态无感,那么在 MRI 上训练的解码器就应该能在 CT 上工作。论文没有给出三个亚区的任何可操作解剖学定义——既无切分平面,也无诸如肠系膜上静脉之类的血管标志。

数据。分布内共 4 604 例:Cyst-X 的 1 461 例 MRI、一个未作任何描述的私有数据集的 1 888 例 MRI、AbdomenCT-1K 的 1 000 例 CT,以及"胰周水肿"数据集的 255 例 CT。涉及三种 MRI 序列——T1、T2 与反相位——但没有给出数量分布。整体按 8:1:1 划分为训练、验证与测试,而正文从未说明这一划分是按患者还是按扫描进行。此外还有 440 例被声明为分布外的数据:AMOS 的 MRI(60)与 CT(300)、U-Mamba 的 MRI(50)、BTCV 的 CT(30)。没有任何人口学信息,没有纳入或排除标准,尽管宣称"多中心"却没有中心名单,占语料 41% 的那个私有数据集更是只字未提。

关于结果

全胰腺。内部测试集上,总体 Dice 为 87.31%,HD95 为 5.23 毫米,ASSD 为 0.94 毫米,IoU 为 78.42%。分组来看:T1 为 85.59,T2 为 88.27,反相位为 89.76,CT 为 87.53。四个外部数据集上:AMOS-CT 为 84.20,BTCV-CT 为 84.58,AMOS-MRI 为 86.87,U-Mamba-MRI 为 88.09。Dice 衡量预测掩膜与参考掩膜的重叠程度;HD95 则以毫米为单位衡量第 95 百分位的轮廓误差,也就是剔除极端离群点后,最错的那些点离得有多远。两者说的不是一回事,而这篇论文正好提供了一个漂亮的例子:反相位序列拥有整个测试集中最高的 Dice(89.76),却有最差的 HD95(8.47 毫米,接近 T2 的 2.92 毫米的三倍)。体积重叠很好,但局部轮廓错得很远——典型情形是在离器官很远处把邻近结构的一块也圈了进来。

亚区。MRI 上平均 80.53%:头 85.19,体 80.23,尾 76.18。CT 上在训练时未见过任何亚区标注的情况下,平均 83.05%:头 82.29,体 83.26,尾 83.61。这是作者认为最值得注意的结果,而它建立在十七例扫描之上——AMOS 7 例、BTCV 10 例——由一位放射科专家临时手工标注,没有第二位阅片者,也没有任何观察者间一致性指标。

表格里没有的东西。全文任何位置都没有标准差、没有置信区间、没有统计检验。更关键的是:没有任何对照行。没有去掉判别器的 nnU-Net,没有 lambda 取零的版本,没有单模态训练的模型,也没有 PaNSegNet。表 II 与表 III 只包含所提方法本身。

临床换算。胰尾 76% 的 Dice 意味着所勾画体积中约有四分之一与参考不一致。用于糖尿病研究中的腺体体积测量,这可以接受;但若要划定那条把胰十二指肠切除术与胰体尾切除术的手术指征区分开来的体-尾界线,这离手术切缘的要求还差得很远。论文本身也没有作此主张:它没有任何临床终点,没有让临床医生评估轮廓是否可用,也没有测量修正轮廓所需的时间。

做得好的地方

规模与异质性是真实的。内部 4 604 例、外部 440 例,两种模态,三种 MRI 序列,四个有名有姓且公开可得的外部数据集。胰腺分割领域的许多工作至今仍只用单中心的几百例 CT。这里"多中心"的说法没有文献支撑,但数据量与序列多样性无可争议。

亚区迁移的检验在设计上是诚实的。作者本可以只放一张定性图,展示 CT 上漂亮的轮廓就收工。他们却去让人手工标注了十七个体积,以便给出一个数字。样本极小,但方法学上的用意是对的:既然声称迁移成功,就该到目标模态里去实测。

距离类指标与 Dice 并列公布,且做了拆分。HD95、ASSD 与 IoU 都按序列、按数据集逐项列出,而不只给一个汇总值。正因如此,上面那个反相位的异常才看得见。公布那些部分与自身叙事相抵触的数字是一种美德,哪怕正文并未就此展开。

做得不够好的地方

核心贡献从未被测量。这是最主要的弱点,而且是结构性的。论文主张对抗式对齐带来了与模态无关的表征,而这正是性能的来源。但唯一给出的证据是一张 t-SNE 投影图——潜空间的二维可视化——作者自己也承认它是"定性的"。消融实验确实存在,却只针对下游微调环节,数值仅存在于一张图中,而且措辞本身已是一种让步:预训练模型"优于或可比于"一条正文从未定义过的基线。"可比于"不是一个结果。这属于对照方法缺席,而非对照方法偏弱,是同一缺陷更彻底的一种形态。PaNSegNet 在前几段里刚被称为最先进方法,却是同一实验室、使用大幅重叠数据的工作:它缺席结果表,除了"决定不做这个对比"之外很难有别的解释。

数据泄漏的风险没有被排除。8:1:1 的划分被宣布时,只字未提是否按患者分层。而 Cyst-X 为同一批患者提供了 T1、T2 与反相位,结果表恰恰是按序列报告性能的。若按扫描随机抽取,同一位患者的 T1 会落入训练集、T2 会落入测试集——相同的解剖、相同的囊肿、相同的腺体形态。这是医疗人工智能文献中最普通的失效模式,也是一旦被正确控制、已发表分数就会应声下跌的那一种;同时它也是一句话就能澄清的问题。那句话不在那里。一个相邻的疑问笼罩着 AMOS-CT 与 BTCV 的"分布外"身份:训练中使用的 AbdomenCT-1K,按其构成本就是多个公开腹部 CT 数据集的聚合,而论文没有描述任何去重流程。同样的数据集来源签名机制,在乳腺 X 线摄影中已有记录。

最亮眼的结果比较的是两种人群,而不是两种模态。在亚区任务上 CT 竟然优于 MRI——83.05 对 80.53——尽管它从未见过任何亚区标注。作者对这一反转未置一词。一个简单的解释是现成的,却没有被讨论:MRI 测试集来自 Cyst-X,这是一个为研究囊性病变而建立的队列,也就是病理性的、形态已变形的胰腺;CT 测试集则来自 AMOS 与 BTCV,是以大体正常的腹部器官分割为主的数据集。因此这一差距衡量的既是模型能力,也是病例难度:这是人群偏倚叠加误导性指标。同样的批评适用于摘要中突出的 87.31%:它把 3 349 例 MRI 与 1 255 例 CT 不加显式加权地合并,因此主要反映的是 MRI 上的表现。再加上队列特征的完全缺失——没有年龄、没有性别、没有疾病状态,关于那 1 888 例私有 MRI 更是一无所知——任何亚组分析都无从谈起,包括借助代理变量的做法。

这意味着什么

对研究界而言,这个想法值得接续下去,与它在本文中的论证方式无关。一个对模态无感的编码器是可复用的部件:它能把某一模态中已有的标注存量,转化为另一模态中可用的监督信号,而在 CT 上标注胰腺亚区,正是那种没人愿意做第二遍的活。但本文没有回答的问题,恰恰是决定它能否被采用的唯一问题:对抗式对齐究竟带来了什么,是一个直接在混合模态上训练的 nnU-Net 所不能提供的?表 II 里多加一行就能解决。只要这一行还缺着,读者就无法把方法的效果与 4 604 例数据本身的效果区分开。

对临床医生而言,今天没有任何改变。代码与权重宣称"录用后公开",也就是目前无法获取;预印本本身采用 CC BY-NC-ND 许可,禁止演绎作品与商业使用。没有前瞻性验证,没有放射科医师对所生成轮廓的阅片评估,也没有测量修正这些轮廓需要多长时间。真正的根本问题——自动轮廓是否好到能让操作者省时间而不是费时间——并未被提出,尽管这才是采纳与否的真实标准,而且我们知道该怎么测,正如其他关于操作者工作负荷的研究所做的那样。

对患者与公众而言,有一个有用的区分:分割不等于诊断。87% 的 Dice 并不意味着"87% 的诊断正确",它只意味着机器画出的轮廓与人画出的轮廓有 87% 的重叠。这是管道工程,不可或缺却不可见,位于其余一切工作的上游。对一位因胰腺囊肿而接受随访的患者来说,真正有意思的问题不是模型的 Dice,而是今年在另一台机器上测得的体积能否与去年的相比——这是一个可重复性问题,本文让它显得可信,却没有去测量它。

延伸阅读

预印本:Unified CT and MRI Pancreas Segmentation for Label-Efficient Cross-Modality Subregion Transfer,arXiv:2609.13043,2026 年 9 月 11 日以 cs.CV 类别提交,DOI 10.48550/arXiv.2609.13043,采用 CC BY-NC-ND 4.0 许可。作者:Ziliang Hong、Hongyi Pan、Halil Ertugrul Aktas、Andrea Bejar、Elif Keles、Frank H. Miller、Michael B. Wallace、Rajesh N. Keswani、Gorkem Durak 与 Ulas Bagci,来自西北大学放射科,以及西北大学与梅奥诊所佛罗里达院区的消化内科与肝病科。

代码与权重:宣称"录用后公开",因此目前无法获取;未给出任何代码仓库地址。所用公开数据集:AbdomenCT-1K、AMOS、BTCV、U-Mamba。Cyst-X 与"胰周水肿"数据集的获取方式在本稿中未作说明,1 888 例私有 MRI 不予共享。正文中没有任何关于伦理委员会审批的说明。

已声明的资助:美国国立卫生研究院项目 U01-CA268808 与 NHLBI R01-HL171376。稿件中没有利益冲突声明,尽管其中两位作者是在职的临床消化科医师。

同一领域内,作者引用的先行工作:Ganin 等人的 DANN(梯度反转)、Chen 等人的 SIFA(CT–MRI 适配)、Isensee 等人的 nnU-Net(骨干架构),以及同一团队的 PaNSegNet(胰腺 MRI 的最先进方法)。