AI 生成的薄层 CT:用真实配对而非模拟厚层训练,会改变方法排名

来自沈阳东北大学、美国国家癌症研究所以及三家中国医院的团队发布了 MSS-CT:一个包含 2000 例胸部 CT 的数据集,其中厚层序列与 1 毫米序列由同一份原始投影数据重建而成;同时发布参考模型 BasicCSS,用于合成缺失的薄层图像。真正重要的结论不是 BasicCSS 排名第一,而是用模拟厚层训练这类模型——这是该领域的主流做法——会让所有受测方法性能下降,甚至使它们的排名发生倒置。但验证止步于图像相似度、自动测量的一致性以及两位未设盲的放射科医师:没有测量任何诊断学终点。

背景

CT 并不直接产生图像:它记录原始投影数据,随后按照选定参数——层厚、层间距、重建卷积核——重建为一叠断层图像。层厚决定了头脚方向上的分辨率。1 毫米序列对体积采样细密;5 毫米序列每个体素聚合的组织量多五倍,因而受到部分容积效应的影响:当同一体素同时混入血管、空气和支气管壁时,对比度被抹平,细小结构变得模糊。

那为什么还保留厚层?因为在相同剂量下薄层噪声更大,存储与传输量增加约五倍,而且许多科室——筛查场景、值班场景、预算受限的医疗系统——只归档厚层序列。于是,想测量结节或评估支气管壁的放射科医师,手头恰恰没有所需的那一套序列。

传统做法是插值:把 5 毫米序列重采样到 1 毫米间距。这只是统一了几何采样,并不能恢复任何信息——信息是在重建阶段丢失的,而不是在显示阶段。由此产生了基于深度学习的CT 层间合成(CT slice synthesis,CSS):让模型从厚层输入推断出合理的中间层。

这篇论文针对的方法学问题在别处。训练这样的模型需要同一患者的(厚层、薄层)配对数据。由于这类数据稀缺,文献中普遍制造伪配对:取一套真实薄层序列,人为退化以模仿厚层。问题是,真实的 5 毫米层并不等于模糊化的薄层:它来自重建域中的信号聚合,带有厂商特定的卷积核与成像特性。用仿造数据训练、在真实数据上部署,与我们此前在低剂量 CT 合成退化一文中讨论的落差如出一辙。

方法

数据集。MSS-CT 共 2000 名受试者,分为两个子集。MSS-CT 3 mm:宁夏医科大学总医院的 500 例 3 毫米 / 1 毫米配对检查,采集时间为 2023 年 11 月至 2024 年 12 月,飞利浦设备,年龄中位数 64.5 岁(四分位间距 52.0—71.0),男性占 45.6%,临床状态未记录;划分为 350 / 50 / 100。MSS-CT 5 mm:沈阳医学院附属第二医院的 1500 例 5 毫米 / 1 毫米配对检查,2023 年 3 月至 2025 年 6 月,东软设备,年龄中位数 34.0 岁(24.0—61.0),男性占 57.7%,其中健康受试者 1000 例、异常 500 例;按健康状态分层划分为 1050 / 150 / 300。关键之处在于:两种情形下,两套序列均来自同一份原始投影数据,因此无需配准,并保证了体素级对齐。

外部验证。两个独立数据集,仅用于 5 毫米到 1 毫米任务:RPLHR-CT,公开数据集,250 名受试者(飞利浦);EC-CT,来自中国人民解放军总医院的机构数据集,300 名受试者(飞利浦,年龄中位数 25.0 岁,健康 200 例 / 异常 100 例)。在 MSS-CT 5 mm 上训练的模型在这两个数据集上未经微调直接测试。

模型。BasicCSS 依次包含体积编码器、沿轴向把特征扩展到目标分辨率的层扩展模块、在相邻两个厚层之间逐段局部细化的分块解码器、通过多参考注意力校正矢状与冠状方向连续性的跨视图细化模块,以及重建输出头。基础模块结合卷积与 Swin-Transformer 层——一种以滑动窗口计算注意力的 transformer,在三维体数据上比全局注意力代价更低。训练设置简单且已完整公开:CT 值截断至 [−1024, 2048] 亨氏单位后归一化,以真实 1 毫米序列为目标的 L1 损失,AdamW 优化器、学习率 10⁻⁴、批大小 1、8 × 128 × 128 体素的图像块,在 NVIDIA RTX A6000 显卡上训练。

对照方法。覆盖层间合成三大范式(重排视图超分辨率、体积超分辨率、逐层插值)的 16 种方法,另加若干经改造用于本任务的自然图像超分辨率与视频插帧模型,以及作为传统基线的三线性插值。正文重点讨论三个代表:ACVTT、ResVox 与 CTHNet。作者说明已尽量把各模型的参数量控制在可比范围内。

四条评估轴。(1)图像保真度,用 PSNR(峰值信噪比,单位分贝,衡量与参考图像的逐像素偏差)和 SSIM(结构相似性指数,在轴位、冠状位、矢状位分别计算)。(2)训练配对方式的影响:真实配对对比两种伪配对(薄层抽样、轴向退化)。(3)下游一致性:用 TotalSegmentator v2.11 自动分割十个胸部结构(心脏、主动脉、肺血管、气管、T3 与 T7 椎体、双侧第五与第七肋骨),以真实 1 毫米序列的分割为参考,用 Dice 系数比较;以及影像组学一致性,在随机抽取的肺部感兴趣区上用一致性相关系数(CCC)衡量。(4)阅片者研究。

结果

图像保真度。BasicCSS 在两项任务、内部与外部测试、三个平面上均取得最优 PSNR 与 SSIM,所有配对比较均具统计学意义(双侧 Wilcoxon 检验并经 Bonferroni 校正,p < 0.001)。在 5 毫米到 1 毫米任务上,BasicCSS 达到 44.09 ± 1.43 dB,其余合成方法为 42.11 至 43.48 dB。与最强对照 CTHNet 的差距,在 3 毫米任务上为 0.29 dB,在 5 毫米任务上为 0.61 dB——按量级换算约相当于均方根误差降低 7%。在 3 毫米任务上,三线性插值仅为 37.97 ± 0.93 dB,SSIM 为 0.967 / 0.964 / 0.963。有一点论文未明确提示:PSNR 的绝对值不可跨子集比较,因为设备厂商、扫描协议与人群均不相同;只有同一数据集内部的比较才有意义。

核心结论:伪配对会误导。在受测的六种方法、两项任务上,真实配对训练的 PSNR 均高于两种伪配对设置,且在 5 毫米任务上差距更大。轴向退化优于简单的层抽样,但两者都低于真实配对。更关键的是,排名发生了倒置:伪配对条件下 ACVTT 居首,真实配对条件下则是 BasicCSS。换言之,基于模拟数据得出的方法排名,可能与临床条件下的胜出者并不相同——这在回溯意义上削弱了已发表的一部分比较结论。

下游一致性。在四个数据集、十个结构上,来自合成薄层的分割结果都比来自插值的结果更接近参考(各处 p < 0.01),且在 5 毫米任务上增益更明显。受插值影响最大的结构是肺血管、气管和骨性结构。影像组学方面,从合成薄层提取的特征与真实 1 毫米序列特征的一致性,优于厚层原图和插值图像,可重复性阈值设定为 CCC ≥ 0.85。增益在 LoG 特征(高斯拉普拉斯滤波,对密度过渡敏感)上明显,在小波特征上较弱——后者对重建差异仍最为敏感。一个值得注意的细节:插值图像的平均 CCC 低于原始厚层,却更常越过 0.85 阈值——说明它是把特征推向了不一致的方向,而非真正改善了它们。

阅片者研究。随机选取 60 例 EC-CT 检查(健康 30 例、肺炎 30 例),由两位分别具有 10 年与 3 年经验的放射科医师独立阅片,原始 5 毫米序列与合成 1 毫米序列并排显示,不提供真实 1 毫米序列。在 120 次评分中,两位阅片者在 100% 的病例中都认为存在"新增信息",有用性平均分 4.83 / 5,对诊断信心的支持度平均分 4.69 / 5。没有任何一项评分低于 4 分。

临床转化。这部分很短,而这正是要点所在。对于 1000 例以 5 毫米重建的胸部 CT,本研究无法说明会多检出多少结节、多少直径测量会改变 Fleischner 分类、又会产生多少假阳性。这些终点一个都没有测量。论文确立的是:由合成序列得到的自动测量结果,比插值结果更接近真实薄层序列的测量结果——这是一种一致性属性,而不是诊断性能。不过有一条工程性结论值得记下:在 8 GB 显存的 NVIDIA Quadro RTX 4000 上,合成一整个体积耗时不到一分钟,这是影像科已有的硬件水平。

做得好的地方

数据集才是真正的贡献,而且已经公开。2000 例检查、两套序列源自同一份原始投影、覆盖两种合成倍率与两家设备厂商——这正是该领域此前所缺的。作者以去标识化 NIfTI 体数据的形式在 GitHub 上发布了 MSS-CT 与 BasicCSS 代码,并附上所用的数据划分。此前的资源 RPLHR-CT 仅有单一倍率;本文把它作为外部数据集使用,这是正确的用法。

关于伪配对的实验是一个构造严谨的阴性结果。六种方法、三种训练方式,其余全部固定——相同划分、相同架构、相同损失函数、相同优化器、相同训练计划——且评估始终在真实条件下进行。排名倒置不是花絮:它证明了一种广泛采用的评估流程所得的结论,无法在接触真实数据后继续成立。本可以只宣布一个新的最优结果,作者却选择公布这一点,值得肯定。

评估没有止步于 PSNR。另有三层:十个结构、四个数据集上的自动分割;带有事先声明可重复性阈值的影像组学;以及人工阅片。外部中心适配分析——先在 MSS-CT 上预训练、再在外部中心微调,优于在本地从零训练——回答了一个真实存在的实务问题。作者还主动指出,BasicCSS 在 RPLHR-CT 上未经微调即可达到与该数据集原始模型相当的水平,并未据此宣称优越性。

做得不够的地方

所有指标都没有检验生成图像最令人担心的问题——指标具有误导性。心脏、主动脉或肋骨上的 PSNR、SSIM 与 Dice,衡量的是大结构的平均保真度。生成模型特有的风险在别处:因为某个小病灶"不太可能"而把它抹去,或凭空生成一个看似合理的病灶。本研究的方案中没有任何病灶层面的终点——影像组学的感兴趣区是在肺内随机抽取,而非以结节为中心——作者也承认,受评估的最细小管状结构肺血管仍未被完整恢复。这正是我们在FLAIR 超分辨率:抹除还是幻觉出小病灶一文中提出的问题,在这里依然悬而未决。

队列偏年轻、以健康人为主,而薄层最需要用于年长患者——人群偏倚。支撑全部外部验证的 MSS-CT 5 mm 子集,年龄中位数为 34 岁,三分之二为健康受试者;EC-CT 的年龄中位数更是只有 25 岁。然而薄层 CT 的首要适应证,是在五十岁以上人群中刻画结节、肺气肿或间质性肺病。唯一年龄相符的子集 MSS-CT 3 mm(中位数 64.5 岁),恰恰没有记录临床状态,也完全没有外部验证。所有中心均在中国,仅涉及两家设备厂商;作者亦指出 RPLHR-CT 的元数据——剂量、重建卷积核、采集参数——缺失,使他们无法解释外部数据集之间的性能差异。

阅片者研究的设计使其不可能失败——对照有偏,且存在产业利益冲突。仅两位阅片者,其中一位经验只有三年;没有插值对照;没有诊断性能终点;最关键的是,阅片者知道哪一套序列是合成的。结果可想而知:100% 认为有新增信息,120 次评分中没有一项低于 4 分——这是一种不具区分力的天花板效应。作者在局限性中如实写明了这一点,值得肯定,但最终流传的仍会是"4.83 / 5"这个数字。此外,13 位作者中有 3 位与商业影像软件厂商推想医疗(Infervision Medical Technology)相关——1 位实习生、2 位雇员——利益冲突虽已申报,但对于一项其自然衍生物就是可售功能的研究而言,这一点仍然重要。

这意味着什么

对研究界而言,可操作的信息很直接:在模拟厚层上得到的合成方法排名,不能被视为在真实条件下同样成立,因为胜出者会变。该子领域的审稿人如今有了一个公开数据集,可以据此要求真实配对评估;同样的逻辑适用于任何"退化输入是人为制造而非实际观测"的任务。本文留下的开放问题应当成为下一步:构建一个富含标注小病灶的测试集,不再衡量平均相似度,而是衡量抹除率与幻觉率。

对临床医师而言,今天的实践没有任何改变,作者也未作此主张:他们说的是一个与原始厚层序列并排显示的辅助视图,而非替代真实薄层序列。这个措辞是恰当的,也必须守住。可供借鉴的阅读框架是:面对"AI 生成薄层"的宣传,两个问题就够了——模型是否用同一原始数据重建出的真实配对训练?除了图像相似度之外是否测量了别的东西?如果第二个问题的答案是否定的,那么诊断性能是"未知",而不是"良好"。

对患者与公众而言,有一个简单的区分值得记住。由投影数据重建出的 CT 图像是一次测量。由模型从厚层生成的薄层则是一次推断:所显示的细节,是模型依据既往学习判断为最可能的样子,而不是在这位患者身上观察到的事实。它可以帮助只有厚层序列可看的放射科医师,但这并不意味着那些细节是真实的——正因如此,这类图像必须与原图并排阅读,绝不能取而代之。

延伸阅读

论文:Benchmarking AI-generated thin-slice CT under clinical reconstruction conditions: a multicohort study,作者 Pengxin Yu、Haoyue Zhang、Xiaoyan Yang、Chenghao Piao、Shuiqing Zhao、Mei Xie、Xuwen Cheng、Dawei Wang、Wei Qian、Stephanie Harmon、Baris Turkbey、Yudong Wu 与 Shouliang Qi,发表于 npj Digital Medicine,2026 年 6 月 2 日收稿,2026 年 9 月 3 日接收,2026 年 9 月 16 日在线发表,DOI 10.1038/s41746-026-03253-6。开放获取,采用 CC BY-NC-ND 4.0 许可,为定稿排版前的接收版本。

作者单位:东北大学医学与生物信息工程学院、医学影像智能计算教育部重点实验室(沈阳);美国国立卫生研究院国家癌症研究所分子影像分部(贝塞斯达);宁夏医科大学总医院(银川);沈阳医学院附属第二医院;沈阳医学院;推想医疗科技股份有限公司(北京)。

数据与代码:github.com/smilenaxx/MSS-CT 提供 MSS-CT 数据集(仅含去标识化 NIfTI 体数据)与 BasicCSS 实现,基于 Python 3.9.23 与 PyTorch 2.2。公开外部数据集 RPLHR-CT 存放于 Zenodo。EC-CT 不公开:需向通讯作者申请,须经伦理委员会批准并签署数据使用协议,且仅限非商业学术研究。下游分割使用 TotalSegmentator v2.11 默认设置。

伦理与资助:经宁夏医科大学总医院(KYLL-2025-1831)、沈阳医学院附属第二医院(2025-SYEYLL-034)与中国人民解放军总医院(S2023-498-01)伦理委员会批准;因属使用去标识化数据的回顾性研究,免除知情同意。资助来源:国家自然科学基金(82472076、62271131)、中央高校基本科研业务费(N25BJD013)、辽宁省教育厅项目(2024-LJ-10164018)。已申报的利益冲突:P.Y. 为推想医疗实习生,X.C. 与 D.W. 为该公司雇员;其余作者声明无利益冲突。

另见 Tatakoto:低剂量 CT 的合成退化及其对结节影像组学的影响,以及 FLAIR 超分辨率:抹除还是幻觉出小病灶。