低剂量CT下的肺癌:如果用「降质」的标准剂量CT、而非去噪图像来训练AI,会怎样?

米兰理工大学(意大利)的一个团队检验了一个把问题反过来的思路:在用低剂量CT(LDCT)做肺癌筛查时,与其对含噪图像去噪,不如把大量的标准剂量CT(SDCT)「降质」成伪低剂量图像,来训练基于放射组学的结节分类器。作者在公开数据集LIDC-IDRI上比较了三种降质方法,结果表明:在标准剂量上训练的模型在真实低剂量上崩溃(敏感性0.571),而三种降质都把AUC恢复到0.84以上——其中最好的CycleGAN达到0.861,敏感性为0.743。但把这三种方法彼此排名,在统计上依然脆弱。

背景

针对重度吸烟者的肺癌筛查依赖低剂量CT(LDCT)。其原理是:大幅降低X射线剂量,以限制反复照射的风险,代价是图像更嘈杂、对比度更低,有时带有伪影。大型试验(美国的NLST、欧洲的NELSON)表明这种筛查能降低死亡率。剩下的问题是用机器学习模型来自动化阅片——发现并分类肺结节。

然而这些模型遇到一个瓶颈:带标注的LDCT数据集极其稀少。因此文献主要致力于对低剂量图像去噪,使其接近标准剂量。这有两个问题:去噪往往需要同一患者的SDCT/LDCT配对图像(在伦理上无法获取,因为要对同一个人扫描两次),而且「先降质再去噪」的链条很繁重。米兰团队提出相反的做法:从数量众多且带标注的标准剂量图像出发,把它们降质为伪低剂量图像以扩充训练数据——然后验证如此训练的分类器能否在真实低剂量上奏效。所衡量的任务是二分类(结节是否恶性),主要以AUC(ROC曲线下面积)评估,这是0.5到1之间的分数:0.5为随机,1为恶性与良性的完美分离。

方法

工作的核心是比较从真实SDCT制造「伪LDCT」的三种方式。方法1:在正弦图域(扫描仪的原始投影数据)插入噪声,加入泊松噪声和高斯噪声以模拟量子噪声与电子噪声——一种确定性且轻量的方法。方法2:借助Pix2Pix复现一个经过验证的物理模型(Yu等人),Pix2Pix是一种在配对图像上训练的条件生成对抗网络(GAN);GAN让一个生成器(制造图像)与一个判别器(试图区分真假)相互对抗,直到假图变得以假乱真。方法3:CycleGAN,一种在无需配对的情况下、从两组未配对图像中学习从一个域(标准剂量)向另一个域(低剂量)翻译的变体——这在此处很宝贵,因为真实的SDCT/LDCT配对并不存在。

数据来自两个公开来源。主要来源LIDC-IDRI汇集了1018例由放射科医生标注的胸部CT。作者从中划分出695名标准剂量患者(1950个结节),用于降质后的训练,以及315名低剂量患者(675个结节),仅用于验证(50%)和测试(50%)。当放射科医生给出的平均概率超过5分中的4分时,结节被标为「恶性」——即训练中225个恶性对1725个良性,存在很强的不平衡。第二个来源(Low-Dose CT Image and Projection数据集,50例配对胸部检查)仅用于训练Pix2Pix。预处理是一致的:转换为亨氏单位、窗宽[−1200, 600]、轻度高斯去噪、归一化。

在每个降质后的数据集上,放射组学登场:PyRadiomics提取851个符合IBSI标准的定量特征(形状、强度、纹理、小波),再由多个选择器(LASSO、MRMR、PCA、RFE、随机森林与梯度提升)进行降维。类别不平衡通过对少数类做增强(用轮廓扰动把225个恶性扩到900个)和对良性做欠采样(到900个)来纠正。测试了六种分类器(AdaBoost、决策树、k近邻、逻辑回归、随机森林、XGBoost)。一半真实LDCT用于选择阈值、特征子集以及最佳的选择器/分类器组合;另一半从未见过,作为最终测试,并用1000次自助法(bootstrap)重采样得到置信区间,用Friedman检验与随后的Wilcoxon检验(Bonferroni校正)来比较各方法。一个关键的严谨之处:没有任何低剂量患者参与分类器的训练。

结果

第一个教训:没有降质,就会崩。用未处理的标准剂量训练的分类器在验证时表现良好(AUC 0.863),但在真实低剂量上下滑:AUC 0.789,尤其是敏感性骤降到0.571,特异性为0.917。换句话说,在100个真正可疑的结节中,这个模型漏掉了约43个——恰恰是筛查工具无法承受的错误。

第二个教训:三种降质都修复了要害。它们都把测试AUC恢复到0.84以上:0.844(方法1,敏感性0.656)、0.859(方法2,敏感性0.684),以及CycleGAN(方法3)的0.861,后者提供了最佳平衡——平衡准确率0.800,敏感性0.743,特异性0.858。在临床转译上,从每100个可疑结节漏掉约43个(未降质模型)降到约26个(CycleGAN);在假阳性一侧,0.86的特异性意味着每100个良性结节约有14个被错标为可疑——这是筛查中的敏感点,因为过多的假阳性会引发不必要的检查和干预。

第三个教训更为微妙,关乎图像质量。以分布间距离(FID和KID,越低越好)衡量,与真实低剂量的对齐,CycleGAN(FID 0.17)明显优于方法1和方法2(FID 4.07和4.67)——后者甚至比未降质的标准剂量图像(FID 1.15)还。这一悖论很有启发:方法2产生的噪声和条纹在视觉上非常「逼真」,但在统计上离真实低剂量更远。肉眼所感知的逼真,并不等于所测得的分布对齐。最后,尽管图像外观不同,所保留的放射组学特征却大量重叠(三种方法共有60个变量),而在所有方法中都被选中的只有两个:结节的长轴长度和球形度——这与临床上的Lung-RADS标准一致,后者首先依据大小和规则程度来判断。

值得肯定之处

一次真正的域偏移压力测试。该方案的强项在于严格分离:真实的低剂量扫描只用于验证和测试,从不用于训练分类器,从而排除了数据泄漏(data leakage)。标准剂量模型在低剂量上崩溃(敏感性0.571)的证明并非细节:它白纸黑字地确立了剂量是一条不可忽视的域边界。

对逼真度与对齐度的诚实解耦。作者同时报告视觉外观和分布距离,由此表明:一幅「看起来像」低剂量的图像(方法2,条纹明显)可能比一幅更模糊的图像(CycleGAN)离真实低剂量更远。这是一个有用的护栏,能防止「肉眼上以假乱真的合成数据必然是好的合成数据」这种错觉——而用这些距离来引导CycleGAN的训练是自洽的。

用心的可复现性。公开数据(LIDC-IDRI以及Low-Dose CT Image and Projection数据集,均在The Cancer Imaging Archive上)、在GitHub上发布的代码、符合IBSI标准的放射组学、自助法置信区间以及明确的统计检验。工作可以被重跑和讨论——这是一切建设性批评的基础。

不足之处

目标并非生物学真相。这里的「恶性」由放射科医生估计的平均概率(5分中大于4分)来定义,而非组织学确诊。因此模型学到的是复现一种放射学印象,而非经证实的诊断:这是一个潜在的误导性指标,不应被读作对确诊癌症的检测。再加上很强的类别不平衡(约11%为恶性),由增强和欠采样人为地加以纠正。

泛化仍是局部的。用于验证和测试的真实低剂量扫描全部来自LIDC-IDRI:所测试的域偏移在一定程度上是同一数据集内部的,没有真正的外部队列(作者提到未来将在LUNA25上测试)。此外,Pix2Pix仅在来自单一数据集的50例检查上训练。这种人群偏差——单一的设备与方案生态——使得能否推广到其他中心仍是未决问题。

方法之间的排名脆弱。Friedman检验和Wilcoxon检验都显著,但95%置信区间大量重叠(方法2与方法3的AUC为0.859对0.861),作者自己也承认,自助法重采样的规模使检验对极小的差异过度敏感。因此稳健的结论并不是「CycleGAN获胜」,而是「三种降质大体相当,并明显胜过不做降质」。此外,0.743的敏感性仍然一般,并且伴随着最宽的置信区间。最后要指出,CycleGAN在训练期间「见过」真实低剂量图像的分布(不含标签)——这是域自适应中的标准做法,但值得点明。

它带来的改变

对研究界而言,该研究重新表述了低剂量领域一个反复出现的问题:与其对稀缺图像去噪,不如降质数量众多的标准剂量图像来构建训练数据——而无配对翻译(CycleGAN)在真实配对因伦理原因无法获取之处提供了一条务实路径。方法学上的信息有两点:域自适应是必要的(朴素模型会崩溃),而合成数据集的质量应以分布对齐来评判,而非以其表面的逼真度。

对临床医生和决策者而言,警示是具体的:一个在标准剂量诊断扫描上验证过的AI,可能在低剂量筛查扫描上悄然失效。剂量方案本身就是一种域差异;面向筛查的工具必须在筛查的剂量条件下开发和验证。而特异性与敏感性同等重要,因为LDCT筛查的软肋始终是假阳性及其带来的一连串无谓检查。

对患者和公众而言,有两点简单的道理。第一,「筛查扫描」与「诊断扫描」产生的图像并不相同,在一者上表现良好的算法未必在另一者上也好。第二,一幅看上去更逼真的合成图像,并不会自动成为训练AI的更好素材。在现阶段——AUC约0.86,敏感性约0.74,基于单一数据集且无组织学确诊——这是一项有前景的研究,而非可用于临床的工具。

延伸阅读

预印本《A Comparative Analysis of CT Degradation for LDCT Nodule Classification using Radiomics》可在arXiv(2605.12164)获取,日期为2026年5月13日,作者为Jiaying Liu、Valentina D. A. Corino、Anna Corti和Luca Mainardi(米兰理工大学;Corino同时任职于米兰Centro Cardiologico Monzino IRCCS的Cardiotech Lab)。代码发布于GitHub,数据通过The Cancer Imaging Archive公开(LIDC-IDRI;Low-Dose CT Image and Projection Data)。所查阅的预印本没有资金或利益冲突声明。关于影像中泛化与训练数据的盲点,参见我们对混合数据集反而拖垮筛查AI、对深度放射组学签名与可解释性,以及对医学影像中按亚组隐藏的偏差的解读。

编辑透明度说明:法文版由Tatakoto编辑部在阅读该预印本后撰写并署名。英文、西班牙文和中文译本借助AI协助完成并经过审校。