核磁共振上的阿尔茨海默病:融合认知量表带来 28 个百分点的准确率,却让模型从影像中学到的更少

布加勒斯特国立科技大学 POLITEHNICA 的两位研究者,在 ADNI-1 队列的 1 075 例 T1 加权核磁共振上训练了一个阿尔茨海默病分类器,随后用对比学习接入临床变量。融合认知量表——MMSE、CDR-SB、ADAS11、RAVLT——把三分类准确率从 58.7% 提升到 87.3%,但这些量表恰恰是 ADNI 用来确定诊断标签的工具:模型并没有把影像读得更好,它只是还原了打标签的规则。真正有价值的结果在别处:在架构、受试者划分和训练流程完全相同的条件下,与解剖体积对齐的编码器所产生的影像表征,在"轻度认知障碍对正常对照"上达到 73.8%,而与认知量表对齐的编码器只有 52.4%——也就是随机水平。

关于背景

阿尔茨海默病在结构性 T1 核磁共振——显示解剖结构而非功能的序列——上表现为萎缩:脑组织变薄,最先出现在内侧颞叶,也就是海马与内嗅皮层所在的位置。十年来的标准任务是把一次扫描归入三类:认知正常(CN)、轻度认知障碍(MCI,前驱期)和已确诊的阿尔茨海默病(AD)。把 AD 与 CN 分开相对容易,因为晚期萎缩肉眼可见;把 MCI 与 CN 分开则很难,而这恰恰是临床上最关键的边界,因为那是干预仍可能奏效的窗口。

这一文献中有两个反复出现的问题,本文正面处理了它们。第一个是模型在看什么:一个接收整张切片的卷积网络没有任何理由把自己限制在脑组织内,它可以利用颅骨、眼眶或脑室边界的对比度。这是典型的捷径学习(shortcut learning)——模型学到的是伪相关而不是病理——与在乳腺筛查数据集的来源特征中记录到的机制相同。

第二个是给模型喂了什么。像 ADNI 这样的大队列附带丰富的临床表格,近年的影像—表格融合工作在把它们加入核磁共振后报告了惊人的增益。问题在于,这些表格中的若干列——MMSE、临床痴呆评定量表(CDR)——本就属于 ADNI 用来确定诊断标签的标准。用这些变量去预测标签,在很大程度上等于重新推导出产生标签的那条规则。这就是标签泄漏(label leakage),它与我们在由大语言模型生成基准标签时见到的循环泄漏是近亲。

关于方法

数据。1 075 例 T1 加权核磁共振,采集自 ADNI-1 Screening 的 1.5 特斯拉序列,来自 982 名受试者——少数参与者有不止一次筛查采集。分布约为 CN 289 例、MCI 507 例、AD 279 例。所有体数据都经过 FastSurfer 处理,这是 FreeSurfer 的深度学习重实现,它把每次扫描统一到 256³ 的 1 毫米各向同性体素网格,并生成带皮层下标签的 DKT 皮层分区。

数据划分。作者按受试者划分:没有任何患者同时出现在两个集合中。正是在这一点上,Wen 等人在 2020 年指出,阿尔茨海默病文献因为按切片而非按患者划分而抬高了自己的数字。测试集是平衡的,每类 21 例,共 63 例;二分类任务用 42 例。其余约 862 例用于训练、150 例用于验证。

影像编码器。刻意做得很轻:一个在 ImageNet 上预训练的 ResNet18,只微调最后一个残差块,逐切片应用(90 张轴位切片,索引 62 至 152,缩放到 224 × 224)。切片描述子经过单层 Transformer(8 个注意力头)——这一机制让每张切片能够加权利用其他切片的信息——再取平均得到受试者描述子,投影为 128 维向量(embedding,即该次扫描的紧凑数值表征)。

表格分支与泄漏谱。临床变量来自合并表 ADNIMERGE(16 421 行受试者—访视记录),按与标签的接近程度分为五组:cog(CDR-SB、ADAS11、MMSE、RAVLT 即时回忆——泄漏风险高,它们就是诊断工具);bio(脑脊液 Aβ、tau、p-tau);pet(FDG、AV45);vol(海马、全脑、内嗅皮层、颞中回——风险低,它们是萎缩的相关量而非诊断标准);demo(APOE4、年龄)。实际只使用 cog 与 vol:bio 组仅约 14% 的行有数据,会需要大量插补。在 cog 与 vol 中缺失单元格不到 3%,用训练集均值替代。

对比对齐。两个分支通过对称 CLIP 损失被拉近——这一训练目标促使同一受试者的影像 embedding 靠近其表格 embedding,并与同批次其他受试者的表格 embedding 拉开距离。一个诚实且很少被报告的方法细节:该损失必须用单精度计算,因为在混合精度下它一直停留在随机值上。其上训练两个头:纯影像头,一个在推理时不接收任何临床变量的线性分类器;以及融合头,作用于两个 embedding 的拼接。

关于结果

分类器在看哪里。基于 FastSurfer 标签训练的 YOLOv8 模型定位相关结构的 mAP₅₀ 至少为 0.95——中等规模变体达到 0.969。把影像分类器的 Grad-CAM 图与这些检测结果对照,可以看到两种情形:在许多切片上它确实关注脑室、继而关注颞叶;但在相当数量的其他切片上,注意力落到颅骨、颈部、眼眶,甚至头颅之外。作者明确指出这一分析是定性的,他们没有量化落在脑内的 Grad-CAM 质量占比。

赢的那种融合,正是泄漏的那种。在 63 例测试扫描上,三分类任务的结果是:纯影像 58.7%(95% Wilson 区间 46.4 至 70.0)、融合认知量表 87.3%(76.9 至 93.4)、融合体积 73.0%(61.0 至 82.4)。作者明确把 87.3% 视为由泄漏驱动的上界,而不是影像层面的结果。

主要发现:对比目标塑造了编码器。这是一次受控比较。两次训练在架构、数据、受试者划分、两阶段训练计划、超参数和测试集上完全一致,唯一的差别是对比损失让影像去对齐哪一组表格。在 MCI 对 CN 上,纯影像头——测试时不接收任何临床数据——在编码器与体积对齐时达到 73.8%(31/42),在与认知量表对齐时只有 52.4%(22/42)。相差 21 个百分点,而评估时根本没有任何表格变量在场。融合后顺序还会反转:端到端看起来最好的配置,恰恰学到了最弱的视觉表征。

裁剪到内侧颞叶有帮助。把输入限制在一个 96 × 48 × 64 体素的框内,逐受试者以八个分割结构(双侧海马、杏仁核、内嗅皮层与海马旁皮层)并集的质心为中心,纯影像三分类准确率从 58.7% 升到 65.1%(41/63,置信区间 52.8 至 75.7),MCI 对 CN 从 73.8% 升到 81.0%。增益在 MCI 上比在 AD 对 CN 上更明显,这与早期信号集中于局部的判断一致。

临床换算——以及它的边界。若从三类人工均衡的人群中抽取 1 000 人,最好的纯影像模型大约会把 651 人分对、349 人分错;随机猜测能分对 333 人。但这个数字不该被过度解读:在 63 例上置信区间约为 ±12 个百分点,而从 58.7% 到 65.1% 的改进只对应 4 例扫描。对比目标那 21 个百分点的差距对应 9 例扫描,单次运行的非配对两比例 z 检验 p ≈ 0.04——作者自己称其为提示性的,而非已确立的。

做得好的地方

泄漏谱是显式的、有序的,并且写进了实验方案。作者没有把 ADNIMERGE 里能用的东西一股脑融合起来再公布最高的数字,而是按变量组与打标签规则的接近程度排序,每组单独训练一次,并事先声明认知量表组只是一个作为对照的上界。这种方法学上的自律在表面成绩上是吃亏的,但本应成为常规。

纯影像头与融合头并列报告。这是让这篇论文有用的关键动作。没有它,结论就会是"认知融合拿到 87.3%,可以发了";有了它,人们才看到这一配置产生的编码器最弱。由此得出的建议——在每个对齐目标下都报告单模态头——可以直接迁移到任何多模态融合工作,并且补充了我们已知的关于文本压过影像的临床模型的结论。

自我批评是量化的,而且放在结论之前。作者逐条列出了阻碍与 Huang 比较的方案差异(63 例受试者层面的扫描对 882 张切片;仅 ADNI-1 对更大范围的选样;一次融合一个变量组对全部组融合、其中一组还包含基线诊断;单次运行对五次划分取平均)。他们明确写道,数字接近说明他们的复现是可用的,而不是说明他们做得更好。他们还指出,预实验中的一个 3D 编码器比他们的 2D 编码器领先约二十个百分点。

做得不够好的地方

测试集太小,撑不起它所承载的结论——由样本量造成的误导性指标。63 例扫描、每类 21 例、每种配置只跑一次。在 ±12 个百分点的 Wilson 区间下,论文中几乎所有比较都彼此重叠。核心结果——两种对比目标之间 21 个百分点的差距——只建立在 9 例扫描上,既没有做配对检验,也没有在多个随机种子上重复。作者如实说明了这一点,这很诚实,但并不改变证据的性质。

没有外部验证,只有一个队列、一种场强——人群偏倚。全部数据来自 1.5 特斯拉的 ADNI-1。ADNI 是一个研究队列,在有限数量的北美中心以志愿方式招募;没有任何证据表明,一个按其采集规范调校出来的编码器能在常规 3 特斯拉设备上、在未经筛选的人群中,或在另一个卫生体系里站得住。这个问题和在扰动下测试的病理基础模型是同一个:内部数字对可迁移性一言不发。

内侧颞叶裁剪转移了依赖而非消除依赖,而且缺了一部分结果。这个解剖框需要在推理时先做一次 FastSurfer 分割:任何分割误差都会直接传导到裁剪位置,整条流水线因此依赖一个计算开销不小的外部工具。此外,作者写道他们训练了裁剪的轴位与矢状位变体,却"等待日志最终提取"而略去了这些数字——在一篇核心论点就是不要挑选有利结果的论文里,这一省略值得指出。最后,论文没有提到任何代码或权重仓库。

这意味着什么

对研究界而言,这篇论文给出了一套可复现且成本低廉的方案:把辅助变量按泄漏程度排成一条轴,每组训练一次,并且系统性地把单模态表现与融合表现一并发表。"带泄漏的对比目标会削弱影像编码器"——而不仅仅是抬高最终分数——这一观察是新的,值得在别处检验:如果成立,影像—表格融合文献中报告的部分增益衡量的其实是表格有多容易,而不是影像模型有多好。决定性的检验很简单:把现有基准拿回来,公布单模态头的结果。

对临床医生而言,今天什么都没有改变。在一个研究队列的 63 例扫描上取得 65% 的三分类准确率,不是一个工具,作者也从未做出相反的主张。真正可以直接带走的是一把阅读的尺子:当一篇论文宣称某个"多模态"模型在阿尔茨海默病诊断上达到 87% 时,第一个该问的问题是 MMSE 或 CDR 是否在输入之列。如果在,那个数字衡量的主要是打标签流程的内部一致性。

对患者和公众而言,有一点反直觉但值得记住。一个十次里有九次正确说出"这个人得了阿尔茨海默病"的人工智能,未必读懂了大脑:它可能读的是当初用来下诊断的那份认知测试结果,而那并没有诊断出任何新东西。影像模型的价值,取决于它在临床检查之外多提供了什么,而绝不取决于它复现临床检查的能力。

延伸阅读

论文:Anatomical Grounding and Leakage-Aware Multimodal Contrastive Learning for Alzheimer's Disease Classification from Structural MRI,作者 Paul-Gabriel Nicolae 与 Irina Mocanu,布加勒斯特国立科技大学 POLITEHNICA 计算机科学与工程系,2026 年 9 月 14 日提交至 arXiv(arXiv:2609.15888,cs.CV),13 页,DOI 10.48550/arXiv.2609.15888。截至本篇解读发布之日,该文为未经同行评议的预印本。

数据:ADNI 队列(阿尔茨海默病神经影像学计划),ADNI-1 Screening 1.5 T 采集集合及合并表 ADNIMERGE。ADNI 的数据采集与共享由美国国立卫生研究院(资助号 U01 AG024904)和国防部(W81XWH-12-2-0012)资助。实验在布加勒斯特 POLITEHNICA 的 FEP 集群上运行,作者提到每个作业十二小时的上限是阻碍其开展纵向多阶段训练的限制。

工具:FastSurfer(Henschel 等,NeuroImage,2020)用于分割与 DKT 分区;Ultralytics 的 YOLOv8(AGPL-3.0 许可)用于检测与实例分割;Grad-CAM(Selvaraju 等,ICCV 2017)用于注意力图;CLIP(Radford 等,ICML 2021)用于对比目标;TabTransformer(Huang 等,2020)用于表格分支。论文中未给出任何代码或权重仓库。

作者引用的背景文献:Wen 等,Medical Image Analysis,2020,关于卷积网络阿尔茨海默病分类中的数据泄漏;Petersen 等,Neurology,2010,关于 ADNI 的诊断标准;Huang,ICCVW 2023,本文沿用并修正了其对比融合方案;Hager 等,CVPR 2023,关于影像—表格对比学习。