心电图上的恰加斯病:影像监督的预训练究竟迁移了什么,又能走多远
阿姆斯特丹大学医学中心与苏黎世联邦理工学院的一个团队,用 UK Biobank 的 63 193 例配对心电图–心脏磁共振检查,把一个心电图编码器对齐到由心脏磁共振导出的表征空间,随后丢弃影像分支,把冻结的编码器用于约 345 000 份巴西心电图上的恰加斯病检测。在对齐阶段从未见过任何一位恰加斯病患者的前提下,线性探针的 AUROC 从 0.827 升到 0.851,预测风险最高 5% 中的敏感度从 37.7% 升到 42.7%——超过了专门用恰加斯数据训练的模型。但在 ELSA-Brasil 这个距训练数据最远的盲测队列上,他们的 AUROC 跌到 0.556,是所比较的四种方法中最低的,而论文恰恰是在这个队列上宣称自己泛化得最好。
背景
恰加斯病由寄生虫克氏锥虫(Trypanosoma cruzi)引起,在拉丁美洲主要经锥蝽传播。世界卫生组织将其列为被忽视的热带病,估计全球感染人数在六百万至七百万之间。其最令人担忧的并发症是心脏方面的:一种在感染多年后才出现的恰加斯心肌病,在该大陆是非缺血性心肌病的主要病因之一。它的本质是结构性的——心肌纤维化、心室重构、进行性功能障碍。
诊断上的悖论可以一句话概括。能直接看到这些异常的模态是电影序列心脏磁共振(cardiac magnetic resonance,CMR),被视为刻画心脏结构与功能的参考标准。然而作者援引已发表数据指出,拉丁美洲人均磁共振设备约比欧洲少四倍,东南亚少十五倍,非洲则最多可少三十倍。相比之下,十二导联心电图几乎不花钱,而且到处都有——但它记录的是心脏的电活动,只能间接反映其结构。
于是有了近两三年多个团队(MMCL、PTACL、ECCL)探索的思路:多模态对比学习。取同一位患者的心电图–心脏磁共振配对数据,迫使模型为心电图生成一个靠近对应影像、远离其他患者影像的表征,然后把影像丢掉。所得到的心电图编码器原则上就带上了影像本该展示的那部分信息的痕迹。不过,所有这些研究都只在其自身训练队列的人群与疾病分布上做过评估,而这些队列几乎总是欧洲或北美的。悬而未决的问题——也正是这份预印本要攻的问题——是:这些结构性表征能否在分布变化下存活;更极端地说,它们对一种在预训练数据中完全不存在的疾病是否还保有诊断价值。
方法
两个基础模型,只训练其中一个。基础模型(foundation model)指在无标注数据上预训练、用于在多种任务上复用的大模型。心电图这一侧,作者从 ECG-FM 出发,这是一个在 140 万份十二导联心电图上预训练的 CNN–Transformer 混合架构。影像这一侧使用 CineMA,一个在电影序列 CMR 上训练的多视图掩码自编码器,把短轴切面与长轴(二腔、三腔、四腔)视图映射到一个共同表征中。在对齐过程中,CMR 编码器被严格冻结:它充当固定靶标,而不是学习伙伴。
改变全局的那个诊断:原始影像空间是退化的。这是本文最有用的观察,别处很少有人提。CineMA 在舒张末期(心腔充盈)与收缩末期(心肌收缩)的表征,平均余弦相似度高于 0.99——也就是说几乎无法区分。静态解剖压倒了全部方差,而功能,也就是运动,消失了。因此,对齐到这些原始向量,等于是在教心电图心脏有多大,而不是它怎么动。
用临床锚定的靶标取代原始靶标。作者提取舒张末期与收缩末期两个表征,拼接后送入一个多层感知机,监督其回归七个表型:左心室射血分数(LVEF)、左室舒张末容积、左室质量、右室舒张末容积、左室整体纵向应变、心房颤动、心肌梗死。随后该感知机被冻结。由此得到一个 256 维的瓶颈,把表征容量集中到 CMR 空间中与心血管病理最相关的那些维度上,剔除冗余的解剖噪声。
对齐是非对称的。所用损失为 InfoNCE——对比学习的标准目标函数,奖励拉近配对样本、推开批次内其他所有配对,并由温度参数(此处 τ = 0.1)调节这种区分的强度。在这里,梯度只流经心电图一侧:影像空间的几何结构纹丝不动,必须由心电图来向它靠拢。投影并非取自输出层,而是取自 ECG-FM 编码器的第 9 层,该层是通过对所有中间层做线性探针、对照若干心脏表型挑选出来的——因此与任何恰加斯标签无关。
数据。在 UK Biobank 上预训练:63 193 例配对的十二导联心电图与多视图电影 CMR 检查,其中 47 683 例用于对齐,15 510 例用于验证与留出评估,按 LVEF、左室质量、性别与房颤诊断分层。心电图为 500 Hz 的十秒记录,切分为两段五秒片段,训练时随机抽取其一作为数据增强。下游评估使用 PhysioNet/CinC Challenge 2025 发布的训练数据:CODE-15% 与 SaMi-Trop 合并,约 345 000 份心电图,其中 8 192 例恰加斯阳性——患病率 2.4%。为与官方挑战赛方案对齐比较,另加入 PTB-XL 作为补充阴性来源(21 801 份心电图)。对齐后的编码器以冻结方式使用,上面只加一个线性头,用五折交叉验证训练,对阳性类重加权,并按 AUPRC 选择检查点。
结果
对齐确实带来了收益,而且度量得很干净。与完全相同但未对齐的编码器相比——冻结的 ECG-FM、同一个探针、同样的折划分——对齐模型的 AUROC 从 0.827 升到 0.851(ROC 曲线下面积:随机抽取一个阳性患者,其得分高于随机抽取的一个阴性者的概率)。更重要的是,挑战赛的运营指标 Top5%-TPR——只保留风险最高的 5% 心电图时能捕获的真阳性比例——从 0.377 ± 0.014 升到 0.427 ± 0.022,即五个百分点。
而且这个结果超过了一个直接以该疾病训练的模型。Jidling 等曾在完整 CODE 加 SaMi-Trop 上端到端训练十五个 1D ResNet 的集成,报告 AUROC 为 0.800。而这个对齐编码器从未遇到过任何恰加斯患者或恰加斯相关影像,仅在冻结权重之上加一个简单线性头就做得更好。在完整挑战赛方案下(含 PTB-XL),线性探针的 Top5%-TPR 达到 0.431 ± 0.005,而挑战赛冠军的冻结编码器消融版为 0.381 ± 0.003——同样是五个百分点的差距。
临床换算让人重新脚踏实地。在 2.4% 的患病率下,每筛查 1 000 人约有 24 例阳性。把预测风险最高的 5% 送去做确证血清学,意味着检测 50 个人。对齐模型能抓住其中约 10 例,未对齐模型约 9 例:真实增益大约是每筛查 1 000 人多检出一例。两种情况下,50 份血清学中约有四十份会是阴性,而阈值之下仍会漏掉约十四例。这不算失败——在血清学检测能力才是瓶颈的场景里,用五十次检测正确地优先排出十例确有实际价值——但这与「AUROC 0.851」给人的印象相去甚远。
在盲测集上,画面变得复杂。官方提交的总分为 0.269,紧随前三名(0.280 至 0.323)之后,排在第四。作者强调了两项结果:SaMi-Trop-3 上最高的 AUROC(0.773,冠军为 0.767),以及 ELSA-Brasil 上最好的挑战赛分数(0.132)——后者被描述为因人口学与采集差异而最困难的队列。讨论部分没有强调的是:在同一个 ELSA-Brasil 队列上,他们的 AUROC 为 0.556,而排在前面的三支队伍分别是 0.566、0.567 和 0.626。REDS-II 上则是 0.350 / 0.739。
做得好的地方
对靶标空间退化的诊断,以及他们据此所做的处理。发现某个潜空间几乎是一维的——舒张末与收缩末余弦相似度高于 0.99——随后拒绝对齐到它,转而构建一个以七个临床表型监督的 256 维瓶颈,这是一个具体、有依据、且任何做心电图–影像对齐的人都能直接复用的工程决策。多数多模态对比学习论文只是对齐到对面编码器吐出来的任何东西。非对称的选择方向一致:冻结靶标,可以防止对比更新扭曲恰恰是要迁移的那个结构流形。
对照选得对,而且层的选择做了防泄漏处理。那五个百分点的差距,不是与另一个模型、在另一批数据、按另一套方案比较得来的。它比较的是同一个 ECG-FM 编码器,同样冻结,用同一个线性头和同样的折划分。唯一变化的是对齐本身。而第 9 层是对照通用心脏表型做探针挑出来的,明确没有看恰加斯标签——这堵住了此类工作中最常见的选择偏倚:先挑在最终任务上表现最好的那一层,再把结果说成 zero-shot。
外部验证是盲法的,这很少见。参加 PhysioNet 挑战赛意味着接受由第三方组织者、用事先确定的指标、在自己一行都没见过的测试集上评估。在一个「外部验证」通常意味着在自己下载的第二个公开数据集上测试的子领域里,这个差别是质的。作者还在官方结果表的注释中指出,排名靠前的队伍可以使用 REDS-II 验证集来校准阈值,而他们没有——这对自己的名次是不利信息,但他们照样写了出来。
做得不够好的地方
人群偏倚恰好朝着与预期用途相反的方向起作用。UK Biobank 是一支中老年英国志愿者队列,绝大多数为白人,并且存在有充分文献记载的选择偏倚:参与者比一般人群更健康。因此所学到的结构性先验,来自一个心肌病以缺血性或高血压性为主、克氏锥虫缺席、年龄结构与流行区筛查人群毫无相似之处的群体。作者把这个反对意见反过来当成论据——「从影像中学到的结构特征,恰恰最可靠地迁移到距预训练分布最远的人群」——但这正是论文最脆弱的地方,而且没有在拉丁美洲做任何前瞻性评估。讨论部分用一句话承认了这一点,并把它推给未来工作。
捷径学习的风险从未被审计。恰加斯训练池是拼装起来的:SaMi-Trop 是已确诊恰加斯心肌病的队列,因而全部为阳性;CODE-15% 是巴西远程医疗样本,绝大多数为阴性;PTB-XL 是德国数据,全部为阴性。因此,分类器完全可能靠识别记录来自哪个队列——设备、采样、电极放置、年龄、滤波——而非识别疾病本身,来取得很高的分数。论文没有做任何来源特征审计:没有域分类器、没有阴性对照视图、没有显著性分析、没有按队列拆解假阳性。而交叉验证中的 0.851 跌到 ELSA-Brasil 上的 0.556,恰恰是这种失效模式所预测的。我们在筛查性乳腺 X 线数据集融合一文中描述过同样的机制。
被推销得最力的结论,恰恰建立在会随阈值移动的那个指标上。「该方法对距预训练最远的人群迁移得最好」这一说法,完全建立在 ELSA-Brasil 的挑战赛分数上(0.132,四者中最佳),而同一队列上的 AUROC 是 0.556,四者中最低——勉强高于随机。可是挑战赛分数依赖于一个工作点,AUROC 不依赖。既然作者自己写明没有拿到 REDS-II 来校准阈值,那么「我们的阈值碰巧落在 ELSA-Brasil 的好位置上」这一解读,至少与「我们的表征泛化得更好」同样可信。一个队列、一次提交、没有置信区间:这个结论被过度解读了。另有三点保留。五个百分点的差距没有配套任何配对统计检验,表 1 也没有给出 AUROC 的置信区间。预印本中没有宣布任何代码仓库或公开权重,而 UK Biobank 与挑战赛数据都需申请获取——因此普通读者无法精确复现。最后,这是一份未经同行评审的预印本,既无资助声明也无利益冲突声明,其「Impact in RCS」一节透露出这更像是投给资源受限环境专题研讨会的稿件,而非期刊论文。
这意味着什么
对研究界。可迁移的成果不是 0.851 这个数字,而是这样一个论证:通过对齐影像学到的结构性先验,对一种在预训练中缺席的疾病仍然保有价值。这改变了问题的位置。此前,心电图–CMR 对齐被当作改进我们本来就会测量的那些表型的手段。而在这里,它被当作一种把昂贵模态蒸馏进可获得模态的手段:在数据富集的国家一次性完成,然后运送到别处。如果这个机制成立,它就适用于任何因缺少影像而被低估诊断的结构性心脏病。不过,首先要做的核验恰恰是本文没有做的:分离出靶标空间中究竟哪些表型真正承载了恰加斯信号,并确认模型学到的不是来源队列。医学基础模型究竟编码了什么,这一问题与我们在医学基础模型的表征收敛一文中讨论的相衔接。
对临床医生。今天什么都不改变。挑战赛总分 0.269、在最贴近现实的队列上 AUROC 0.556、没有前瞻性评估、没有任何监管认证:我们仍处在方法学概念验证阶段。值得记住的是它的使用框架,而这个框架是聪明的:目标不是用心电图诊断恰加斯病——诊断仍然依靠血清学——而是在检测能力成为瓶颈时,决定优先把谁送去做血清学。这是分诊问题,不是诊断问题,而这正是提问的正确方式。但真正合适的对照在此缺席:一条简单的临床规则,比如年龄、居住地区、家族史、恰加斯心肌病的经典心电图异常。在真实数据上没有击败这个对照之前,净收益仍属未知。
对患者与公众。这项工作深层的吸引力是一种技术上的公平:它主张在影像丰富的地方学习,再部署到只有心电图的地方,且使用时从不要求磁共振。相比要求资源受限国家先去购置富裕国家的设备,这是更诚实的方向。但必须看到界限,而且这个界限是结构性的:被蒸馏的知识来自一支年长的英国人群,而唯一一次在真正不同的巴西队列上的测试,给出的排序几乎不比随机好。由别处的心脏塑造出来的模型,并不自动就是适用于此处心脏的模型。同样的张力也贯穿于其他针对被忽视疾病的人工智能工作,例如血吸虫病门静脉周围纤维化的超声筛查。
延伸阅读
预印本:Leveraging Cardiac Imaging to Improve ECG-Based Detection of Chagas Disease in Resource-Constrained Settings,arXiv:2609.08582 [cs.LG],DOI 10.48550/arXiv.2609.08582,2026 年 9 月 8 日提交,采用 CC BY 4.0 许可。作者:Laura Alvarez-Florez 与 Daniel Uyterlinde(同等贡献)、Samuel Ruipérez-Campillo、Lukas P. A. Arts、Folkert W. Asselbergs 与 Fleur V. Y. Tjong——阿姆斯特丹大学医学中心生物医学工程与物理系及临床与实验心脏病学系、阿姆斯特丹大学 Quantitative Healthcare Analysis 课题组,以及苏黎世联邦理工学院计算机科学系。稿件中未出现任何资助声明或利益冲突声明。评估框架来自 George B. Moody PhysioNet Challenge 2025,主题为从心电图检测恰加斯病。主要对照为 Jidling 等,PLoS Neglected Tropical Diseases 2023, 17(7): e0011118。所用数据集包括 UK Biobank(Sudlow 等,PLOS Medicine,2015)、CODE-15%(Ribeiro 等,Zenodo,2021)、SaMi-Trop 队列(Cardoso 等,BMJ Open,2016, 6(5): e011181)与 PTB-XL(Wagner 等,PhysioNet,2022);复用的基础模型为 ECG-FM(McKeen 等,JAMIA Open,2025)与 CineMA(Fu 等,arXiv 预印本,2025)。关于流行病学与疾病管理,基础参考是 世界卫生组织恰加斯病实况报道。