不用标签、仅凭一份心电图预测死亡:自编码器的「重建误差」究竟在衡量什么
因斯布鲁克医科大学的一个团队用 720 万份巴西心电图训练了一个掩码自编码器,从未告诉它谁会死亡。思路是:一份心电图越偏离所学到的「正常」,其重建误差越大,死亡风险据称就越高。该评分在三大洲 160 万名患者上得到验证,能较好地预测全因死亡——但仔细审视会发现,「自监督」一词掩盖了一次由标签驱动的选择,而那个招牌数字从未真正分离出心电图在年龄之外所贡献的部分。
背景
心血管疾病仍是全球第一位死因,每年造成逾 1900 万人死亡。人们希望及早识别高危人群,但经典的临床评分依赖一些变量(血压、胆固醇、既往史),它们有时不可得、测量不准,或在个体层面区分力不足。相比之下,心电图(ECG)——通过贴在皮肤上的十二个导联记录心脏电活动——几乎人人可及、廉价且无创,是可自动化风险评分的理想载体。
近几年,人工智能模型读取心电图来预测风险。多数是有监督的:给它一个目标(比如患者年龄),风险评分就变成模型预测与真实值之间的差距——即众所周知的「心电图年龄」高于实际年龄。作者强调,问题在于这一评分取决于目标的选择:模型可能学到训练队列或目标结局特有的伪影,而非心脏信号本身。因此他们的赌注是:构建一个无标签、完全内在于心电图的评分。以下阅读需两个提示。风险比(hazard ratio,HR)是一个风险倍数:HR 为 1.40 意味着评分每上一档,死亡风险增加 40%。C 指数(C-index)衡量按生存正确排序两名患者的能力;1.0 为完美,0.5 相当于随机。
方法
工作的核心是一个掩码自编码器(masked autoencoder)。自编码器是一种先压缩输入、再试图原样重建它的网络;「掩码」指遮住信号的一部分,让模型从其余部分猜出它。这种学习称为自监督:没有人工标签,模型仅从信号的结构中学习。所选架构是 Vision Transformer(ViT),一种把输入切成小块、并通过注意力机制权衡各块相对重要性的网络——这里用的是刻意做小的「Tiny」版。
模型在 CODE 数据集的 85% 上预训练,即来自巴西米纳斯吉拉斯州一个远程医疗网络的 7 212 109 份心电图,主要于 2010 至 2016 年在基层医疗中记录。每份心电图降采样到 100 Hz,逐导联滤波并归一化,再切成 36 个小块,其中 80% 被掩盖;模型学习重建被遮住的部分。在使用时,重建误差是真实心电图与其重建之间的平均差异,在五次运行上取平均。逻辑很简单:与模型大量见过的相近的「正常」波形重建得好(误差低);非典型波形重建得差(误差高)。这一误差就成为风险评分。
一个对批判性阅读至关重要的方法细节:尽管训练无标签,模型的停止点(2600 步,不到一个 epoch)和其规模,是因为在内部队列上最大化死亡预测才被选定的。换言之,死亡标签确实在评分的制作中的某个环节进入了。作者如实报告了一个反直觉的事实:更大、训练更充分的模型重建心电图更好……却把死亡预测得更差。被保留的是一个在重建上刻意「平庸」的模型。
结果
验证规模很大:约 160 万名参与者,三大洲六个队列——CODE-15%(巴西,基层医疗,内部)、MIMIC-IV-ECG(美国,重症)、HEEDB(美国,住院)、CHRIS(意大利,一般人群)、Innsbruck(奥地利,心脏科)和 UK Biobank(英国)。中位随访 1.4 至 11 年,5 年死亡率从 1.0%(CHRIS)到 14.0%(MIMIC-IV-ECG)。重建误差每升高一个标准差,在校正年龄和性别后,死亡风险稳定上升:CODE-15% 中 HR 为 1.39(C 指数 0.810),MIMIC 中 1.39(0.731),HEEDB 中 1.41(0.740),Innsbruck 中 1.23(0.741),CHRIS 中 1.25(0.896)。所有置信区间都明显排除随机。
短期信号明显更强。在 HEEDB 中,HR 从 5 年的 1.46 升到 1 年的 1.61 和 30 天的 2.00;平均曲线下面积(C 指数的一种时间依赖变体)在 30 天为 0.776,但到 5 年跌到 0.667。临床解读:误差处于第 90 百分位的患者,其 30 天死亡风险约为第 10 百分位患者的六倍——这是一个说明性数字,是在假设对数线性关系下、跨 2.6 个标准差外推得来的。在二值版本(阈值定在巴西均值上方一个标准差)中,「高危」患者在 MIMIC 中 HR 为 2.00,HEEDB 中 1.95,Innsbruck 中 1.53,UK Biobank 中低至 1.27。但被归为高危的比例因队列差异极大:从 1.8%(CHRIS)到 25.3%(MIMIC)——这表明阈值无法原样在人群之间迁移。
值得肯定之处
代码、权重和数据开放,没有产业资金。模型的代码和权重在 GitHub 上以 CC BY 4.0 许可发布,大型数据集(CODE、MIMIC-IV-ECG、HEEDB、CHRIS、UK Biobank)可申请获取。经费完全来自因斯布鲁克医科大学内部,没有商业赞助,也未申报利益冲突。在一个专有评分泛滥的领域,这种透明让任何人都能重演并审计该分析。
一次在规模与坦诚上都罕见的外部验证。把同一评分放到六个队列上——巴西基层医疗、美国重症监护、意大利一般人群、奥地利心脏科——覆盖 160 万人,其泛化努力远高于该领域的平均水平。而且团队并不掩盖令人尴尬的异质性:例如它指出,CHRIS 的死亡通过讣告和家属联系获得,很可能低估了死亡数并削弱了 HR。
一个优雅的想法,以及一个未加粉饰就报告的反直觉结果。仅凭一份心电图「与正常的距离」来界定风险、不设外部目标,在概念上很干净。尤为可贵的是,发现重建更差的模型反而把死亡预测得更好,是那种人们倾向于埋起来的尴尬结果;这里它被描述并讨论,足见分析的成熟度——尽管如我们将看到的,它也应当引起警惕。
不足之处
「自监督」一词掩盖了一次经由模型选择的泄漏。论文的卖点是一个「无标签」评分。但停止点和模型规模,是按其在 CODE-15% 上的死亡预测表现挑选的。于是死亡标签驱动了评分的构建,CODE-15% 也就不再是真正独立的内部验证:它的 C 指数偏乐观。这是一种经由模型选择之门的数据泄漏(data leakage)——隐蔽、几乎未被提及,却削弱了核心承诺。「重建越差=预测越好」这一反直觉结果其实是一个警报:它暗示起预测作用的并非心脏建模的质量,而是退化的重建放过去的别的东西。
招牌指标从未分离出心电图自身的贡献,而且没有真正的对照。所有报告的 C 指数(0.73 至 0.90)都来自已经包含年龄和性别的模型。而年龄本身就是一个极强的死亡预测因子——CHRIS 中 0.896 的 C 指数几乎肯定是由年龄而非心电图撑起来的。论文既没给出评分相对于单用年龄和性别的 C 指数增益,也没给出重分类指数:因此我们并不知道重建误差究竟增添了什么。再加上缺少对照:没有与现有的有监督 AI-ECG 评分或既有临床风险评分做直接较量。在做这项检验之前,「在年龄之外」的高 HR 并不能证明其有用。
一个可能的捷径:评分捕捉的是急性状态,而非仅仅是内在风险。重建误差也许主要是「此刻患病」的标记——噪声、伪影、心律失常、起搏器、重症监护心电图——而非基础的心脏风险。三条线索汇合:信号在 30 天最强、到 5 年减弱;正是在重症监护(MIMIC)中被标为高危的患者比例飙升到 25%;而训练不足的模型在第 III 导联上产生近乎为零的重建——这是学习伪影,不是生理。这种可能的捷径学习(shortcut learning),加上无法迁移的阈值(因队列不同,「高危」患者从 1.8% 到 25.3%)、研究的回顾性、缺乏特定病因死亡(一切都是「全因」)以及未经同行评审的预印本身份,都要求谨慎。
这意味着什么
对研究界而言,这项研究既是一个好主意,也是一个方法学的教科书案例。自监督风险评分是一条有吸引力的路径——它绕开了目标选择的偏倚——但其评估必须跨过本工作尚未跨过的两道门槛:分离出在年龄和性别之外的增益(C 指数增益、重分类),以及证明该信号并非只是急性严重程度的替代物。真正的工作在此:前瞻性验证、特定病因终点,以及不依赖结局标签的模型选择。
对临床医生而言,今天没有任何改变,而这正是有用的信息:这是一个研究原型,没有前瞻性验证,没有与现有评分的比较,阈值还会因人群而重新校准。不应由它导出任何诊疗决策。该评分的价值是启发式的——它或许终有一天能标记出值得再看一眼的「非典型」心电图——而非决策性的。
对患者与公众而言,这个故事是对「人工智能读你的心电图、预测你的死亡」这类标题的一剂良药。要问的问题不是「它的准确率多高?」,而是「它能不能胜过简单的年龄计算,它是否在真实条件下、前瞻性地测试过?」。这里,诚实的回答是:我们还不知道。这恰恰是论文值得称道之处——它并不隐瞒——也恰恰是它「自监督」的包装终究容易让人忽略的东西。
延伸阅读
预印本见 medRxiv(2026.07.10.26357749),由 Angus Nicolson、Samuel Pröll、Riccardo Lunelli、Hagen Blankenburg、Peter Pramstaller、Christian Fuchsberger、Axel Bauer 和 Clemens Dlaska(Medical University Innsbruck;Eurac Research,博尔扎诺)于 2026 年 7 月提交,尚未经过同行评审。代码与权重见 GitHub。关于人工智能应用于心电图与预后评分,另见我们关于另一种在 12 导联心电图上的自监督学习、基于 MIMIC-IV 的重症死亡预测与校准的重要性,以及从可穿戴心电图预测心房颤动的解读。
编辑透明度:法文版由 Tatakoto 编辑部在阅读该预印本后撰写并署名。英文、西班牙文和中文译文在人工智能协助下产生并经审校。