用一周的手腕运动预测未来疾病:两个加速度计foundation model在UK Biobank里真正读到的是什么

斯坦福与丹麦的一个团队(成员包括James Zou和Emmanuel Mignot)用两个冻结的foundation model,把UK Biobank中97 696名参与者一周的手腕运动编码,再训练一个生存模型一次性预测390种未来疾病。平均一致性达到0.688,一个"你动得多不多"的单一轴解释了76%的预测风险,并清晰地浮现出帕金森病的前驱期特征(五年AUROC 0.90,基于428例)。但一切都建立在单一且不具代表性的队列上,没有外部验证,而且编码器正是在这批数据上预训练的。

关于背景

手腕加速度计——智能手表里那个沿三个轴测量手臂加速度的传感器——已无处不在。佩戴一周便可记录身体活动、睡眠以及与呼吸相关的细微振荡。十年来我们已知低活动水平能预测死亡率;但一周的运动对于罹患某一种具体疾病的风险究竟说明了什么、在整个"表型组"(一个人所有疾病的完整范围)上又如何,我们所知甚少。以往在UK Biobank(拥有50万名志愿者的英国大型队列)上的工作,大多只提取活动摘要(中等强度活动分钟数、久坐时间),或每种疾病单独训练一个模型。本预印本提出的问题是:能否把一周原始信号转化为一种可复用的表示,同时预测数百种疾病?

关于方法

研究动用了两个"foundation model"——在大量无标注数据上预训练、随后可复用于多项任务的神经网络——两者此前均由同一团队开发,并保持冻结(其权重在此不再微调)。它们通过自监督(模型在没有人工标注的情况下学习重建信号中被遮蔽的部分)在约109 000份UK Biobank记录上训练。第一个名为HA(Human Activity),是一个基于transformer的掩码自编码器——transformer这种架构在处理序列时会对各元素的相对重要性加权——它把信号切成10秒的窗口并重建频谱图(把运动分解为各频率成分),针对日间行为。第二个名为AcceleRest,在30秒窗口上工作,采用与呼吸幅度相关的目标,针对睡眠和心肺信号。两者各自为每个窗口输出一个256维的向量表示(embedding)。

数据来自UK Biobank的加速度计子研究:一台Axivity AX3佩戴在优势手腕上连续七天,采样率100 Hz。经质量控制后保留97 696名参与者(56%为女性,平均年龄62岁,标准差8),按参与者不重叠地分为训练集87 652人、验证集4 772人、测试集5 272人。住院诊断(ICD-10编码)和死亡原因被归入"phecode";其中患病率至少达0.30%的389个phecode,加上全因死亡率,构成待预测的390个结局。在每日表示(先压缩、再拼接为1 536维向量)之上,训练一个生存模型(预测的不是标签,而是疾病出现前的时间):一个在三天窗口上滑动的transformer,采用多标签Cox损失(生存分析的标准模型,此处扩展到同时处理390种疾病)。加入年龄和性别,并对四个不同随机种子的模型取平均。性能以一致性(C指数)衡量:在0.5到1之间,模型给先发病的患者赋予更高风险的概率。

关于结果

在5 253名测试参与者上,388个可评估结局的平均一致性为0.688(95%置信区间0.679–0.697)——表面看并不高,但在每个类别上都高于随机。全因死亡率达0.767。最引人注目的结果是结构性的:一个单一的轴——在去除年龄和性别的影响后,寻找预测风险的主方向而得——解释了风险方差的76%,且几乎所有疾病都正向地投影其上(97%为正载荷)。换言之,手腕所捕捉到的绝大部分是一条一般性的"健康/活力"梯度——动得越多,几乎对所有疾病的风险都越低。作者称之为SHARC,并表明它主要与运动强度(加速度的第95百分位数,相关−0.52)和BMI(0.48)相关。

但不止于此。在这个共享轴之外,针对具体疾病的评分在101个病例充足的结局中,有85个进一步提高了区分度。增益最明显的是神经退行性疾病。在测试集上,帕金森病的一致性达0.91(仅25个新发病例),阿尔茨海默病达0.85(15例)。在全队列上(功效更高的"out-of-fold"分析,428个帕金森病病例,至诊断的中位时间为4.9年),随时间变化的AUROC——在给定时间范围内计算的ROC曲线下面积——为五年0.90(置信区间0.873–0.923)、七年0.87。为排除反向因果关系的关键一步:"lead-time washout"(剔除佩戴后三年内确诊的病例,以核查模型是否已在读取既成的运动症状)之后,七年AUROC仅从0.872降至0.849。因此该信号看来是前驱性的——先于诊断——而非已发疾病的简单映照。该模型甚至胜过一个已发表的、专为帕金森病定制的模型(前驱期平均精度0.18对0.07)。

此处的临床解读不可或缺。对一种仅影响队列0.44%人群的疾病,0.90的AUROC并不是诊断检测。标记出风险最高的那10%参与者可捕获77%的未来帕金森病——但这10%将近9 700人,其中绝大多数永远不会患病。在前驱期设定下,平均精度为0.18:用于丰富试验队列有用(是基线患病率的61倍),用于安抚或警示某个个体则无用。这就是筛查一个人群与诊断一个人之间的区别。

做得好的地方

真实的规模与广度。97 696名参与者、由单一模型从冻结且可复用的embedding出发预测390种疾病:新增一种疾病的边际成本为零,且一周佩戴即足够。这可信地证明了手腕原始信号编码了广泛的健康信息,远超通常提取的活动分钟数。

诚实的对照。与许多只展示最佳指标的研究不同,作者与恰当的基线较量:仅年龄+性别+BMI为0.639,对UK Biobank标准活动摘要做回归为0.577,仅手腕为0.684——加入年龄和性别只带来+0.005。他们更进一步,表明年龄、性别和BMI本身可从embedding中重建(性别AUROC 0.997,年龄r 0.852),这是对潜藏于表示中的混杂因素难得的坦诚。

经过审慎检验的前驱期信号。三年washout、内部地理复现(留一地区法,0.65–0.67)、报告的校准(中位斜率1.03)和决策曲线分析,都显示这是一个在积极尝试推翻自身结果、而非兜售结果的团队。帕金森病特征在washout后仍然存在,是本文最有意思的发现。

做得欠佳的地方

没有外部验证——且可能存在表示层面的泄漏。一切都依赖UK Biobank。而两个编码器正是在同一批记录上预训练的:只有疾病标签被留出,表示本身并未留出。模型从未见过另一种设备(科研级的Axivity AX3既不是Apple Watch也不是Fitbit)、另一群人、另一套编码系统。而外部验证恰恰是让大多数IA-医疗模型崩塌的那一步,此处正缺失;作者也明确承认了这一点。

严重的人群偏倚。UK Biobank是健康志愿者偏倚的典型:参与者比一般人群更受过教育、更富裕、更健康,很少有极年轻或极年长者。佩戴传感器七天的要求进一步剔除了病情最重的患者——以至于在这个队列中,记录在案的痴呆比帕金森病还罕见,与现实恰好相反。此外,结局仅来自住院和死亡登记:约一半的痴呆和39%的卒中只在基层医疗中编码,因而漏出统计,低估了病例并使区分度产生偏差。

一个看起来像体能的单一轴。预测风险的76%系于一条与运动强度和BMI相关的单一梯度,这提醒我们要谨慎:对390种疾病中的大多数,模型主要重复的是"体能好的人更少生病",这是有用但不具特异性的道理,且部分与年龄和体型(embedding已编码之)相混杂。真正的新意——具体的、尤其是神经退行性的特征——所依据的病例数有时极小(测试集中帕金森病25例、阿尔茨海默病15例),因而置信区间很宽。最后,权重和数据均不可共享(UK Biobank政策),代码也只承诺在发表时公开:即时可复现性为零。

它改变了什么

对研究界而言,把冻结、可复用的加速度计embedding作为覆盖全表型组的底座,这一想法很有吸引力,很可能会流行开来。下一步必不可少的是在消费级设备和非英国队列上验证——否则泛化性仍只是假设。而帕金森病的前驱期特征,值得做前瞻性检验:作为丰富临床试验的工具(识别高风险人群以测试神经保护药物),而非作为个体检测。

对临床医生而言,今天什么都没有改变。没有哪块手表能据此"检测帕金森病";所展示的是,一周的运动在一个非常特殊的人群尺度上包含一个统计性的风险信号。人群与个体之别在此绝非学术空谈。

对患者和公众而言,有两点。第一:你的手腕对你未来健康所"知道"的,有一部分不过是你总体的体能,年龄和体型也包含在内。第二:在一种罕见病上取得亮眼的AUROC并不允许对个体发出任何警报——在被标记的10%里,几乎没有人会真正患病。

延伸阅读

预印本《Dual foundation models for accelerometry predict future health》可在 medRxiv(10.64898/2026.07.24.26358894)获取,作者为Marcus Dige、Niels R. Lorenzen、Magnus Ruud Kjær、Angus Burns、Poul Jennum、Emmanuel H. During、James Zou、Emmanuel Mignot和Andreas Brink-Kjaer(斯坦福大学Sleep Medicine与Biomedical Data Science;丹麦技术大学;Rigshospitalet;西奈山Icahn医学院;哈佛医学院)。研究在UK Biobank Application 62249下进行,经NHS North West Multi-centre Research Ethics Committee伦理批准;无申报利益冲突;许可为CC BY-NC-ND 4.0。数据与权重不可共享(UK Biobank政策),代码宣布将于发表时公开。关于医学foundation model、自监督与风险预测,参见我们关于医学foundation model的表示收敛、关于以掩码自编码器的重建误差作为死亡率预测指标,以及关于帕金森病的遗传学预测的解读。

编辑透明度:法文版由Tatakoto编辑部在阅读预印本后撰写并署名。测试集上帕金森病的一致性基于极少的病例数(25例);五年0.90的AUROC来自对整个队列的out-of-fold分析(428例)。英文、西班牙文和中文译本在人工智能协助下生成并经过校对。