不汇集数据也能训练病历模型:以122 251例重症监护住院验证联邦学习

Michael Burkhart、Brett Beaulieu-Jones 及其同事检验了一个具体问题:能否在从不把多家医院的数据汇聚到一处的前提下,训练出病历"基础模型"(foundation model)?基于来自三个独立医疗系统的122 251例重症监护住院与十二项预测任务,他们的生成式事件模型在医院之间的迁移表现远优于传统模型(AUC惩罚为0.025点,而非0.079),且联邦学习几乎追平了集中式训练。但最有价值的发现却反直觉:汇集数据相比纯本地训练仅带来微小提升,而且随着每家医院积累自身数据,这一优势逐渐消失。

背景

病历基础模型是在海量健康数据上预训练的模型,旨在产生可复用的表示,服务于众多临床任务——预测病情恶化、死亡、再入院——而无需每次从头开始。这一思路借鉴自大语言模型的成功,却在医疗领域遭遇两大众所周知的障碍。

其一是数据孤岛。病历分散在各家医院彼此独立的信息系统中,受医疗保密与严格法规保护(欧洲的GDPR、美国的HIPAA)。把多家医院的数据实际汇集起来训练单一模型,在法律上十分繁重,有时根本不可能。其二是迁移时的性能下降:在一家医院训练的模型,往往在另一家医院表现明显更差,因为人群、编码习惯、设备与用药实践各不相同。这正是人群偏倚失效模式,在医疗AI中无处不在。

联邦学习(federated learning)提供了一条优雅的出路:不是把数据搬向模型,而是把模型搬向数据。每家医院在本地训练,然后只共享学到的参数——从不共享病历本身。中央服务器汇总这些更新,再返回一个改进后的模型。其承诺是双重的:既享受多中心合计的数据规模,又把数据留在本地。问题在于它是否真的有效,尤其是这番折腾是否值得。这正是本项工作所要检验的。

方法

作者汇集了来自三个独立医疗系统122 251例重症监护住院,统一到 Common Longitudinal ICU Data Format(CLIF,重症监护纵向数据通用格式),这是一个由学术重症医学联盟维护的通用格式。这种统一是基础前提:没有共享词汇,比较医院就如同比较不同的语言。

方法的核心是生成式事件模型(generative event model, GEM)。原理是:把一位患者的病史拆解为一串"词元"(token)——每一项化验、每一种药物、每一个生命体征都成为一个离散符号,就像文本被拆解成词语。模型随后以语言模型的方式,学习根据既往事件预测下一个事件。通过学会"讲述"患者的病程轨迹,它构建出内部表示,进而可以接到具体任务上。这里是十二项入院24小时之后的预测任务:用住院最初24小时的数据,预判更晚发生的事件或结局。

实验的巧妙之处在于比较四种训练方案,构成一个真正的矩阵。站内(within-site):在同一家医院训练并测试(基准)。跨站(cross-site):在一家医院训练、在另一家测试——这是对可迁移性的直接度量。集中式:把所有数据汇集起来,仿佛壁垒不存在(理论上限)。联邦式:在从不汇集数据的前提下训练,采用两种经典算法——FedAvg(联邦平均:各站本地训练,服务器对权重取平均,如此在若干"通信轮次"中循环)及其带服务器端惯性(momentum)以稳定聚合的变体 FedAvgM

比较对象是 LightGBM,一种梯度提升决策树模型——临床表格数据中扎实且难以超越的基线。性能以 ROC-AUC(ROC曲线下面积:模型把一个正例排在一个负例之上的概率)与 PR-AUC(精确率-召回率曲线下面积)报告,后者在待预测事件稀有时更为诚实——而重症监护中大多数严重结局正是如此。

结果

第一项发现:生成式事件模型取得了最高的平均ROC-AUC,无论站内还是跨站。尤为重要的是,它们的可迁移性强得多。当把模型从一家医院搬到另一家时,其性能会下降——这就是"跨站惩罚"。对GEM而言,该平均惩罚为0.025点ROC-AUC0.027 PR-AUC;对LightGBM则升至0.079与0.089。换言之,换一家机构时,提升树损失的性能约为其三倍。生成式模型更能扛住"水土不服"。

第二项发现:联邦学习是有效的。FedAvg 与 FedAvgM 逼近了集中式训练——那种能看到全部数据的方式——的性能,而且大部分收益在5到10个通信轮次内即可获得,使整个过程在网络传输上成本很低。于是,几乎能获得汇集数据的好处,却从不把数据移出医院。

第三项发现,也是最有意思的:这种汇集数据的好处是微小的。集中式多中心训练只比纯本地训练略好一些。而且其优势集中在意料之中的地方——当一家医院本地数据很少时——随后随着该院积累自身病历而逐渐缩小。诚实的临床转译是:对于一家已拥有数万例住院的大型中心,去获取邻院的数据几乎毫无增益。测量上的困难值得强调:0.025点的AUC惩罚很小,但其真实影响——有多少患者被更好或更差地分类——完全取决于任务与事件频率,而这两点摘要并未逐项拆分。

值得肯定之处

一个矩阵式的实验设计,少见而干净。明确比较站内、跨站、集中式与联邦式,可以分离出每一块各自的贡献——一边是可迁移性,另一边是汇集数据的收益。许多论文只是宣布"联邦有效";这一篇则拆解了机制,说清收益在哪、又不在哪。

可量化、具体的可迁移性。0.025对0.079这一结果并非空泛的赞美:它是在真实数据上对"换医院的稳健性"的直接度量。证明一个词元化生成式模型的迁移能力比扎实的提升树好三倍,是一项具体贡献,对任何需要把模型部署到本院之外的人都有用。

公布负面结果的诚实。与"数据越多越好"的时代氛围相反,作者公布了汇集数据只带来微小帮助、且越来越少。点名真正的瓶颈——学习真正可迁移的表示——而不是过度兜售联邦这套装置,正是严肃工作应有的姿态。

不足之处

为一套沉重装置换来的实际收益却很单薄。联邦学习在技术上很有吸引力,但若多中心优势本就很小、又随本地数据积累而消退,那么整套基础设施(协调、通信轮次、跨院治理)的成本效益,对大型中心而言就变得可疑。论文对此坦诚呈现,但由此得出的结论——联邦主要惠及小型机构——大大冷却了热情。

核心问题依旧悬而未决。跨站惩罚并非为零,作者自己也点出了真正的挑战:产生能在异质系统之间迁移的表示。这正是未被解决的人群偏倚。只要搬动一个模型仍要付出性能代价,"通用病历基础模型"的承诺就仍是一个方向,而非既成事实。

刻意收窄的范围,以及被断言却未经压力测试的隐私保护。研究是回顾性的,仅限于重症监护、三个系统,以及纯粹的机器学习指标(ROC-AUC、PR-AUC),没有临床转译——没有校准、没有净获益、没有需治疗人数,也没有任何床旁的前瞻性检验。最后,联邦的隐私论点被当作既定事实呈现:然而"数据不动"并不等于"没有泄露"。共享的参数在某些情况下可能泄露关于患者的信息(推断攻击、梯度泄露)。论文并未触及这一战线,而在任何部署之前都必须加以处理。

它改变了什么

对研究界而言,这项工作把正确的问题往前推了一步。人们不再只问"能否在不汇集数据的情况下训练?"——答案是能,且网络成本低——而是问"能否学到真正能在不同系统间迁移的表示?"。词元化生成式模型与联邦相结合,成为支撑这一研究的可信基石,并附带可复用的比较对象与评估矩阵。

对临床医生与数据治理而言,讯息是间接却有力的:不必集中病历,也可能获得多中心模型的大部分收益。这为合规与医院数据主权提供了有力论据。今天没有任何东西可以在床旁部署,但这一方向对于负责裁断此类抉择的信息部门与伦理委员会而言至关重要。

对患者与公众而言,有两点值得记住。其一,你的重症监护数据可以在不离开你就诊医院的情况下,帮助改进模型——这是对"共享数据"顾虑的一个具体回应。其二,"医院分享得越多越好"这一直觉需要打折扣:超过某个本地数据量之后,其他中心的贡献就变得微乎其微。原始规模并非一切;真正要紧的,是模型在被换到新环境后仍能保持良好表现的能力。

延伸阅读

预印本见 arXiv (2608.02939),于2026年8月3日提交(类别 cs.LG 与 cs.CY)。详细的资助与利益冲突声明见正文。作为背景,可参阅重症监护通用数据格式 CLIF(Common Longitudinal ICU Data Format)、联邦学习的原理与 FedAvg(联邦平均)算法、病历基础模型与临床事件词元化的思路,以及在稀有事件下 ROC-AUC 与精确率-召回率 AUC 之间的区别。