心脏手术中的PhysioFusion:将26路术中信号与STS登记库融合,在1393名患者中带来了什么变化
东北大学Roux研究所与缅因医疗中心的团队构建了PhysioFusion,一个集成模型:它把胸外科医师协会(STS)登记库的术前数据与26路术中监测信号结合起来,预测心脏手术后的并发症,数据来自同一家医院的1393名患者。交叉验证中AUC达到0.87,但仅用登记库变量也同样是0.87:术中信号在这里没有带来可测量的增益。应当把它看作一项诚实的内部研究和一个阴性发现,而不是多模态融合能改善预测的证据。
背景
心脏手术后,有相当比例的患者会出现严重并发症(本研究队列中为11.6%):呼吸机使用时间延长、卒中、肾衰竭、非计划再手术、深部胸骨伤口感染、死亡。在美国,胸外科医师协会(STS)维护着全国性登记库,每台手术都有编码,其术前风险评分是各中心之间比较的参照。这些评分只使用切开之前已知的信息。
然而,一台持续数小时的手术会产生连续的测量流:动脉压和静脉压、心电图、血氧饱和度、体温、体外循环时间。这篇论文的思路很自然:这些时间序列中含有术前变量未能捕捉的风险信号,所以把它们融合起来的模型应当预测得更好。该论文是2026年9月发布在medRxiv上的预印本,尚未经过同行评审。
方法
数据。2022年9月至2024年4月间在缅因医疗中心(MaineHealth)接受手术的1393名连续成年患者,其中161人(11.6%)发生了STS与美国国家质量论坛(National Quality Forum)认可的十一类不良事件中的至少一种,并合并为一个复合终点。静态变量来自STS数据库(年龄、既往史、心功能、手术类型、体外循环时长等)。时间序列涵盖26路术中信号。
模型。核心是一个双分支网络:静态变量使用残差网络(堆叠的模块,其输出与输入相加,使训练更稳定);时间序列使用卷积网络(检测信号中的局部模式)和双向GRU(一种从两个方向读取序列的循环网络)。此外还有四个经典模型:XGBoost(相继的决策树,每棵树修正前一棵的错误)、L1惩罚逻辑回归、支持向量机(SVM)以及两阶段梯度提升级联。各预测通过加权平均合并,再用保序回归重新校准(一条递增曲线,使“模型说20%”与“实际有20%的患者发生事件”相对应)。
验证。带随机打乱的分层五折交叉验证:数据集分成五份,每份轮流作为测试集。类别不平衡通过SMOTEENN处理(生成合成阳性样本并清除模糊样本),仅用于训练折。评估三个决策阈值:在敏感性不低于0.7时使阳性预测值最大的阈值、使F1最大的阈值,以及敏感性等于特异性的“平衡”阈值。
结果
机器学习指标。在平衡阈值下,组合模型的AUC(随机取一名发生事件的患者与一名未发生事件的患者,模型把前者排在前面的概率)为0.87(95%置信区间0.82至0.91),敏感性0.76,特异性0.83,阳性预测值(PPV)0.40,阴性预测值(NPV)0.96。校准误差为0.036。
核心结果是按模态拆分。仅用静态变量,AUC为0.87(0.82至0.92),敏感性0.74,特异性0.82,PPV 0.45,校准更好(0.023)。仅用时间序列为0.83(0.80至0.86),PPV为0.33。两者的区间几乎完全重叠:在这个队列中,融合并不比登记库数据更好。逐信号消融的结论是没有哪个监测通道不可或缺,平均动脉压和中心静脉压最难被替代。单个模型中,梯度提升为0.86,逻辑回归0.78,SVM 0.69,深度网络0.72(仅时间序列时为0.60)。
临床转化。按队列的发生率(每1000人116例事件),敏感性0.76意味着约检出88例并发症、漏掉28例。在884名无事件患者中,特异性0.83意味着约150次假警报。直接计算得到的PPV约为0.37,略低于报告的0.40,可能源于四舍五入和按折计算。实际含义是:大约三次警报中有两次是假的,略多于四分之一的并发症会被模型漏掉。0.96的NPV令人安心,但主要是因为事件本身少见:对所有人都预测“无并发症”,NPV也有0.88。
优点
如实报告的阴性结果。作者指出两种模态可以互相替代,而没有把融合说成成功。在一个常把复杂性当作价值本身来宣传的领域,这很少见,而这恰恰是考虑为手术室配备设备的人所需要的信息。
技术环节上审慎的评估方案。SMOTEENN重采样仅限于训练折,测试折保留真实的11.6%发生率;报告了三个操作阈值而不是一个;并给出了置信区间。五类模型表明结果并不取决于架构选择。
连续入组的医院数据和标准化终点。患者是连续入组的(没有挑选容易的病例),终点依据STS定义而非临时定义。文中包含无利益冲突声明。
不足
严格的内部验证(人群与中心偏倚)。只有一家医院、161例事件,没有外部或时间上的验证:交叉验证衡量的是同一批患者、同一间手术室、同一批监测设备上的表现。作者自己承认事件数少对高容量模型不利,这解释了深度网络得分较差(0.72),但这也意味着架构之间的比较,对更大数据集会出现什么结果说明不多。
缺失的对照(因遗漏而产生的有偏对照)。我们查阅的文本中没有应用任何已确立的STS风险评分。而这才是关键的对照:AUC为0.87的模型是否优于外科医生手头已有的评分?内部对照只是集成中的组成部分,不是临床参照。缺少这一点,就无法判断该模型是否优于现行做法。
信息泄漏风险和需谨慎解读的指标(数据泄漏、误导性指标)。“平衡”阈值是在被评估的预测上选定的,保序校准则拟合在模型预测上;我们查阅的文本没有说明这两步是否与测试折严格分开,如果没有,敏感性、特异性和校准都可能偏乐观。在11.6%的发生率下,AUC为0.87对应的PPV为0.40:多数警报会是假的。由十一类高度异质的事件组成的复合终点(死亡与再手术的机制和预防方式都不同)也使有针对性的临床行动变得复杂。最后,代码和数据仅可应要求获取。
意义
对研究界。这篇论文提供了一个有用的检验案例:在一个规模不大的单中心队列中,原始术中信号对填写完整的登记库没有增益。接下来的问题是:患者更多、有外部验证、信号表示设计更好(例如在大量监测数据上预训练)时,这一结论是否仍然成立,而不是在161例事件上堆叠更多网络。
对临床医生。实践中没有任何改变:该模型没有在本中心之外验证,没有与STS评分比较,也没有前瞻性评估。不过它提醒我们,术前登记库已经包含了大部分可预测的信号,这意味着在投资新的传感器或数据流之前,应先提高数据录入质量。
对患者和公众。这些模型不能取代手术团队的判断。一个警报三次只对一次的工具仍然只是团队的分诊辅助,而不是针对个人的结论,患者在短期内也不应期待手术室里的“智能”监护。
延伸阅读
论文(预印本,未经同行评审):PhysioFusion: A Multi-Modal Ensemble using Static Preoperative Variables and Time Series Intraoperative Data to Predict Adverse Events Following Cardiothoracic Surgery,Rajashekar Korutla、Anne Hicks、Marko Milosevic等(Roux Institute, Northeastern University;Spectrum Healthcare Partners;Maine Medical Center, MaineHealth),medRxiv,2026年9月,DOI 10.64898/2026.09.24.26363920。代码与数据:可向通讯作者提出申请,并需签署数据使用协议。作者声明无利益冲突;在我们查阅的文本中未找到资助信息。
关于仅用极少事件训练的模型,参见我们关于肝细胞癌早期复发研究的解读。关于单中心临床预测模型,参见我们关于Mohs手术研究的解读。