ICU 革兰阴性菌血症预测:三个冻结模型经前瞻性验证,表现不如一个四项床旁评分
伊斯坦布尔 Şişli Hamidiye Etfal 教学与研究医院的感染科与重症医学科团队,把本院此前开发的三个用于预测 ICU 革兰阴性杆菌菌血症的机器学习模型整体冻结——不再训练、不调阈值、招募期间对模型输出完全屏蔽——然后在 289 份连续血培养上做前瞻性验证。三个模型的 ROC 曲线下面积(AUROC)都只有 0.61,低于 Pitt 菌血症评分(0.63)和 quick Pitt 评分(0.64);后两者在床边三十秒即可算出,不需要任何计算机。摘要中突出的 0.70 来自一个只有十六个事件的亚组,方法部分称其为预先设定、摘要部分称其为事后分析;而表现最好的模型,其校准曲线显示第八风险十分位的菌血症发生率只有第七十分位的三分之一。
背景
在 ICU,菌血症(血液中存在活菌)靠血培养确诊,而血培养需要二十四到七十二小时。在这段空窗期里,重症医生只能独自决定:用不用抗生素、用哪一种、覆盖多宽的谱。每延误一小时合适治疗都会增加死亡风险,尤其是肠杆菌目(Enterobacterales)的革兰阴性杆菌。因此,"在血培养出结果之前就预测血培养结果"这个想法由来已久。
目前已有两类工具,各司其职。严重程度评分——SOFA、SIRS、NEWS-2——衡量的是器官衰竭和炎症反应的幅度,它们是为脓毒症分层设计的,不是为了猜血培养。菌血症专用评分——Pitt 菌血症评分(PBS)及其简化版 quick Pitt(qPitt)——是为了在菌血症已经确诊之后预测死亡率而设计的。五个评分没有一个是为本研究评估的这项任务设计的。
与之相对,关于脓毒症和菌血症的机器学习文献非常多,但存在一个结构性缺陷,作者自己也引用了:在 ICU 数据上开发的模型中,只有 6% 到 14% 做过外部验证,而且一旦做了,性能几乎总是下降。伊斯坦布尔团队此前已发表三个基于本院 ICU 常规数据回顾性训练的模型。这篇论文是下一步,也是几乎没人迈出的一步:原封不动地拿到真实条件下去检验。
方法
前瞻性设计,模型锁定。单中心观察性研究,2025 年 2 月 1 日至 7 月 31 日,在 Şişli Hamidiye Etfal 的成人 ICU 进行。纳入条件:年满 18 岁、入 ICU 至少 48 小时、且符合 Sepsis-3 对可疑感染的定义后采集的血培养。Sepsis-3 的这一定义是:在开始抗生素治疗后 24 小时内采集培养,或在采集培养后 72 小时内开始抗生素治疗。这个筛选条件很重要,后面还会提到:它把分析限制在临床医生确实怀疑有问题的病例上。
共连续收集 323 份血培养。排除 17 份真菌血症、15 份革兰阳性菌血症和 2 份不符合纳入标准的革兰阴性菌种,剩下 289 份样本:192 份培养阴性,97 份革兰阴性菌血症,患病率 33.6%。101 株分离菌中以肺炎克雷伯菌(56.4%)、鲍曼不动杆菌(15.8%)和铜绿假单胞菌(11.9%)为主;74.3% 对碳青霉烯类耐药,39.6% 对黏菌素耐药。感染来源中呼吸道占 61.9%。
三个模型。一个随机森林(Random Forest,即由多棵决策树投票组成的森林),以及两个混合效应变体:BiMM(二元混合模型)和 MERF(混合效应随机森林)。"混合效应"是指在模型中为每个患者加入一个专属项,从而正确处理同一个人的多次重复测量,而不是把它们当作彼此独立——这在本研究中很关键,因为每位患者贡献的是 48 小时的生命体征与化验轨迹。
这次验证为何可信。模型是原样应用的:相同的预测变量、相同的观察窗口,没有重新训练,没有调超参数。决策阈值沿用开发研究训练集上由 Youden 指数确定的数值,未做任何重新校准。招募期间无法查看模型输出,所有分析都在数据采集结束后才进行。这就是一次干净的时间性验证该有的样子。
对照。ΔSOFA ≥ 2、SIRS ≥ 2、NEWS-2 ≥ 5、PBS ≥ 6、qPitt ≥ 3,以及按 Sepsis-3 标准的脓毒症诊断,全部采用预先设定的切点。数据取自采血前 48 小时,统一以上午 10 点为参考时刻以减少日内波动,采用完整病例分析。分析使用 R 4.4.1,并按 TRIPOD 和 STARD 清单报告。研究在 ClinicalTrials.gov 注册,编号 NCT07126106——注册日期为 2025 年 8 月 17 日,也就是数据采集结束后的第十七天。
结果
在完整队列中,模型输了。三个模型的 AUROC 都是 0.61,而 qPitt 为 0.64,PBS 和 NEWS-2 为 0.63,ΔSOFA 为 0.62。平衡准确率(敏感性与特异性的平均值,用于校正类别不平衡)在模型中为 60% 至 61%。特异性偏低,为 43% 至 50%;阳性预测值在 41%–42% 左右。模型中敏感性最高的是 BiMM(78%),但 PBS 达到了 93%。
在亚组中所有工具都提升了,而评分提升得更快。限定在 ICU 第 4 至第 10 天采集的血培养,分析涵盖 89 份样本、16 例菌血症。模型 AUROC 升至 0.69–0.70,平衡准确率升至 68%。但 PBS 达到 0.77,qPitt 达到 0.76。切点为 6 的 PBS 捕获了 100% 的菌血症;BiMM 和 MERF 敏感性达到 90%;随机森林选择了权衡的另一端,特异性 74%、敏感性 63%。
MERF 的校准是坏的。作者按预测风险把患者分成十分位,并统计每一层中实际发生的菌血症。前七个十分位的发生率稳步上升,随后从第七十分位的 58.8% 跌至第八十分位的 17.2%,之后虽有回升,却再也没有回到第七十分位的水平。换句话说,模型判定风险最高的那批患者,实际菌血症比例反而低于它排在中游的患者。
没有预先使用抗生素时,模型什么也预测不了。一项探索性分层分析按采血前是否使用过抗革兰阴性菌药物划分队列。在 65 名未暴露患者中,三个模型的 AUC 为 0.49 至 0.53——相当于随机猜测。在 224 名已暴露患者中,三者都回升到 0.65。而开发队列中大约 70% 的患者在采血时已经在用抗生素。
临床换算。以主队列中的 MERF 为例,按 33.6% 的患病率折算到 1000 份血培养。模型大约会报警 620 例,其中 255 例确实是革兰阴性菌血症,365 例不是,另有 81 例被漏掉。也就是说,五次报警里有三次是假的,四例菌血症里有一例被漏过。在亚组中患病率降到 18%,90% 的敏感性代价更高:每 1000 份样本约有 605 次报警,对应 162 例真实菌血症,接近三次假警对一次真警。敏感性 100% 的 PBS 在这一点上更差:其 32% 的特异性对应的阳性预测值只有 24%。在一个 74% 分离菌对碳青霉烯类耐药的科室里,每一个假阳性都意味着一次可能升级到黏菌素或末线 β-内酰胺类的用药。
一个藏在表 1 里的有用阴性结果。C 反应蛋白(181 ± 92 对 175 ± 85 mg/L,p = 0.6)、降钙素原(11 ± 27 对 7 ± 22 ng/mL,p = 0.2)、体温(两组均为 37.2 °C,p = 0.4)和白细胞计数(p = 0.070),都无法把菌血症患者与其他患者区分开。真正有区分度的是:年龄(71 ± 17 对 67 ± 16 岁,p = 0.046)、有创机械通气(84% 对 69%)、中心静脉导管(76% 对 64%)、血管活性药,尤其是此前三十天内分离出过革兰阴性菌(57% 对 34%,p < 0.001)。患者的微生物学史胜过炎症标志物。
做得好的地方
模型是真正被冻结的,这很少见。没有重新训练,没有事后寻找最优阈值,开发研究的 Youden 切点原样沿用,整个采集期间对模型输出保持屏蔽。相反的做法——在验证队列上重新调阈值,然后把结果称作"验证"——是这个领域最普遍的原罪,会机械地抬高性能数字。本研究的方案不给这种回旋余地。这正是 0.61 这个数字可信的原因,也和固定阈值跨国迁移所暴露的是同一个问题。
对照选得诚实,而且对照赢了。作者本可以只拿 SIRS(五个评分中最弱的一个,AUROC 0.57)来比较,然后宣称模型更优。但他们把 PBS 和 qPitt 放进了同一张表,眼看它们在两个队列中都击败了自家模型,并且照实写了出来。表 3 的这一行是全文信息量最大的结果,而它对作者本人不利。
验证人群的定义站得住脚。通过把分析限制在符合 Sepsis-3 可疑感染定义的病例上,作者排除了那些根本没人怀疑菌血症的患者——而在许多既往研究中,正是纳入这类患者人为抬高了特异性,作者对此有明确指出。此外还可以加上:他们公布了与自家模型相矛盾的十分位校准曲线,并提交了完整的 TRIPOD 和 STARD 清单。
做得不够好的地方
被突出的结果只建立在十六个事件上,而它的身份在不同页面上不一致。第 4 至 10 天亚组包含 89 份样本、16 例菌血症。只有十六个事件时,AUROC 的不确定性非常大——而表 3 中无论模型还是评分,都没有任何一个数值附带置信区间。更尴尬的是:方法部分把这个亚组描述为"预先设定",摘要却称其为"事后"。两者不可能同时为真;而研究在 2025 年 8 月 17 日、即采集结束后第十七天才在 ClinicalTrials.gov 注册,也无法澄清这一点——回顾性注册无法防范注册本身理应防范的任何偏倚。这是典型的误导性指标失效模式:摘要里唯一出现的数字,恰恰来自最有利、样本量最小的那一层。
结局标签被治疗污染了。78% 的患者在采血时已经在使用抗革兰阴性菌药物,而且这种暴露在培养阴性组中更常见(82% 对 69%,p = 0.022)。因此,一部分"阴性"很可能是被抗生素灭菌了的菌血症:模型是在一个带噪声的参考标准上被打分的,这与其他研究中记录的从临床常规中提取标签的问题完全一致。作者承认了这一点,但他们对分层分析的解读值得反过来看:他们的结论是模型"更适合"已接受治疗的患者。同一组数据还有另一种读法——在 65 名未暴露患者(也就是标签最可靠的那组)中,0.49 至 0.53 的 AUC 意味着模型毫无区分能力。表面上的信号只存在于参考标准最可疑的地方。模型捕捉到的究竟是感染,还是一条处方轨迹,这个问题并未解决。
校准问题否定了人们最想让模型做的那件事。第七到第八十分位之间从 58.8% 跌到 17.2%,这不是精度不足,而是次序倒置。模型的用途恰恰是把患者按风险从高到低排序,以决定先治谁;如果最高十分位的患病比例还低于中间十分位,这个排序就无法承载任何决策。作者提出可能是某些变量权重过大,并暗示中段区间或许仍然可用。这个假设合理,但没有被检验,而且文中没有报告任何标准校准指标——斜率、截距或 Brier 评分都没有。同样的盲区在重症监护的报警策略中已被指出过。此外还有样本层面的限制:单中心、没有事先做样本量计算、采用完整病例分析,以及一个几乎无法迁移到西欧的本地流行病学背景——74% 的碳青霉烯类耐药率。
这意味着什么
对研究界而言,这篇论文的价值恰恰在于它没有发现什么。它用一套很少有团队肯自我施加的方案,记录了锁定模型在开发性能与真实条件性能之间的落差。作者自己做的对比很有启发:Bhavani 等人在 252 569 名住院患者中得到 0.78 的 AUROC,Ming 等人在 20 850 名患者中得到 0.97;但在后一项研究的医院获得性菌血症亚组里,AUROC 回落到 0.64,与伊斯坦布尔的 0.61 相当接近。在已经使用抗生素、已经被耐药菌定植的患者中预测 ICU 获得性菌血症,似乎本质上就比预测入院时的菌血症更难。这项工作开启的方向与其说是算法的,不如说是方法学的:只要"血培养阴性"这个标签取决于患者接受了什么治疗,任何架构都解决不了问题,必须显式地处理它。
对临床医生而言,实用结论对这个领域来说并不好听,但很清楚。在这个队列里,Pitt 菌血症评分和 quick Pitt——五项和四项、在床边心算即可、免费、不需要任何信息系统——胜过三个喂了四十八小时生命体征与化验数据的机器学习模型。目前没有任何依据支持为这项任务部署算法工具。而且被评估的九个工具(无论模型还是评分)没有一个的阳性预测值超过 42%:单凭一次阳性信号永远不足以启动抗生素升级,在耐药背景下尤其如此,因为升级意味着黏菌素或末线 β-内酰胺类。真正可以直接带到床边的结果其实不是模型:而是"此前三十天内分离出过革兰阴性菌"这一项,其区分能力优于 C 反应蛋白、降钙素原、体温和白细胞——后面这四项完全没有区分能力。
对患者和公众而言,有两个数量级值得记住。论文中常被称为"中等"的 0.70 AUROC,并不意味着模型十次里对七次:它的含义是,如果随机抽取一名菌血症患者和一名非菌血症患者,模型有 70% 的概率把更高的风险给对了人。而在这里,一次阳性报警大约四次里有三次是错的。这是把工具调到"不漏掉任何重症"时要付的常规代价——这个代价以广谱抗生素、药物不良反应和对耐药菌的选择压力来支付。
延伸阅读
论文:Prospective validation of machine learning models predicting Gram negative bacteremia in ICU versus clinical scores,npj Digital Medicine,2026 年 9 月 14 日发表,DOI 10.1038/s41746-026-03239-4,以 CC BY-NC-ND 4.0 许可开放获取。作者:Ahmet Doğukan Bayrak、Olcay Dilken、Gizem Çamkerten、Hakkı Meriç Türkkan、Ceren Atasoy Tahtasakal、Mustafa Altınay、Dilek Yıldız Sevgi、İlyas Dökmetaş 和 Okan Derin——分别来自 Şişli Hamidiye Etfal 医院(伊斯坦布尔)感染科与重症医学科、Yıldız 技术大学统计系、鹿特丹 Erasmus MC 成人重症监护科,以及伊斯坦布尔 Medipol 大学流行病学博士项目。
注册:ClinicalTrials.gov NCT07126106,2025 年 8 月 17 日提交。伦理批件号 2880,由 Şişli Hamidiye Etfal 医院伦理委员会于 2025 年 1 月 14 日批准,患者本人或其法定代理人均签署了书面知情同意。TRIPOD 与 STARD 清单作为补充材料提供。
数据与代码:去标识化数据集和分析代码均未存放于公开仓库,作者声明二者可在合理请求下向通讯作者索取。分析使用 R 4.4.1。作者声明未获得外部资助,且无利益冲突。
三个模型的开发研究由 Dilken 等人完成,主题是重症监护中的短期临床与化验轨迹。文中引用的对照工具:Pitt 菌血症评分(Al-Hasan 与 Baddour,Clinical Infectious Diseases,2020)、quick Pitt 评分(Battle 等人,Infection,2019),以及 Sepsis-3 定义(Singer 等人,JAMA,2016)。