从宫颈超声预测早产:为什么这些人工智能模型换一台超声机就崩溃
印度北部 GARBH-Ini 队列的一个团队与牛津大学合作,训练了多个模型(包括一个 Vision Transformer),试图从一次孕中期宫颈超声图像预测自发性早产。在内部测试中,最佳模型的 AUC 为 0.71;但在用另一台超声机采集的独立队列上验证时,它跌到 0.52,几乎与掷硬币无异。这是一个如实发表的阴性结果,它主要说明了医学影像人工智能目前还做不到的一件事:走出实验室。
背景
早产——妊娠 37 周之前分娩——仍是全球新生儿死亡的首要原因,其中一部分分娩没有可识别的诱因,称为自发性早产。提前识别高危妊娠可以采取措施(阴道黄体酮、宫颈环扎、加强监测)。如今的参考工具是在孕中期用超声测量宫颈长度:宫颈短提示风险升高。但这一指标的敏感性有限——许多最终会早产的孕妇会被漏掉。
由此产生了本研究的假设:宫颈图像也许比单纯的长度包含更多信息。组织的纹理——它的颗粒感、回声强度的微小变化——可能携带一种宫颈重塑的特征,肉眼看不见,也无法用一个距离数值概括。这正是视觉模型理应能提取的那类模式。而医学影像中有一个决定成败的问题:在一个中心的图像上有效的模型,换一台设备、换一家医院还有效吗?一个阅读提示:AUC(ROC 曲线下面积)衡量区分阳性病例与阴性病例的能力;1.0 为完美,0.5 相当于掷硬币。
方法
数据来自 GARBH-Ini,一个在印度北部随访的前瞻性妊娠队列——因此是影像文献中代表性不足的人群,这一点很重要。每位参与者都接受了孕中期宫颈超声,需要预测的结局是 37 周前的自发性分娩。团队并非只测试一种方法,而是四类,从而能在同一场地上比较经典方法与深度方法。
第一类是手工设计的纹理描述符:局部二值模式(Local Binary Patterns,LBP),它为每个像素编码其邻域的明暗模式,把图像概括为一张微纹理直方图,再由随机森林(一组按多数投票的决策树)分类。第二类是 Vision Transformer(ViT),一种把图像切成小块、并通过注意力机制学习各区域相对重要性的神经网络——如今视觉领域的主流架构。第三类仅依赖临床变量。第四类是多模态:融合图像与临床数据。
关键在于评估方案。模型首先在内部测试集(来自同一队列、预留出来的患者)上评判。随后是真正重要的考验,外部验证:模型面对一个用不同超声机采集的独立队列。这正是模拟真实部署的测试——卖给医院的工具会遇到训练时从未见过的机器、操作者和人群。
结果
在内部,信号确实存在。最佳模型达到 0.71 的 AUC(95% 置信区间:0.60–0.82),略高于单用宫颈长度的表现。也就是说,在自己队列的数据上,模型捕捉到了经典测量未能完全概括的某种东西。这正是那种在新闻稿里会变成「人工智能能预测早产」的数字。
外部验证推翻了这种解读。在用另一台设备采集的独立队列上,性能崩塌到 0.52 的 AUC(95% CI:0.38–0.64)——在统计上与随机无异。Vision Transformer 和多模态模型都没有更好:复杂度并未抵御这次下滑。一个临床高危亚组在 34 周阈值上显示出略好的判别力,但病例太少,无法得出结论。临床层面的解读直接而严峻:AUC 为 0.52 意味着在患者床旁、在一台新机器上,模型无法把将要早产者与其他人区分开。照此使用,要么会错误地安慰真正有风险的孕妇,要么会对本不需要的妊娠触发干预(环扎、黄体酮、住院)。
值得肯定之处
做了外部验证,并在失败后照样发表。绝大多数影像研究止步于内部测试,并以讨喜的 AUC 作标题。这里团队一直做到了另一台超声机上的独立队列,眼看模型崩塌,仍然如实报告。对整个领域而言,这个阴性结果胜过十个无法复现的成功:它精确指出了墙在哪里。
诚实的比较,多个模型对阵一个真正的对照。并行测试经典纹理方法(LBP)、Vision Transformer、临床模型和多模态融合,并把它们与宫颈长度——诊疗标准——相较,避免了常见的「我们的模型对阵空气」的偏倚。这也表明失败不是某一种架构的失败,而是问题本身设定方式的失败。
前瞻性队列与代表性不足的人群。GARBH-Ini 是印度北部的一项前瞻性妊娠随访,而影像人工智能研究绝大多数是在北美和欧洲数据上训练的。在这一人群中提出早产问题,并采用专门采集而非机会性数据集,是稳健的方法学选择。
不足之处
极可能存在捷径学习。从内部 0.71 到外部 0.52 的骤降,恰在更换超声机之时,正是捷径学习(shortcut learning)的特征:模型很可能学到的是训练机器的采集特征——设置、专有后处理、特有颗粒感——而非宫颈的生物学。它辨认的不是高危宫颈,而是一台设备。这是影像人工智能的核心失效模式,在此被真实地演示了出来。
生物学上异质的目标,以及在亚组上脆弱的指标。自发性早产不是单一疾病,而是一个病因多样的综合征(感染、炎症、机械因素、特发性)。指望一张宫颈图像预测所有这些轨迹,很可能不切实际。而看似最佳的结果——34 周阈值上的高危亚组——建立在很少的病例之上:这是一个具误导性的指标,一个令人鼓舞却过于不精确、不可依赖的数字。
需要牢记的证据局限。这是一篇尚未经过同行评审的预印本;外部置信区间很宽(0.38–0.64),说明验证样本量有限;只测试了另一台机器,而真正的泛化需要多个厂商、多个中心;也未宣布公开代码或权重,这暂时使得无法在别处重演这次审计。因此不能排除更稳健的训练方案可能做得更好——研究显示的是一种方法的失败,而非任务的不可能。
这意味着什么
对研究界而言,这一信息是有益的提醒:内部 AUC 再诚实,在经受住换设备的考验之前也一文不值。多机器外部验证应成为常态而非例外,像这样的阴性结果理应更常被发表。眼下展开的具体工作是硬件鲁棒性:图像标准化、模拟多台超声机的数据增强、域不变学习。
对临床医生而言,实践中没有任何改变,而这正是有用的信息:这些模型没有一个已准备好用于患者床旁。用超声测量的宫颈长度,必要时联合阴道黄体酮,仍是筛查和预防早产的参考框架。宫颈纹理人工智能在今天并不是可靠的补充。
对患者与公众而言,这一教训是对营销的解药。当一则公告承诺一款「能预测早产的人工智能」时,正确的问题不是「它有多准?」,而是「它是否在另一台设备、另一家医院、另一人群上测试过?」。本研究显示,这个问题的答案能把一款工具从有前景变为无用——也说明了为何那些拒绝过快部署的团队所持的谨慎,在这里直接保护了孕妇。
延伸阅读
预印本见 medRxiv(2026.07.17.26358221),由 Radhika Chanian、Divyanshu Mishra、Rahul Jain、Nikhil Sharma、Ashok Khurana、Reva Tripathi、Abhinav Tripathi、GARBH-Ini study group、Nitya Wadhwa、J. Alison Noble(University of Oxford)、Ramachandran Thiruvengadam、Bapu Koundinya Desiraju 和 Shinjini Bhatnagar(THSTI)于 2026 年 7 月提交,尚未经过同行评审。关于影像模型的泛化与外部验证,另见我们关于一款皮肤癌皮肤镜人工智能的外部临床验证、病理基础模型面对扰动时的鲁棒性,以及一款卒中风险模型的多中心验证的解读。
编辑透明度:法文版由 Tatakoto 编辑部在阅读该预印本后撰写并署名。英文、西班牙文和中文译文在人工智能协助下产生并经审校。