证据与病历之间的落差:当十七个大模型必须自己从真实孕期病历中找信息时,它们失去了什么
复旦大学及其附属妇产科医院的团队构建了 ObGynLongBench,这是一个包含 1 500 个决策点的评测集,取自 976 份真实的孕期电子病历,每道题都锚定在一个具体日期,该日期之后的全部记录被删除。在同一批题目上,十七个语言模型在被直接提供相关证据时的正确率为 58.7 % 至 79.1 %,而当它们必须自己在病历中查找证据时仅为 41.3 % 至 68.7 %——作者称这一 7.6 至 22.7 个百分点的落差为"Evidence-to-EHR Gap"(证据到病历的落差)。这个发现是真实的,统计处理也很讲究,但该基准既没有人类参照成绩,也没有"不给病历"的对照条件,而且它的标注是由它所评测的同一批模型家族生成的。
背景
三年来,评判医学语言模型的标准尺度一直是多项选择题:USMLE、MedQA、PubMedQA 及其各专科变体。这种形式有一个优点——客观且可复现——也有一个随着分数攀升而日益突出的缺陷:题目送到模型面前时,临床情景已经被撰写好、筛选好、概括好了。该看的内容就在那三百字里,别无干扰。但临床医生做的不是这件事。临床医生打开的是一份病历。
电子病历冗长、重复、次序混乱,而且其中绝大部分信息与当天的决策毫无关系。在这个队列中,单个产科决策点之前平均有 479 项化验结果、82 次生命体征记录、25 份临床记录、6 份超声报告和 3 条用药记录。一份随访孕期病历的中位跨度为 184 天。全部串联起来,平均约为 30 800 个词元(模型切分输入文本的单位,大致相当于词的片段),标准差为 19 800——远多于一份考试情景题,又远少于近期模型所宣称的上下文窗口。
因此这个团队提出的,是一个缺失环节的问题:一个在证据被直接给出时答得对的模型,当它必须自己去找证据时还答得对吗?此前已有工作探索过长病历(MedAlign、MIMIC-Instr、TIMER),但都采用开放式作答,既没有锚定到可追溯的指南,也没有严格的时间边界。正是这种双重锚定——一条被识别出的临床规则,一个被强制执行的截止日期——构成了 ObGynLongBench 的原创性。
方法
测量的是什么。每个案例是一道四选一(A–D)的处置题,绑定到一位患者、她孕期时间轴上的一个日期,以及一条来自产科教材或指南的规则。该日期之后的全部内容从提供给模型的病历中移除;住院病例的截止点设在入院时刻,当天的诊断被自动抹去。评价指标只有一个:正确率。没有 AUC,没有敏感度,没有校准度——这种题型不适合,而这本身就是一个局限。
三种输入范围的设计。这是论文的核心,设计得相当好。同一批案例向同一个模型提问三次,只改变给它看的内容。在 Evidence-only 模式下,只提供预先定位好的证据条目。在 Visit-level 模式下,提供同一天的全部记录。在 History-level 模式下,提供决策前的完整病历。把一个模型与它自己在不同范围下作对照,干净地分离了两件事:模型对医学知道多少,以及它能从病历中提取多少。案例还被分为三个等级:L1(单一且局部可见的证据)、L2(同一次就诊内多来源的整合)、L3(证据分散在时间上,通常在决策前七天以上)。
数据。976 份真实孕期病历,来自单一一家三级医院,中文书写,覆盖十六个产科亚专科(妊娠期高血压疾病、妊娠期糖尿病、妊娠期肝内胆汁淤积症、B 族链球菌筛查、多胎妊娠等)。这 1 500 个案例并不独立:976 个对应某位患者的第一个决策点,524 个对应之后的决策点,其中 240 位患者各贡献两个。数据采集时段、患者年龄、产次和来源均未报告。
模型。十七个,全部不是作者训练的:四个商用"快速档"模型(Claude-Haiku-4.5、GPT-5.4-mini、Gemini-3-Flash、DeepSeek-V4-Flash)、八个长窗口开源模型(Qwen、Gemma、Phi 系列)以及五个医学专用模型(HealthGPT-Pro、Hulu-Med、Lingshu、MedGemma)。扩展推理模式在开源与医学模型上被关闭,在商用模型上则按默认开启。随后比较了六种病历访问策略:直接阅读、图像渲染、两种 RAG 变体(按相似度检索片段)、滚动摘要,以及工具循环式智能体。
但基准的构建本身依赖大模型。从指南中抽取规则由 GPT-5.3-Codex 完成,L1/L2/L3 等级判定由 Claude Opus 4.6 完成,题干与干扰项由大模型撰写,有效性核验由 GPT-5.4-mini 智能体执行。请记住这一点:下文还会回到它。
结果
落差存在,而且很大。在 Evidence-only 条件下,最佳模型是 Gemini-3-Flash,79.1 %,其次是 DeepSeek-V4-Flash 的 78.8 % 和 Gemma-4-26B-A4B 的 78.2 %。在 History-level 条件下,Gemini-3-Flash 仍居首位,但跌至 68.7 %。Claude-Haiku-4.5 从 75.5 降到 59.8(−15.7 个百分点),GPT-5.4-mini 从 77.4 降到 64.9(−12.5),Qwen3.5-35B-A3B 从 76.9 降到 60.1(−16.8)。十七个模型无一例外全部下降,从 −7.6(Phi-4-mini)到 −22.7(MedGemma-1.5-4B)。以患者为聚类单位重采样得到的 95 % 置信区间约为 ±2.5 个百分点:这个落差不是噪声。
难度随证据的分散程度上升。对几乎所有模型而言,L1 > L2 > L3。Gemini-3-Flash 为 66.0 / 71.5 / 65.0;Claude-Haiku-4.5 为 63.0 / 61.0 / 52.3;MedGemma-1.5-4B 为 45.8 / 43.5 / 29.7。最后这个数字值得正视:四个选项下,随机猜测的水平是 25 %。
医学专用模型并不更好。最佳通用模型与最佳医学专用模型之间的差距,从 Evidence-only 的 4.2 个百分点扩大到 History-level 的 7.4 个百分点。换句话说,医学训练增加了一点知识,却没有增加任何读病历的能力。
错误会在同一位患者内部传播。在这 1 500 个案例中,模型在同一位患者的第二个决策点上系统性地表现更差——十七个模型全部如此,从 −1.86 到 −10.88 个百分点,平均 −5.41,其中十二个在 p < 0.1 水平上显著。这是论文中最有价值的安全性结果:早期对病历的误读,似乎会污染同一位患者后续的决策。
在各种访问策略中,只有一种真正有用。以直接阅读(59.6 %)为基线,图像渲染下降 6.9 个百分点,静态 RAG 与滚动摘要与噪声无法区分,只有主动检索型智能体有增益——提高 4.6 个百分点,达到 64.2 %。配对自助法证实了这一点:Image 为 −6.91 ± 1.59,Agent 为 +4.53 ± 1.60,是仅有的两个显著差异。不过仍须指出:智能体消耗 35 786 个词元,直接阅读为 30 951 个,各策略之间的算力预算并未拉平。
临床换算。设想 1 000 个此类产科决策点。最佳模型在证据被奉上时会答错 209 个。同一个模型面对完整病历时会答错 313 个:约一百个决策仅仅因为信息需要被找出来,就从正确翻转为错误。在 L3 案例上——证据在时间上分散,也就是孕期随访的典型形态——MedGemma-1.5-4B 会答错 703 个,仅比抛硬币的 750 个略好。这些数字无法直接搬到产房:它们是选择题,不是问诊。但它们划出了一个上限,而这个上限很低。
做得好的地方
决策前的信息边界被认真对待。这是论文中最精细、也最少有人做对的工程环节。此后的一切都被移除;入院当天的诊断也被移除;一份明确的清理目标清单剔除了此前那些已经写明处置结论的记录与医嘱;相反,截止点之前的化验与生命体征按原则保留,以免案例变得无解。若没有这份纪律,测的就是模型找出病历里已写好答案的能力——这与毁掉众多多模态基准的循环泄漏是近亲。
统计处理高于本领域的平均水平。1 500 个案例并不独立,因为 240 位患者各贡献多个,而作者处理了这一点:采用以患者为聚类单位的自助法计算置信区间(10 000 次重采样,抽中的患者连带其全部案例),采用配对自助法在同一批案例上比较访问策略,并逐个模型公布单侧检验的 p 值。许多医学人工智能基准只报一个光秃秃的百分比;这一个报告了它的不确定性,而这个不确定性恰恰明确否定了正文中若干被略嫌轻率地评论过的微小差异。
一次独立且量化的临床审核。从 1 500 个案例中随机抽取一百个,由三位未参与构建的产科住院医师复核,他们可查阅截止点之前的完整病历。汇总结果:96 个参考答案被判为正确,1 个错误,3 个不确定;题目质量在 98 个案例中被判为清晰且具临床相关性。评审者间一致性以 Gwet 的 AC1 报告(0.927 与 0.973)而非 kappa,这在标注高度集中于单一类别时是正确的选择。此外,评测代码以 MIT 许可证公开,全部提示词列于附录。
做得不够好的地方
最基本的对照条件缺席了:不给病历、只给题目。该基准的临床规则来自公开指南,而这些指南在训练语料中广泛存在。论文没有做过一次只给题干和四个选项、完全不给患者数据的实验。因此无从知晓 79.1 %——乃至 68.7 %——当中有多大比例是靠单纯复述指南、排除干扰项就能拿到的。这是误导性指标的一种变体:随机水平(25 %)从未被重申,没有测量任何人类成绩(三位住院医师审核题目,但不作答),于是这些数字失去了标尺。如果分数中有相当一部分不用打开病历就能拿到,论文的核心论点也就相应被削弱。
标注与被测对象出自同一个行业。GPT-5.4-mini 是核验每道题是否有效、是否仅凭截止点前的证据即可作答的那个智能体;它同时也是排名第二的被测模型(Evidence 77.4,History 64.9,除 Gemini 外 L3 最高分)。被保留下来的题目,按构造就是它判定为可解的那些。DeepSeek-V4-Flash 既是证据利用评分的裁判,又是被测模型;而且在论文提供的稳健性矩阵中,它是四个裁判里最不合群的一个(与其他裁判的加权 kappa 为 0.73–0.77,而其余三者之间为 0.83–0.85)。作者声称通过选择封闭式题型避免了循环性;他们只是把循环性从评测环节移到了标注生成环节,这与消除它并不是一回事。
所测落差中有一部分很可能是技术性假象,而非推理能力的欠缺。跌幅最惊人的两个——Hulu-Med-30A3(−21.0)与 MedGemma-1.5-4B(−22.7)——恰好是上下文窗口最窄的两个模型(75 000 与 131 000 词元),而输入长度为 30 800 ± 19 800 词元。事实上有三个模型在 Visit-level 上的表现优于 History-level,这是溢出的典型特征。然而论文没有公布任何截断率、窗口溢出率或无法解析的回答比例。此外还有一项被承认但影响不轻的不对称:商用模型默认开启扩展推理,开源与医学模型则关闭。所有跨家族的比较——包括"医学模型并不更好"这一结论——都因此有偏。最后须指出人群偏倚:单一一家中国三级医院、产科领域,因而就诊人群偏向高危妊娠,没有公布任何人口学数据,而这 1 500 个案例本身的发布状态也始终未被言明——只有代码明确声明了许可证。
这改变了什么
对研究共同体而言,这篇论文有益地移动了标尺。它表明,带情景题的选择题拿到高分并不能预测在真实病历上的表现;它还提供了一套协议——同一批案例、三种输入范围——可以干净地把医学知识与信息提取分离开。这在别处、在其他专科和其他语言中都是可复现的,也应当被复现。主动检索型智能体的结果还指向一个具体方向:与其指望模型一次性把病历读好,不如让它去查询病历。而患者内部错误传播这一发现,本身就值得一项专门研究。
对临床医生而言,今天什么都没有改变,论文也并不假装相反:其伦理章节明确写道,ObGynLongBench 不是一个临床决策支持系统。可操作的信息在别处。当有人拿着一个基准分数向你推介某个工具时,该问的问题是:它是在撰写好的情景题上评测的,还是在我们这里实际存在的病历上评测的?这里记录下的十到二十个百分点的落差,恰恰就是演示与部署之间的距离。这与在对话式分诊和病程中段决策上观察到的是同一种模式:情境一旦不再被预先嚼碎,性能就会塌陷。
对患者和公众而言,教训简单而持久。一个"知道"指南的模型,不等于一个会读你病历的模型。这是两种不同的能力,第二种远远更不成熟,而在有用信息分散于六个月的孕期随访中,起决定作用的恰恰是第二种。问卷正确率 68.7 % 这个数字,对一个工具的安全性什么也没说:它既不测量说"我不知道"的能力,也不测量置信度的校准——而这两项性质,本研究与大多数封闭式基准一样,完全没有测量。
延伸阅读
预印本:ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making,arXiv:2609.07601,2026 年 9 月 7 日提交,DOI 10.48550/arXiv.2609.07601,采用 CC BY 4.0 许可。评测代码与相关资源公布于 GitHub,采用 MIT 许可;而这 1 500 个案例本身的发布状态并未说明。
已声明的资助:国家重点研发计划(2023YFF1204800)、上海市经济和信息化委员会"人工智能赋能科学研究"专项(2025-GZL-RGZN-BTBX-02028)、国家自然科学基金(62406121)、上海市自然科学基金基础研究计划(25ZR1401034),算力部分由复旦大学 CFFF 平台提供。稿件中没有利益冲突声明;没有作者隶属于生产上述十七个被测模型中任何一个的机构。
同一领域内,作者引用的既有长病历基准:MedAlign、MIMIC-Instr 与 TIMER,均为开放式作答,且未锚定到可追溯的指南。