RAG 与公共卫生:多选题答对率 99%,但只有约三分之二的回答忠实于官方指南

一个英国团队扩展了 PubHealthBench——取自英国政府 687 份公共卫生指南文件的 7929 道问题——用于测试检索增强生成(RAG):这是一种把语言模型的回答「锚定」到实时检索得到的文档语料中的技术。在多选题上,提供正确的段落可将准确率推高到约 99%,以至于小型开源模型都能超过不带检索的大型闭源模型。但一旦转向自由作答并检验其对指南的忠实度,最佳配置也只有 64% 的情况站得住脚——而自动打分工具恰恰在「事实一致性」这一维度上崩塌。

背景

大语言模型(LLM,即 large language models:像 ChatGPT 那样、经训练来预测文本的网络)在医学多选题测验上得分优异。但两个障碍使它们在公共卫生中变得危险。其一是幻觉:模型以与正确陈述相同的自信,给出看似合理却错误的陈述。其二是过时:官方指南会变化——在疫情期间有时每周都在变——而模型的知识则冻结在其训练日期。

RAG(检索增强生成)是应对这两个问题最常见的办法。原理是:在回答之前,系统先在一个持续更新的语料库中检索最相关的段落,再把它们作为上下文提供给模型。这样,回答被「锚定」在明确的来源上,而非模型不透明的记忆里。理论上很有吸引力;实践中,最终质量完全取决于检索到什么以及如何评估。此前一个基准 PubHealthBench 曾显示,面对这些问题,没有模型在自由作答上超过 75%,而人类得分为 88%(仅粗略使用搜索引擎),不带检索的最佳闭源模型 GPT-4.5 的上限为 92.5%。本文由此出发发问:加入检索到底能带来什么,我们又是否真能正确地衡量它?

方法

作者把 PubHealthBench 改造成一个 RAG 基准。687 份指南文件被转换为 markdown 并按标题层级切分,得到一个含 5358 个片段(「chunks」)的语料库。检索部分比较三类方法。稠密检索把每个片段和每个问题转成一个嵌入(embedding,一串意在捕捉语义的数字向量),并检索出向量与问题最接近的片段;共比较八个嵌入模型,从 NV-Embed-v2(80 亿参数)到 MedCPT、EmbeddingGemma 等小型编码器。稀疏检索依赖精确词语,通过 TF-IDF 和 BM25 这两种为罕见词加权的经典方法实现。混合检索用互反排名融合(Reciprocal Rank Fusion, RRF)合并两种排序,在稠密与稀疏之间设一个可调权重。共测试三种语料变体:完整、摘要(每个片段替换为 GPT-4o-mini 生成的摘要)与精简(仅对超过 512 token 的片段作摘要)。

检索质量以 Recall@k(正确来源是否出现在前 k 个结果中)、MRR(Mean Reciprocal Rank,奖励排名靠前的好结果)与 nDCG@10(对前十名排序质量的度量)来衡量。在生成一侧,共评估十一个 LLM,从 Llama-3.3-70B、MedGemma-27B 到 Gemma-3-1B,先做多选题。为贴近真实使用,作者抽出 760 道由专家审阅、不带选项的问题,进行自由作答(最多 15 个上下文片段,上限 1 万 token)。由于无法人工评阅成千上万条自由回答,他们引入了以 LLM 作评审(LLM-as-a-judge):由一个模型(GPT-OSS-120B)按四项标准给每条回答打分——忠实度(不添加来源中没有的内容)、完整性、清晰度、事实一致性。关键在于:该评审器在 100 条回答上与两位人工标注者作了对照验证,采用科恩 kappa(κ,一种经随机校正的一致性:0 表示随机,1 表示完全一致)。还须指出作者自己点明的一处偏差:该基准本身由 Llama-3.3-70B 生成,而它正是随后被评估的模型之一。

结果

在检索上,排名很清楚。最佳稠密编码器 NV-Embed-v2 取得 Recall@10 为 0.98、MRR 为 0.85、nDCG@10 为 0.88;混合检索把它推到 0.99 / 0.88 / 0.91。小型编码器则大幅掉队——EmbeddingGemma 和 MedCPT 的首位精度跌到约 0.24–0.27——但混合检索为它们挽回 5 到 10 个百分点。两条实用经验:每个片段一旦超过 700 到 800 词,排序质量下降;且没有任何模型在「摘要」语料上取得最佳成绩。为压缩而摘要,会损害检索。

在多选题上,检索的效果很惊人。提供正确上下文可把几乎所有模型推到约 99%:Llama-3.3-70B 为 0.995,MedGemma-27B 为 0.992,就连小型的 Gemma-3-4B 也有 0.956;只有 Gemma-3-1B 落后(0.664)。除它之外全部超过 88% 的人类得分,多个模型还超过不带检索的 GPT-4.5 的 92.5% 上限——一个「喂料充足」的 80 亿参数开源模型,胜过「喂料不足」的大型闭源模型。仅一个上下文片段时增益即已出现,在三到五个片段处达到顶峰。

随后是自由作答,局面逆转。完整性与清晰度保持在高位(常为 0.88 到 0.97),但忠实度——不添加所引来源中没有的任何主张——对最佳模型也只在 0.64 的情况下达到;总体而言,只有半数到三分之二的回答通过这一标准。而且随着正确来源在列表中被检索到的位置越靠后,忠实度还会下降。具体而言:三条看似撰写工整、「有出处」的回答中,约有一条添加了所引指南并不支持的内容。在公共卫生领域,一条建议会触及整个人群,一处不忠实的添加——多出的一次剂量、被遗漏的一项禁忌——无法逐例补救。更糟的是,本应衡量事实一致性的自动评审器在这一点上并不能复现人类判断:它与标注者的一致性几近于零(κ 为 0.06 与 0.17),而在忠实度(κ 0.64 到 0.71)与完整性(κ 0.57 到 0.59)上尚可。恰恰在临床风险最高之处,这件仪器是失明的。

做得好的地方

一项锚定于真实指南、且超越多选题的评估。该基准并非建立在人造问题上,而是取自涵盖十个领域的 687 份官方公共卫生文件。尤为重要的是,作者没有满足于多选题的舒适:他们构建了一个经专家审阅的自由作答集,这是唯一接近真实使用的形式。正是这一转变,揭示了测验 99% 与忠实度 64% 之间的落差。

一个清晰而可复现的实用结论。检索是首要杠杆;一个「喂料充足」的小型开源模型,可与不带检索的大型闭源模型比肩,甚至胜出。奏效的配置都有记录(按排名融合的混合检索、权重、TF-IDF、不作摘要的语料),且全部以开放的 CC BY 4.0 许可发布——足以让人重跑并质疑这些测量。

一种少见的方法学自省。作者用两位人工标注者验证其自动评审器,逐项公布一致性,并白纸黑字地说明「事实一致性」得分并不可靠、因而须谨慎解读。在一个动辄把「以 LLM 作评审」当作真理来兜售的文献环境里,这种对仪器局限的诚实值得肯定。

做得不足的地方

一个被摆在最前的误导性指标。那个惊人的数字——约 99%——是多选题成绩,而作者自己也承认它高估了真实能力:在多选题中,模型可以排除错误选项、捞取部分分数,而未必真正掌握内容。证据就在文内:即便检索到的片段并非正确来源,多选题的高准确率依然存在。真正的故事不是 99%,而是自由作答中 0.64 的忠实度。

评估的循环性与有偏的对照。该基准由 Llama-3.3-70B 生成——而它随后又以 0.995 高居榜首。用一个模型自己产出的问题去评估它,是一种泄漏:这些问题「按构造即可从语料中作答」,从不检验跨多个片段的推理,也不检验在语料之外的问题上说「我不知道」的能力。评估一侧还叠加了一个有偏的对照:LLM 评审器在事实一致性上并不稳定(与人类的一致性几近于零),于是健康领域最关键的那一维度,归根结底并未被可靠地衡量。

一种人群偏差与部署上的脆弱。一切都建立在单一政府——英国——的英文、人群层面的指南之上:没有任何东西能保证这些结果可迁移到另一个国家、另一套卫生系统或另一种语言。而且主导性的失败模式很说明问题:模型倾向于说得太多,纳入超出所问范围的指南,从而降低精确度、增加误解的机会。控制回答的范围——不添加未被请求的建议——仍是尚未解决的挑战,而这恰恰是原型与可部署工具之间的分界。

它改变了什么

对研究界而言,其信息是方法学的:用多选题评估医学 LLM 具有误导性,应当优先采用自由作答的忠实度评估,并以本身经过人类验证的评审器为支撑。本文勾勒出有价值的后续工作:在事实一致性上可靠的自动评审器(目前尚缺)、能够跨多个片段推理的检索,以及包含「语料中无答案」问题的测试集,以检验系统是否懂得拒答。

对临床医生与卫生机构而言,锚定于持续更新语料的 RAG,是让助手在不重训模型的情况下与官方指南对齐的一条可信路径——当指南快速变化(尤其在疫情中)时,这是实实在在的优势。但现状下无法直接部署:只要忠实度停留在约三分之二、范围控制尚未解决,这类助手仍只是须受监督的辅助工具,而非自主的信息来源。

对患者与公众而言,教训是一种阅读卫生。一个「引用官方指南」的助手,并不因此就忠实于指南所言:在这项研究中,约每三条自由回答就有一条添加了所示来源并不支持的内容。测验拿高分,丝毫说明不了一条完整写出的建议是否安全——而当你在寻求健康信息时,后者才是要紧的。

延伸阅读

该预印本可在 arXiv(10.48550/arXiv.2607.06641) 获取,采用 CC BY 4.0 许可。关于 LLM 在敏感临床情境中的局限,参见我们对决策边界处 LLM 临床安全性的解读;关于将 LLM 用于从临床记录作诊断,参见对GenoSolver 用于罕见病的解读;关于模型回答格式的影响,参见对GPT-4 在放射学中及其解释排版的解读。

编辑透明度说明:法文版由 Tatakoto 编辑部在阅读预印本后撰写并署名。英文、西班牙文与中文译本借助 AI 协助生成并经校订。