PrecepTron:一个以医师评分面板校准的 320 亿参数评审模型,以及它揭示的临床基准问题

哈佛医学院、贝斯以色列女执事医疗中心与斯坦福的团队公开了 PrecepTron——一个经过微调、用以替代医师评审团为临床大语言模型开放式回答打分的 320 亿参数模型,同时公开 GRAND-ROUNDS:一个包含 9217 个评分的公共数据集,由 11 位医师在七项已发表研究中给出。真正重要的结论不是 PrecepTron 在五项任务中的三项达到了医师之间的一致性水平,而是三个作为评审使用的前沿闭源模型,在相同回答、相同评分表下彼此相差多达 17 个百分点。也正是借助这一评审,作者发现 GPT-5 在不到四十个单词的病例文本下,就能在 42% 的《新英格兰医学杂志》病例上拿到高分。

背景

在医学领域评估语言模型,长期以来意味着让它去做选择题——USMLE、各类题库——答案唯一,评分自动。这个阶段已经结束:模型在这些考试上趋于饱和,更关键的是,这些考试与临床医生的真实工作毫无相似之处。于是文献转向了开放式回答:要求模型给出鉴别诊断、处置方案或会诊记录,再由医师依据明确的评分表为其产出打分。

这一转向让基准更可信,也让评估更脆弱。更可信,是因为对照变成了真实任务上的人类。更脆弱,是因为分数如今取决于由谁来打。招募哪些专家——全科还是专科,普通医师还是顶尖医师,学术机构还是社区执业?人数多少?彼此之间是否一致?发表在《JAMA》《Nature Medicine》或《Science》上的研究,通常依赖两人到十余人的评审团,且往往来自同一家机构。本文共同资深作者 Arjun Manrai 在 2026 年《Nature》的一篇评论中总结了这一问题,标题为「Medical AI has a measurement problem」。而美国 FDA 在 2026 年就生成式 AI 医疗器械的监管公开征求意见——也就是说,这些分数很快将影响监管决策。

当下流行的答案叫 LLM-as-a-judge:把打分交给另一个语言模型。它快速、可逐字节复现,并且已被用来回答严肃问题,比如医学专用模型是否真的胜过通用模型。但有两重障碍。第一,自动评审本身可能校准不良并带有自身偏好——偏爱更长的回答、偏爱由 AI 撰写的文本、偏爱来自同一模型家族的产出。第二,闭源评审运行在供应商那一侧:把患者记录发往外部 API,对多数医院而言不可接受。这篇论文同时从这两条战线入手。

方法

数据集。GRAND-ROUNDS(Graded Responses and Annotated Notes for Diagnostic Reasoning on UNstructured Data Sets)汇集了七项已发表研究中由医师手工评分的大模型产出:9217 个医师评分,覆盖 5250 条「回答—评分表」条目,产出方为 160 位临床医生与 9 个 AI 模型,评分者为 11 位医师。共六项任务,其中五项用于实验:NEJM 临床病理讨论会(CPC)上的鉴别诊断(用 Bond 评分,五级序数量表——0、2、3、4、5——其中 5 表示正确诊断出现在鉴别诊断列表中);Goh 等 2024 年的 Landmark Diagnostic Cases,采用 19 分评分表,分别为候选诊断、支持与反对证据、最终诊断和后续检查建议赋分;Goh 等 2025 年的 Grey Matters Management Cases,考查处置推理;NEJM Healer,按 10 分制 R-IDEA 评分表评估会诊记录质量;以及 BIDMC ER,来自 2026 年《Science》研究的贝斯以色列急诊科诊断准确性任务。第六项任务——CPC 检查计划——虽然公开,但因评分过度集中在量表高端而被排除在实验之外。

参与比较的评审。八个模型以零样本方式运行,即提示词中只给出已发表的评分表:五个开源模型(Qwen3.5-9B、Qwen3-32B、Gemma-3-12B、Llama-3.1-8B、Mistral-3-8B)与三个闭源模型(Claude Opus 4.6、Gemini 3.1 Pro、GPT-5),另加三个闭源模型的集成,其分数取三者均值并取整。

模型。PrecepTron 是对 Qwen3-32B 的有监督微调,采用 LoRA(low-rank adaptation,低秩适配):不去改动全部 320 亿权重,只训练嫁接在每一层注意力与投影矩阵上的小型低秩矩阵,从而使整个过程能在单张 GPU 上完成,并在机制上限制了模型的漂移幅度。秩 16、缩放因子 32、dropout 0.05、AdamW 优化器、学习率峰值 2 × 10⁻⁴、余弦调度并含 3% 预热、有效批大小 4、序列长度 4096 个 token、bfloat16 精度、三个 epoch,在单张 80 GB 的 NVIDIA H100 上训练。每张评分表训练一个独立适配器;CPC 与 BIDMC ER 共用一个,因为二者共用 Bond 评分。数据划分按病例进行,从不按回答划分:病例数不少于十例的任务取 20% 病例用于训练,病例数更少的两项任务只用两例——也就是说,各任务的训练病例数在 2 到 46 之间。有一个后来被证明关键的细节:训练样本按分数三分位(低、中、高)重采样直至各档数量持平,并设置最多重复五次的上限,以防止评审模型固守最常见的分数。

评价指标。主要指标是相对于人类参考评分的准确率:在 Bond 量表上为「相差不超过 1 分」,其余任务为「与归一化分数相差不超过 10%」。次要指标是二次加权 Cohen κ——一种经机遇校正的一致性度量,差距越大惩罚越重。两项指标都系统性地与医师之间的一致性做对照,后者在至少由两位医师评分的回答子集上计算。95% 置信区间采用非参数 bootstrap,2000 次重采样,随机种子固定。另有两种不更新权重的竞争策略在相同数据上受测:五样本 few-shot 提示,以及提示词优化器 GEPA。

结果

前沿评审彼此矛盾。面对相同回答、使用相同评分表,三个闭源模型给出的平均分在 Landmark Diagnostic Cases 上相差 17 个百分点(Gemini 74%、GPT-5 59%、Claude 57%),在 CPC 上相差 9 个百分点(GPT-5 80%、Gemini 77%、Claude 71%,而医师为 88%)。而且这种分歧并不是可以重新标定掉的恒定偏移:Claude 在 CPC 上最严苛(71%,医师为 88%),在 BIDMC ER 上却最宽松(82%,医师为 78%)。没有任何一个基础模型能在五项任务上都达到医师间一致性水平。作者在五项任务中的四项检验了评审是否偏袒自己的产出:未发现系统性偏好。第五项即 BIDMC ER 无法检验——其文本含有患者数据,不能离开医院。

轻量微调弥合了差距。在 2 到 46 个病例上训练后,PrecepTron-32B 在全部五项任务上相对基础模型提升 4 到 15 个百分点:CPC 由 82% 升至 92%,Landmark 由 46% 升至 61%。在后者这项因 19 分评分表而最为苛刻的任务上,取自两个病例的 93 条已评分回答,就足以把 κ 从 0.62 提升到 0.80。完整数据,准确率与 κ 对照人类基线:CPC,PrecepTron 92%(κ = 0.71)对医师 92%(κ = 0.68);NEJM Healer,81%(κ = 0.80)对 77%(κ = 0.83);BIDMC ER,91%(κ = 0.60)对 88%(κ = 0.66);Landmark,61%(κ = 0.80)对 67%(κ = 0.92);Grey Matters,80%(κ = 0.78)对 95%(κ = 0.90)。PrecepTron 在两项任务上胜过三个闭源模型的集成(CPC 92% 对 83%,Landmark 61% 对 44%),在其余三项上与之持平。两种基于提示词的策略则告失败:five-shot 使 NEJM Healer 从 76% 跌至 67%,GEPA 使处置推理从 72% 跌至 63%。

复现五项研究。把 PrecepTron 用在原论文的回答上、沿用原评分表、排除训练所用病例,它重现了五项研究的核心结论:Kanjee 等(《JAMA》,2023)中 GPT-4 的诊断准确性;Cabral 等(《JAMA Internal Medicine》,2024)中聊天机器人、住院医师与主治医师 R-IDEA 评分的相对次序;Goh 等(2024 与 2025)中 GPT-4 与使用常规资源的医师相当或更优的表现;以及 Brodeur 等(《Science》,2026)中诊断准确性由分诊到收治的递增趋势。

最令人不安的结果。有了自动评分器,作者得以做一件没有任何人类评审团会出钱做的事:以十个 token 为步长,向 GPT-5 逐段提供每个病例越来越长的开头文本,并在每一步为其回答打分。在 CPC 上,GPT-5 在 50 个 token 以内(约四十个英文单词)就有 42% 的病例把正确诊断纳入其前十位鉴别诊断,对应前三位为 14%、首位诊断为 12%。作为参照,一份 CPC 的病例陈述约为 1600 个 token。在处置类病例上饱和更快:五道保留问题中有四道在 50 个 token 内达到评分表满分的 80%,其中三道在 10 个 token 内即达到。四个 Landmark Diagnostic Cases 全部在 50 个 token 内达标。Gemma-4-31B 的行为在定性上一致,只是需要稍多一些文本。记忆效应无法解释这一现象:所用的 50 个 CPC 为 2025 年及以后发表,晚于两个模型的预训练截止时间,另外两个数据集此前从未在网上公开。表 2 中的一个例子足以说明问题:面对「一名 53 岁男性因严重左心室功能障碍伴心尖部动脉瘤在本院心内科门诊就诊」这 30 个 token,GPT-5 把 Chagas 病列为第二诊断假设——而这正是最终诊断。

具体换算。这个模型不接触任何患者:它批改的是答卷。因此其损害单位不是假阴性,而是已发表的结论。一组病例平均分上 17 个百分点的差距,恰恰就是「模型胜过医师」与「模型不及医师」之间的落差幅度。如果评审的选择就能让均值移动这么多,那么过去三年健康 AI 文献中的一部分标题性结论,取决于一个几乎没有哪项研究会报告的参数。

做得好的地方

关于前沿评审的阴性结果才是真正的贡献,而且无法靠重新标定挽回。证明三个闭源模型给同一批答卷打出相差 17 个百分点的分数,本身已足以成文。真正关键的细节在于:这些偏差在单个模型内部并不一致——Claude 在这里严苛,在那里宽松。恒定偏倚可以用一个偏移量校正,这种偏差不行,只能逐任务测量。论证所用的手段也配得上结论:八个评审、五项任务、两项指标(其中一项经机遇校正)、bootstrap 区间。

消融实验真的去找了失败可能藏身之处。去掉平衡重采样后,NEJM Healer 上的 κ 从 0.72 跌至 0.51,而准确率相当:作者主动公布了证据,说明其评审模型若缺少这一防护,就会在看上去依然称职的同时坍缩到多数分数。他们还检验了最具诱惑力的捷径——评审是否会给「像 AI 写的」文本更高分——办法是仅用人类撰写的回答重新训练,结果未发现捷径。主动去找自己的失效模式,再把它们写进补充材料,并不多见。

数据与模型确实公开,而且体量允许本地部署。9217 个医师评分、训练代码、适配器,以及首次公开的 Landmark Diagnostic Cases 与 Grey Matters 病例文本,都已存放于 Hugging Face 与 GitHub。来自五项有影响力研究的人工标注就此成为可复用的公共资源——而这恰恰是他人得以质疑本文其余部分的前提。此外,320 亿参数可装入单张 80 GB 显卡:医院可以在院内运行该评审。这一论点并非纸上谈兵——正因为贝斯以色列急诊科的文本无法离开医院,三个闭源评审才无法在该任务上接受自我偏好检验。

做得不够的地方

对五项研究的「复现」是循环的,这是一种有偏对照。Kanjee、Rodman、Crowe、Brodeur、Goh、Chen 与 Abdulnour 既是本文作者,也是被复现研究的作者。PrecepTron 在这些语料 20% 的病例上、用同一批评审团的评分完成训练,随后在剩余 80% 上「重现」结果。这是内部一致性检查,不是独立复制:没有任何来自其他团队、由作者未曾用以训练的评审团打分的研究,被用来检验这套装置。作者在局限性中说得很直白——用 PrecepTron 复现一项研究,复现的是该研究的评价标准,而非其背后的临床判断——但图 4 上写着「复现五项已发表研究」,传播开来的会是这句话。同一种自我封闭的验证结构,我们此前在标签来自被评估模型本身的基准一文中也指出过。

主要指标偏宽松,而在无人注意之处,两项指标彼此矛盾。在只有五个档位的 Bond 量表上「相差不超过 1 分」,意味着可以把 4 分与 5 分混为一谈——前者是逼近诊断的鉴别列表,后者是包含诊断的鉴别列表。更关键的是:在 BIDMC ER 上,PrecepTron 的准确率为 91%,但其 κ 却从基础模型的 0.68 下降到 0.60,低于医师的 0.66。准确率上升而经机遇校正的一致性下降,正是评审在偏斜分布上退守高频分数的典型特征——而这恰是平衡重采样本应防止的缺陷,也是第六项任务被移出实验的理由。论文只用一个插入语(「略有下降」)带过此事。此外还应指出,短前缀这一发现正是用这个评审得出的,而它的宽松程度恰恰是争议所在;作者点出了一个 PrecepTron 可能过于慷慨的边界案例,却没有大规模的人工复核来定夺。

被冻结进权重里的是一个评审面板,而它的构成并不中立。11 位评分医师绝大多数来自波士顿—斯坦福一线:贝斯以色列女执事、麻省总医院、布莱根妇女医院、哈佛、斯坦福。论文把「更换面板」——用专科医师重跑一项研究,或用本地医师把国家级基准本地化——当作一项功能来呈现;但实际交付的就是这个学术化的美国面板,其潜在偏好将成为评判其他模型的参照。每张评分表一个适配器,各自只用 2 到 46 个病例训练;而协议的第 2 步说得很明白:在别人的任务上完成的验证不可迁移。因此可复用的产物是配方,而不是评审模型本身。最后,这份预印本既无资助声明,也无利益冲突声明,数据集许可协议未予说明,而 BIDMC 病例文本——唯一涉及真实急诊就诊的任务——并未公开,使这一部分无法从外部核验。

这意味着什么

对研究界而言,可操作的信息有两条。其一,评审已成为一个必须像试剂一样申报的方法学参数:模型、版本、提示词、校准数据,以及与医师之间一致性并列呈现的「评审—医师」一致性。论文以方框形式给出的五步协议可直接套用,理应成为同行评议的硬性要求。其二,分量更重:如果一个模型凭四十个单词就能在 42% 的 NEJM 病例上答对,那么现行评分表在很大程度上奖励的是模式识别——把年龄、性别与某个症状映射到典型表现——而把真正构成临床推理的能力搁在一边:整合新信息、修正既有假设、抵抗过早结论。下一代基准必须让信息随时间变化,并为「修正」本身赋分,而不是只看终末评分。

对临床医师而言,今天床旁不会有任何改变。值得预判的是间接影响:医院一旦在临床中部署大模型,就需要规模化的监督,而本文这样的本地评审很可能正是这种监督将采取的形态。这使评审成为一个新的安全器官,同时也是一个新的失效点。校准不良的评审不会产生可见的错误,它产生的是一块令人安心的仪表盘。值得留存的阅读框架只需一问:面对任何「AI 比肩医师」的标题——谁来打的分,有多少人,他们彼此一致吗?同样的谨慎也适用于由自动评审打分的临床基准。

对患者与公众而言,有一个简单的区分。当一则消息宣称某个模型「解决了」复杂病例时,它报告的是一个分数,而这个分数是由某个主体给出的——一个小规模的医师评审团,或者越来越多地,一台机器。这篇论文表明,这个主体会改变结果。它同时表明,用来为这些模型加冕的考试,有一部分可以靠对寥寥数词的第一印象作答——这是一种没有经过推理却答得不错的方式。一个在基准上看起来像优秀诊断医师的模型,并未证明当患者不符合典型表现时它懂得改变判断。同样的「案例评分与真实行为之间的落差」,我们已在真实条件下的对话式分诊中见到过。

延伸阅读

论文:Scaling Clinical Judgment to Evaluate Medical AI,作者 Thomas A. Buckley、Zahir Kanjee、Peter G. Brodeur、Byron Crowe、Anthony M. Pettinato、Aashna P. Shah、Adrian D. Haimovich、Liam G. McCoy、Daniel Restrepo、Ethan Goh、Jonathan H. Chen、Laura Zwaan、Katherine E. Goodman、Daniel J. Morgan、Raja-Elie E. Abdulnour、Adam Rodman 与 Arjun K. Manrai,arXiv 预印本,2026 年 9 月 11 日提交,分类 cs.AI,DOI 10.48550/arXiv.2609.12822。尚未经过同行评议。

作者单位:哈佛医学院生物医学信息学系;贝斯以色列女执事医疗中心内科与急诊医学科;斯坦福大学住院医学部、计算医学部与临床卓越研究中心;阿尔伯塔大学神经病学部;麻省理工学院医学工程与科学研究所;麻省总医院内科;鹿特丹伊拉斯谟医学中心医学教育研究所;马里兰大学医学院流行病学与公共卫生系及马里兰大学健康计算研究所;马里兰退伍军人医疗系统;布莱根妇女医院肺病与重症医学科。Adam Rodman 与 Arjun K. Manrai 为共同资深作者。

数据与代码:训练与评估代码、评审提示词,以及 few-shot 与 GEPA 基线见 github.com/2v/PrecepTron;PrecepTron-32B 适配器见 Hugging Face 合集;GRAND-ROUNDS 数据集首次收录了 Landmark Diagnostic Cases 与 Grey Matters Management Cases 的病例文本;项目文档见 preceptron.net。贝斯以色列急诊科的病例文本含有受保护的健康信息,未予公开。预印本未说明数据集的许可协议。

资助与利益冲突:该预印本既无资助声明,也无利益冲突声明。十七位作者中有七位,同时是本文试图复现的那些研究的作者(Kanjee 等 2023、Cabral 等 2024、Goh 等 2024 与 2025、Brodeur 等 2026)。

另见 Tatakoto:由自动评审打分的德语临床基准、标签来自被评估模型时的循环泄漏,以及案例题与真实分诊之间的落差。