人工智能生成的病理报告:为什么 BLEU 分数会高估质量,以及临床指标 CRQS 修正了什么
石溪大学与犹他大学的一个团队搭建了首个用于从数字化切片自动生成病理报告的标准化基准,在三个数据集上重新评估了四个模型和三个图像编码器。他们的发现是:常用的语言指标(BLEU、ROUGE、METEOR)奖励表面相似度,甚至可能给一份颠倒了诊断的报告打高分。为此他们提出了 CRQS,一种比较所提取的临床事实而非词语的评分——但这个充当裁判的指标本身依赖一个语言模型,并且是对照有噪声的参考报告来衡量的。
背景
从切片生成病理报告,就是让模型读取一张全切片图像(whole-slide image,WSI)——一张染色组织切片的扫描图,一幅由数十亿像素构成的「吉像素」图像——并写出诊断报告:肿瘤类型、分级、分期、切缘、淋巴结受累情况。这项任务是新近才有的,并因病理基础模型(foundation models,即在海量切片上预训练的视觉网络,这里指 CONCH、UNI、H-Optimus)而变得可行,它们把每一块图像碎片转化为可用的特征向量。
有两个问题拖住了这一领域。其一是可比性:每个团队都用自己的数据、编码器、预处理和协议,因此无法判断某个宣称的提升究竟来自模型还是实验搭建。其二是评估。多数工作用从机器翻译借来的指标——BLEU、ROUGE、METEOR——来给生成的报告打分,它们衡量的是词汇重叠,即生成文本与参考文本之间共有词语或短序列的比例。问题出在临床:一份报告可能与参考逐字相近,却漏掉一个诊断、弄错分级,或者凭空捏造淋巴结受累。这些错误不是语言问题,而是医学问题——表面指标看不见它们。
方法
这项工作有两块。第一块是标准化基准。作者把四种代表性方法重新实现到同一套代码库中:WSI-Caption(又称 MI-Gen,一种基于多示例学习的生成器,把碎片特征聚合成整张切片的报告)、HistGen(分层的局部-全局编码)、BiGen(一种检索增强模型,会去调取外部文本知识)和 SCOUT(一种情境感知的多模态 transformer)。每一种都与三个病理编码器——CONCHv1.5、UNI2-h 和 H-Optimus-1——搭配,以分离视觉表征的作用。一切都走同一条流水线:用 TRIDENT 工具在 20× 放大倍率的碎片上提取特征,同一个分词器,同样的训练/验证/测试划分,在 H100/H200 GPU 上以批大小 1 训练。三个数据集各具互补特征:TCGA(7074 / 884 / 885 张切片;报告长、为自由文本、标注噪声高)、HistAI(9980 / 1248 / 1248;多机构、结构化程度中等)和 REG 2025(5924 / 740 / 741;报告短、半结构化、噪声低)。
第二块是 CRQS 指标(Clinical Report Quality Score,临床报告质量评分)。CRQS 不比较两段文本,而是通过一个语言模型流水线,从每份报告(生成的与参考的)中抽取一组结构化临床字段(诊断、组织学类型、分级、分期、切缘状态、淋巴结受累、生物标志物),再对术语做归一化。随后计算四个子分数:事实覆盖率(参考报告中被正确复原的字段比例)、关键信息召回(最具决定性的字段:诊断、分级、分期、切缘、淋巴结)、幻觉率(模型所断言、但参考中并不存在的事实比例)以及临床不一致(在双方都出现的字段上直接矛盾)。综合时对关键信息召回赋以最高权重,并对不一致的惩罚重于幻觉——因为一个相互矛盾的取值比一个不冲突的添加更危险——然后归一化到 0 与 1 之间。字段模式是与一位病理学家共同设计的,优先选取真正可从切片推断的要素。
结果
数据集之间的反差引人注目。在 REG 2025(报告短且结构化)上,词汇指标与临床指标一致:BLEU-1 约为 0.83–0.86,CRQS 约为 0.69–0.71。在 TCGA(长自由文本)上,CRQS 崩塌到约 0.18–0.19,幻觉率高达约 0.5——即模型所断言的临床事实中,将近一半得不到参考的支持——而词汇分数却仍「拿得出手」(BLEU-1 ≈ 0.34–0.39)。换言之,在贴近现实的数据上,经典指标明显高估了临床质量。HistAI 居于两者之间(CRQS ≈ 0.27–0.29)。
尤为关键的是,最优模型会随指标而变。在 REG 2025 上,SCOUT 在语言分数上领先,但取得最高平均 CRQS 的却是 BiGen:若按 BLEU 来选系统,会与临床标准选出不同的赢家。两个例子让这种背离变得具体。案例一:模型把一处宫颈病变从高级别(HSIL / CIN 2)降级为低级别(LSIL / CIN 1)——一个临床上很严重的错误——然而 METEOR 给它 0.4264(一个说得过去的分数),而 CRQS 把它压到 −0.0714。案例二:模型写「淋巴结反应性增生」,而参考写的是「反应性淋巴结,无转移性癌」——临床含义相同、用词不同——METEOR 只给 0.0114(灾难性的分数),CRQS 却认可为 0.9143。编码器的选择有可测量的影响,但没有一个到处占优:最优的视觉表征取决于数据集和方法。
案例一的临床解读道尽了利害:把宫颈真正的高级别癌前病变描述为「低级别」,就有可能让一位本需治疗或密切随访的患者被简单地安慰过去。一个把这种错误打成 0.43(满分 1)的指标,会放过一个危险的模型;而这恰恰是 CRQS 力图阻止的。
值得肯定之处
一次真实、可复现、公开的标准化。共享的固定划分、由 TRIDENT 统一提取特征、把四种方法重新实现到同一套 PyTorch Lightning 代码库中:这一搭建正面回应了该领域的可比性问题。一个耐人寻味的细节是,若干被重新评估的模型超过了它们各自原先报告的数字,这提示已发表的部分「进步」源自预处理而非架构。框架与划分均已开源(GitHub 上的 PathBench 仓库),因而可复演。
一个讲临床、而非讲语言的指标。通过把质量拆解为可解释的失败模式——遗漏、漏掉关键字段、幻觉、矛盾——CRQS 做到了 BLEU 做不到的事,而且是双向的:它惩罚 METEOR 认为尚可接受的分级颠倒,也奖励 METEOR 判为一无是处的正确改写。这套与病理学家共同构建、以切片上可见要素为中心的模式,把评估锚定在真实的结构化(synoptic)报告实践之中。
公共经费、学术团队、无利益冲突。该工作由 NIH 资助(含 1R01CA297843-01)和 NSF 资助(2442053),由大学实验室主导(石溪大学的生物医学信息学、犹他大学的病理学),没有商业赞助,也未申报利益冲突。在评估这类问题上,独立性至关重要:谁定义了指标,谁就决定了哪些模型「获胜」。
不足之处
用误导人的指标……却由一个借助语言模型来评判的指标去纠正。为了抽取临床事实,CRQS 依赖一条 LLM 流水线。于是临床裁判本身就是一个语言模型,其抽取的错误率并未大规模对照病理学家来量化——只是被定性地「由专家核验」。这有可能把它声称要解决的问题上移一层:一个 LLM 裁判可能凭空产生某个字段,或错误地归一化一个同义词,从而恰恰重新引入它本应衡量的幻觉与误导性指标。这与临床中 LLM 评估者所面临的陷阱如出一辙,我们在别处已有论述。
它衡量的是对参考的忠实度,而参考本身有噪声,且从不触及患者的结局。CRQS 把生成报告与参考报告相比对——可 TCGA 的报告被明确描述为「标注噪声高」。因此不一致和幻觉都是对照一个并不完美的真值来计算的:一个「幻觉事实」也许是一处正确的观察,只是在潦草的参考中缺失;而不一致则会惩罚与一个时而有误的参考之间的分歧。TCGA 上 0.5 的幻觉率,部分反映的是参考质量,而不仅仅是模型的失败。该指标在任何环节都不触及临床结局:没有病理学家对最终报告的读者研究,也没有前瞻性验证。此外还有一个被承认的人群偏倚——只有三个数据集,且以西方为主(包括美国的 TCGA):对其他实验室和人群的泛化并未受检验。
未经检验的设计选择。CRQS 的权重(0.30 / 0.40 / 0.20 / 0.40)是手工设定的,没有敏感性分析来展示若重新赋权排名会如何变动;而单份报告可能得到负分(CIN 案例为 −0.07),因此 0 到 1 的归一化只在平均意义上成立。最后,批大小为 1 和固定的解码策略未必发挥出每种方法的最佳配置:这些绝对数字应被视作基准内部的比较,而非某一给定模型的性能上限。
这意味着什么
对研究界而言,讯息很清楚:在病理报告生成中,临床正确性——而非词汇重叠——应成为首要标准,且评估应横跨多个数据集与编码器,以免得出只在单一设置下成立的结论。可复用的框架与划分降低了做一次诚实比较的成本。接下来要做的是「验证这个验证者」:把 CRQS 的抽取误差对照病理学家加以量化,检验它对权重的敏感性,并把评估与临床结局挂钩。
对临床医生而言,没有可部署之物——这是一件为科研系统打分的工具,而非医疗器械。但其教训直接有用:某厂商若为一款自动报告工具吹嘘「BLEU/ROUGE 达到最先进水平」,它几乎没有谈及任何临床安全性。真正该问的是:对照经病理学家核验的参考,其事实覆盖率、幻觉率与不一致率各为多少。
对患者与公众而言,这项研究给「人工智能替你写病理报告」之类的标题降了温。在贴近现实的自由文本数据(TCGA)上,当前系统会凭空产生约一半的临床事实,临床忠实度评分很低——哪怕它们的报告「读起来很顺」。自动化的病理报告仍是一个研究问题,而非临床产品——而真正的进步,将以事实的准确性、而非文字的流畅度来衡量。
延伸阅读
预印本见 arXiv(2607.18448),由 Suryakant Singh、Sejuti Majumder、Beatrice Knudsen、Joel Saltz 和 Prateek Prasanna(Stony Brook University;University of Utah)于 2026 年 7 月提交,尚未经过同行评审。评估框架与数据划分以 PathBench(GitHub) 的名义发布。关于基于语言模型的评估与病理基础模型,另见我们关于用 LLM 评估者为医疗 AI 打分的局限、通过蒸馏专家来构建病理基础模型,以及组织病理学基础模型的鲁棒性与泛化的解读。
编辑透明度:法文版由 Tatakoto 编辑部在阅读该预印本后撰写并署名。英文、西班牙文和中文译文在人工智能协助下产生并经审校。