当临床大模型填错格子:先测量、再修复对 ICD-10、CPT 与 FHIR 模式的合规性

Jianru Shen(University of Montana)在涵盖十个专科的 320 个临床场景中测试三款开源大语言模型——Qwen2.5 7B、Llama 3.1 8B 和 Gemma2 9B——要求每款模型输出符合医疗数据标准 ICD-10、CPT 和 HL7 FHIR 的结构化数据。没有保护机制时,格式合规率因模型不同而停留在 85.9% 到 91.6% 之间;一个自动"先校验再修复"的闭环在两轮迭代内将其提升到 99.0%,约 1% 的情形交由人工处理。但论文衡量的是结构合规,而非临床准确:一个格式完美的编码仍可能在医学上是错误的,而这正是这项工作留下的缺口。

背景

大语言模型(LLM,即 large language model:一种训练来预测文本的神经网络)能够生成流畅的临床文字。问题在于,医院并不靠文字运转。诊断必须转化为 ICD-10 编码(《国际疾病分类》第十版),操作必须转化为 CPT 编码(美国的手术操作术语,用于计费驱动),并且整体要以 HL7 FHIR 格式(Fast Healthcare Interoperability Resources,现代医疗数据互操作标准)在各软件系统之间交换。这些格式就是"模式"(schema):严格的模板,规定有哪些字段、字段是什么类型、以及如何嵌套。

如果模型的输出违反模式——缺字段、编码类型错误、JSON 结构无效——电子病历系统就会拒收。这正是阻碍大模型进入临床的现实瓶颈:模型可以"推理"正确,却仍然产出下游系统无法使用的对象。此前已有一些方法(受限解码、函数调用、强制 JSON 模板),但往往绑定于某个特定模型厂商。论文提出了一个系统性问题:合规缺陷是某个模型独有的,还是整整一代大模型共有的?一个通用的纠错层能否弥合它?

方法

核心是一个"闭环"(控制论意义上的)校验-修复循环。模型先生成结构化输出。一个校验器将其与目标模式(ICD-10、CPT 或 FHIR)比对:这是一种确定性的、无需 AI 的检查,只回答是或否,并指出确切错误。如果输出无效,错误信息连同纠正指令回传给模型;模型重新生成;再次校验。如此重复,直到输出通过或达到迭代上限。最后一道安全网将循环无法修复的情形交给人工。

评估采用配对设计:每个场景运行两次,一次为基线条件(模型不带循环作答),一次带校验-修复循环,从而分离出该机制的净贡献。方案包含涵盖十个医学专科的 320 个临床场景,与三款模型交叉后得到 960 组模型-场景配对。三款大模型均在本地部署——这在医疗领域很重要,因为它避免了将数据发送到第三方云服务。指标简单易读:模式合规率(校验器接受的输出占比)、收敛所需的迭代次数,以及转交人工监督的比例。论文还给出了所遇错误的分类体系。

结果

在基线条件下,格式合规率因模型而异,介于 85.9% 到 91.6% 之间。最能说明问题的不是水平高低,而是三款模型的接近:尽管架构和训练语料各不相同,它们却落在相差 5.7 个百分点的区间内。换言之,合规缺口并非某个模型的偶然:它是共有的,指向这些大模型在学习医疗格式方面的共同不足。加入校验-修复循环后,总体合规率升至 99.0%,实际在 两轮迭代内收敛,约 1% 的情形送交人工复核。错误分析显示,失败多为"表示层"违规——格式问题(缺字段、类型不对、结构畸形),而非深层的理解错误。这与"由校验器提示引导的定向修复即足以纠正"相一致。

换成具体数字有助于理解。每 1000 条结构化输出,基线条件下约有 85 到 140 条不合规——都是电子病历会拒收或错误录入的对象。经过循环后,约剩 10 条,交由人工处理。运营收益是实打实的:从一个禁止自动化的失败率,降到一个可由监督消化的残余。但这笔账没有回答论文避而不谈的另一个问题:在如今"合规"的 990 条输出中,有多少带的是正确的编码?

做得好的地方

跨三大模型家族的配对评估。把 Qwen、Llama 和 Gemma 放进同一方案,分别在基线与修复下运行,分离出机制的效果,并表明合规缺陷是系统性的(厂商之间差距不到 5.7 个百分点)。这比单模型演示更有说服力。

一个简单、确定、与厂商无关的修复层。校验依赖模式而非 AI 判断:可复现、可验证。循环在两轮内收敛,且不论底层是哪款模型都能工作,使其成为一个无需厂商锁定(vendor lock-in)即可部署的组件。

一套能解释结果的错误分类。指出失败主要是格式违规而非语义错误,阐明了为何由校验器引导的修复就已足够。对于想设计定向保护而非昂贵重训练的人,这是有用的贡献。

做得欠佳的地方

指标若读得太快就会误导。"模式合规"意味着句法正确:输出有正确的形状。它对临床正确只字不提:一个格式正确却指向错误疾病的 ICD-10 编码,会 100% 通过校验。校验器检查的是模板,而非医学真相。因此所宣称的 99.0% 衡量的是形式;论文并未衡量——也不声称衡量——有多少编码在临床上是正确的。这正是经典的"误导性指标"失效模式。

场景是构造出来的,没有真实病历,也没有真实部署。320 个场景是一个测试台,而非某家医院的患者病历,既无多中心外部验证,也未在真实电子病历中测试集成。能否推广到真实数据的多样性与噪声,尚待证明。

1% 的残余与过度信任的风险。在每天产出数百万文档的医院系统规模下,1% 代表相当可观的待复核量。更重要的是,"修复后"的输出格式规整、因而令人安心:它诱导盲目自动化(automation bias),而修复其实并未触及内容本身。再加上所测模型体量偏小(70 亿到 90 亿参数)、工作为单一作者、以会议预印本形式发表(IEEE SMC 2026):这些都是把这些数字当作起点、而非定论的理由。

它改变了什么

对研究界而言,论文提供了一个可复现的框架和一套分类,用于衡量临床大模型的结构可靠性——这一视角有别于医学推理基准。它更重要地标出了下一步任务:把格式合规与编码的语义准确性评估结合起来,后者才是安全真正在意的。

对临床医生和集成团队而言,信息有两层。是的,校验-修复层能在不依赖单一厂商的情况下,让大模型接入电子病历更可靠。不,"可集成"不等于"正确":在内容层面,人工复核依然不可或缺,不能因格式的整洁而放松警惕。

对患者和公众而言,其中的利害看不见却很实在。ICD-10 与 CPT 编码支撑着病历、报销和计费。一个只修形式、不保准确的系统,可能产出完全合规却错误的文档——影响就诊路径或自付费用。形式上的可靠是必要的;但并不充分。

延伸阅读

预印本见 arXiv (2607.24371),已被 IEEE SMC 2026 会议接收。所引标准的背景:世界卫生组织的 ICD-10 分类、美国医学会(American Medical Association)的 CPT 术语,以及 HL7 FHIR 互操作标准。