ChatGPT Health 用于分诊:多轮对话并不能让建议更安全

Alvira Tyagi、Girish Nadkarni、Bilal Naved 及其同事(Icahn School of Medicine at Mount Sinai 及合作方)让 ChatGPT Health 处理了 255 个分诊病例——由临床医生撰写的病例小节、真实的急诊就诊记录以及真实的护士热线电话——以检验与 AI 对话是否有助于把患者引导到正确的就医层级。结果是:与人类标准的完全一致率仍在 50% 左右;更关键的是,当 AI 偏离护士标准时,它在近七成的病例中低估了紧急程度,其中严重低估约占十分之一。这里的教训不是一个分数,而是一个错误的方向——一款面向大众的助手,其对话的流畅掩盖了系统性的"虚假安心"偏差,而且多聊几句非但不能纠正它,反而使之更糟。

背景

越来越多的人在决定是留在家里、给医生打电话还是直奔急诊之前,会先向对话式助手描述自己的症状。这个看似平常的举动,本质上是一项分诊任务:把患者自述的、不完整的信息转化为一个紧急程度。临床分诊是一种在不确定性下的决策,需要在两种相反的风险之间取得平衡——过度分诊会把人不必要地送往急诊、加重系统负担,而分诊不足则会延误必要的救治。因此,错误的方向与其频率同样重要。

ChatGPT Health 是一款基于大语言模型(LLM)的面向大众的健康助手——LLM 是一种经训练后能根据提示生成自然语言文本的系统。其支持者的论点是:以往的评估往往基于单一固定的问题,会低估那些为对话而设计的系统。既然分诊护士会通过连续提问来完善判断,一个能够同样做到的模型理应引导得更好。本研究检验的正是这一假设——多对话等于更好的分诊。

方法

作者对 ChatGPT Health 进行了一项回顾性、横断面的评估,涵盖来自三个来源的 255 个病例:39 个由临床医生撰写的标准化病例小节(覆盖 21 个临床领域)、76 例马里兰州一家社区急诊科的真实就诊,以及 140 通打给美国一家大型医院系统护士分诊热线的真实电话。每个病例在两种模式下呈现。在"自然"模式(single-turn,单轮)中,模型只收到一句描述症状的话,随后给出建议——这是匆忙的患者的典型用法。在"多轮"模式(multi-turn)中,模型被要求像护士那样一次问一个问题,再作结论;评分者根据病历作答,信息缺失时回答"我不知道"。

每条建议按四级有序量表评分:A(居家)、B(24 小时之后就诊)、C(24 小时内就诊)、D(前往急诊),其中 D 最为紧急。两个参考标准作为基准:医生裁定,以及基于 Schmitt-Thompson 协议的护士分诊——这是电话分诊公认的标准。研究测量了完全一致率、加权 Cohen kappa(一种经随机校正的一致性指标:0 = 随机,1 = 完美)、平均有序距离(相差的级数),尤其是错误的方向——分诊不足还是过度分诊——并设两个关键类别:安全关键性分诊不足(至少比参考低两级,即危险模式)与利用关键性过度分诊(至少高两级,即高成本模式)。所有评估于 2026 年 3 月 5 日至 5 月 21 日在标准的大众版应用上完成,未使用自定义系统提示,病例之间清除历史记录。

结果

完全一致率平平且稳定。相对护士分诊,ChatGPT Health 在自然模式下有 52.9% 完全答对,多轮模式下为 55.7%;相对医生裁定则为 54.1%48.2%。加权 kappa(0.36 至 0.44)仅反映尚可到中等的一致性。换言之,模型大约有一半时间与人类标准吻合——而切换到对话并不改变这另一半。

真正的信号在别处。当 AI 偏离护士分诊时,偏差明显倒向同一侧:自然模式下 70.8% 的分歧是分诊不足(P < 0.0001),多轮模式下为 69.0%(P < 0.0001)。模型低估紧急程度远多于高估。严重分诊不足——在参考标准会让人去急诊时却建议居家或等待——在护士标准下影响了自然模式 10.2%、多轮模式 8.6% 的病例。换成临床语言:在 1000 个如此咨询的人中,约有一百人会得到危险的安心建议。而这种严重分诊不足在从合成病例小节(5.1%)转向真实病例(急诊 10.5%、护士热线 17.9%)时会加剧:病例越接近真实生活,危险错误就越频繁。

对话帮不上忙。两种模式的完全一致率无显著差异(McNemar 检验,相对护士分诊 P = 0.43),而相对医生标准,多轮模式甚至有更加偏离的趋势。更糟的是,在多轮模式中,对话越长,建议就越偏离正确答案(Spearman 相关 ρ = 0.162,P = 0.010)——这一关联在自然模式中并不存在。作者诚实地指出,疑难病例天然会引出更多提问,从而模糊了任何因果解读,但结论依然成立:拉长对话并不能靠近正确的分诊。最后,表现因主诉而异:呼吸系统(一致率 75.0%)和神经系统(70.0%)主诉表现较好,优于皮肤科(45.2%)、消化科(48.8%)或难以归类(38.5%)的主诉。

做得好的地方

一套兼顾病例小节与真实患者的方案。研究没有满足于实验室式的病例小节,而是让模型面对 216 个由临床医生裁定的真实病例(急诊加护士热线)。正是这一点揭示了最令人担忧的事实:严重分诊不足从病例小节的 5.1% 升至真实电话的 17.9%。纯合成的测试会带来虚假的安心。

衡量错误的方向与严重程度,而非仅看平均值。概念性贡献正在于此:把总体一致率(约 50%,平平无奇)与错误的结构(70% 的分诊不足偏差,危险)区分开来。通过报告有序距离、方向和关键类别,作者表明,同样的"50% 一致"可能因错误的方向不同,而隐藏着一群或安全或致命的错误。

正面检验"多对话=更好"这一假设。研究不止于指出弱点:它直接驳斥了那个经典论点——认为单轮评估对为对话而设计的系统不公平。通过表明多轮并未改善、且长对话反而降低准确性,它以专门为此设计的实验,回应了一个具体而反复出现的异议。

做得不够的地方

误导性指标,这里被反过来利用,但始终潜伏。文章本身就在对抗这个陷阱,但它提醒我们这一陷阱多么普遍:一则宣称"ChatGPT Health 有一半时间与护士一致"的新闻稿在技术上属实,在临床上却危险,因为失败的那一半倒向虚假安心。要点是:在查看错误的方向之前,总体一致率并不能说明安全性。

算不上真正的金标准,也没有前瞻性检验。两个人类参考标准彼此也只有 59.6% 的病例一致,而护士分诊往往比医生裁定更谨慎——因此"正确答案"本身是模糊的。更重要的是,评估是回顾性的:它依据的是病例小节文本和病历记录,而非与真实患者的现场对话——真实患者会答得笨拙、遗漏细节或陷入恐慌。真实条件下的表现可能更差——或只是不同。这是一种被承认的测量偏差,但确实存在。

单一系统、受训中的评分者,以及一处需要注意的利益冲突。该研究只测试了一款产品(ChatGPT Health)、只在某一时点(2026 年 3 月至 5 月);一个快速迭代的模型明天可能表现不同。为 AI 回答评分的多为医学生和一名博士研究员,部分人的评分者间信度仅为尚可(在敏感性分析中不得不排除一名异常评分者,但未改变结论)。最后,一位资深作者申报了对数字分诊公司 Clearstep 的经济利益——已申报并加以管理,但值得留意,因为该结论倾向于用确定性的安全护栏取代"纯生成式",这与此类产品的方向一致。

它改变了什么

对研究界而言,方法学信息很明确:仅凭总体一致率来评估一款面向大众的健康助手已经不够。必须测量与参考标准的距离、错误的方向、错误集中的紧急程度层级,并在真实条件下而不仅在病例小节上进行测试。本研究提供了一套模板——以及公开的代码——来做到这一点。

对临床医生而言,一个立即可行的实际做法:在问诊中加入"您来之前是否咨询过 AI?"这一问题。带着模型生成的虚假安心而来的患者,可能已经拖延,或在淡化自己的症状;有时需要把他们从错误建议中"去锚定"。由于分诊不足集中在高紧急度病例(C-D 级),模型恰恰在错误代价最高之处失灵。

对患者和公众而言,教训很朴素:对话式助手的流畅并不等于安全,更长的对话也不会让它更可靠。面对急性症状——胸痛、呼吸困难、神经系统体征——这类工具可能给出错误的安心。这些平台需要明确的警示和确定性的安全护栏;作者认为,它们事实上被当作分诊工具来使用,理应作为医疗器械软件接受监管。

延伸阅读

该预印本可在 medRxiv(DOI 10.64898/2026.07.21.26358588) 获取,无外部资助,采用 CC BY-NC-ND 4.0 许可;分析代码在 GitHub,数据在 Zenodo。关于背景,可参见 Ramaswamy 等人对 ChatGPT Health 的结构化评估(Nature Medicine,2026)以及 Schmitt-Thompson 护士分诊协议。