ChatGPT-4o 在田野中充当英语-尼泊尔语语音口译:58 % 的语句忠实,而 91 % 的最严重错误发生在患者开口时
来自华盛顿大学、乔治城大学、东北俄亥俄医科大学以及加德满都大学医学院的六位作者,在尼泊尔杜利凯尔医院周边的步道和路边小店里,用 ChatGPT-4o 的语音模式完成了 30 场真实对话,随后由一位双语评审对全部 485 条翻译语句逐条评分。58.1 % 的翻译保留了原意,但 14.2 % 丢失了原意——而这 69 次失败中的 63 次,即 91.3 %,都发生在尼泊尔语受访者开口说话的时候。这篇论文最有价值的发现不是总体比例,而是:那些最不准确的翻译依然足够流畅,英语一方的听者察觉不到任何异常。
背景
语言不一致——医生与患者、或研究者与受访者之间不共享同一种语言——会以可测量的方式削弱理解度、满意度和医疗质量。专业口译员仍是金标准:相比临时充当口译的人(家属、会双语的前台)或完全没有语言协助,专业口译在这三个维度上都更好。但使用口译员需要预算、受过训练的人力、纳入医疗体系的制度安排以及提前预约——而这四个条件恰恰是农村地区和临时性接触所缺乏的。
由此产生了对数字工具的兴趣。上一代方案是三个独立模块的串联:语音识别、机器翻译、语音合成。多模态语言模型——能够直接处理音频并在单一对话界面中输出语音——消除了这些接缝,而且装进一部手机就够了。ChatGPT 已被明确提议作为中低收入国家多语言沟通的解决方案。然而可及性与可靠性是两回事:这些系统中没有任何一个是作为口译员的替代品来开发或验证的。
尼泊尔语属于所谓的低资源语言(low-resource language):平行语料少、标注音频少、相关研究少。它还兼具若干使机器翻译更困难的特征——主宾谓语序、依赖语境的代词、敬语体系(尊敬的 tapai 对应随意的 timi)、有文化根基的表达方式、地区方言差异。此前对尼泊尔语机器翻译的评估已经发现过词汇、句法、语义和文化层面的损失。
更关键的是,已发表的评估绝大多数针对书面文本:标准化句子、固定数据集、事先准备好的出院医嘱、与参考译文的回顾性比较。而语音翻译器的真实使用场景是自发口语:有犹豫、有重复、有未说完的句子、有背景噪音、有话轮重叠。这正是本研究填补的空白。
方法
研究设计。横断面观察性研究,于 2025 年 7 月和 8 月在尼泊尔卡夫雷帕兰乔克县杜利凯尔医院周边约 5 公里范围内进行。在公共空间(步道、路边小店)便利抽样招募,明确在医院院区之外进行,未接触任何在诊患者。纳入标准:年满 18 岁、以尼泊尔语为主要语言、具备知情同意能力。未按教育程度、识字水平、技术熟悉度或既往就医情况设置排除标准。方案预计纳入 20 至 30 人,最终纳入 30 人。未做效能计算:研究属描述性和探索性质,作者对此有明确说明。
设备。OpenAI 付费订阅,GPT-4o 模型,运行 iOS 16.6.1 的 iPhone 13 Pro,Ncell 移动网络。每位受访者启用一个全新的 ChatGPT 会话。每次使用完全相同的初始化提示词,要求模型只翻译所说的内容,不添加、不概括。另有一台独立设备全程录音。
问题。四个英语问题,经预测试后定稿:年龄;是否去杜利凯尔医院(如去,因何事、如何前往);平时做什么来保持健康;最喜欢的节日以及如何庆祝。这些问题刻意设定为非诊断性、低风险——目的是引出自然口语,而非评估临床决策。团队中会尼泊尔语的协作者在招募时在场,但不参与对话本身:回路中只有模型。
评估。由一位双语评审(ACTFL Advanced-Mid 水平)对照 ChatGPT 文字记录重听全部录音,对 485 条翻译语句逐条按三点量表评分:3 分 = 核心含义完整保留且表达自然;2 分 = 主旨保留但存在一到两处明显的语法、用词或表述错误;1 分 = 含义被显著改变、含混或丢失。同时,她以归纳法——即从数据本身出发而非套用既有框架——构建了一套偏差分类体系,在阅读转录稿的过程中不断细化,最后用定稿的类别集对全部语料再做一遍标注。同一条语句可获得多个标签。共识别出十九种偏差类型,包括:含义扭曲、措辞过于正式、遗漏、增添、过度解读、数字错误、混入印地语词汇、语气或言外之意丢失、延迟超过三秒、完全无翻译输出、句子中途截断、语域过于随意、方言不当、输出语言错误。
伦理。方案经加德满都大学医学院机构审查委员会批准(IRC-KUSMS,批件号 171/25,2025 年 7 月 16 日)。书面知情同意,录音单独授权,并明确告知语音将由 ChatGPT 在外部服务器上处理。
结果
总体分布。485 条翻译语句中,282 条(58.1 %)评为 3 分,134 条(27.6 %)评为 2 分,69 条(14.2 %)评为 1 分。换言之,略多于七分之一的语句发生了被判定为显著的含义改变,接近三分之一需要澄清。
方向不对称是核心结果。英译尼方向,平均分 2.63 ± 0.53:257 条中 167 条(65.0 %)为 3 分,仅 6 条(2.3 %)为 1 分。尼译英方向,平均分 2.23 ± 0.86:228 条中 115 条(50.4 %)为 3 分,但有 63 条(27.6 %)为 1 分。全部 69 次失败中,63 次即 91.3 % 发生在受访者说话时。而且在所有问题上,这个方向的标准差都系统性更大:不只是更差,而且更难预测。
最开放的问题翻译得最差。英译尼方向,得分最高的是年龄问题(2.79 ± 0.48),其次是医院问题(2.68 ± 0.47)和节日问题(2.64 ± 0.48);最低的是"你做什么来保持健康?"(2.33 ± 0.63)。尼译英方向排序相同但整体下移:医院问题 2.33 ± 0.83,年龄和节日均为 2.26,健康问题 1.85 ± 0.86。允许自由作答、没有既定形式的问题,正是系统失灵之处。
失败模式。含义扭曲居首(65 次,占所标注标签的 17.1 %),其次是措辞过于正式(56 次,14.7 %)、遗漏(54 次,14.2 %)和增添(44 次,11.5 %)。此后依次为过度解读(23 次,6.0 %)、需要澄清(15 次,3.9 %)、语法错误(14 次,3.7 %)、数字错误(13 次,3.4 %)、混入印地语(12 次,3.2 %)、延迟超过三秒与完全无翻译输出(各 10 次,2.6 %)、言外之意丢失(7 次,1.8 %)、该输出尼泊尔语却输出英语与句子中途截断(各 6 次,1.6 %)。另有 35 个标签(9.2 %)对应受访者自己改说英语——这属于对话选择,不是系统错误。
具体是什么样子。论文给出的实例比百分比更有说服力。一位受访者说"我务农,做农活",输出却是"我每天走一点路"。67 岁被译成 47 岁。有人说自己喜欢所有节日,系统却替他表达了对德赛节和提哈节的偏好。当引导者问"你做什么来保持健康?"时,模型输出的却是之前那个关于如何前往医院的问题。另有场景中,尊敬的 tapai 变成了随意的 timi,含义未变,却让说话者显得失礼。印地语词 achha 取代了尼泊尔语的 thik cha。反过来,模型也正确地把习语 sathi bhai 译为"朋友",而非逐字直译。
换算成实际情形。若一次问诊中患者一方有二十个话轮,按尼译英方向观察到的分布,平均会出现五到六条含义被显著改变的语句,另有约十条只是部分忠实。关键问题不在数量,而在于这些被改变的语句以流畅、合乎语法、听起来合理的英语呈现,听者没有任何信号可据以识别。
做得好的地方
该固定的地方都固定了,而且评估是在真实条件下完成的。30 次接触中,英语引导者、设备、账号、模型版本、初始化提示词和核心问题全部一致。正是这种稳定性,才使得把观察到的方差归因于语音和系统而非实验装置成为可能。而且这一切发生在户外的自发对话中,有噪音、有犹豫、有语码转换——不是书面语料。这恰恰是既有文献未曾覆盖的真实使用条件。
该分类体系把 AUC 或 BLEU 混在一起的东西分开了。一边是总体评分,另一边是十九类偏差:这个设计明确区分了损害对话自然度的错误(语域过于正式、方言不当、延迟)与损害忠实度的错误(扭曲、增添、数字错误)。这种区分是本文可复用的贡献。单一的聚合指标会把"书面腔的措辞"和"年龄错了二十岁"混为一谈,而两者后果完全不同。
作者自己拆解了他们最具卖点的结论。方向不对称是这项研究最可能被拿去做标题的发现;他们却写明这一结果与输入类型相混杂:英语问题是标准化的、重复了三十次,而尼泊尔语回答是自发的,长度和清晰度各异。他们还补充说,无法区分错误产生于语音识别环节还是翻译环节。评分与编码的去标识化数据集作为附件公开。无利益冲突声明,也未见产业资助。
做得不够好的地方
只有一位评审,没有评分者间信度——而这就是全部测量。485 个评分和 19 个偏差类别都出自一个人。作者点明了这一点,但问题的严重性值得说透:在这里,标签本身就是结果。不存在独立的金标准——没有专业口译员产出的参考译文,没有第二位编码者,没有 kappa 系数。整个分类体系的细节结构都建立在一个人的语言判断之上,而且是一位以 Advanced-Mid 水平评估尼泊尔语的英语母语者——水平很高,但不是母语。这是翻译质量研究的经典失败模式:误导性指标在此表现为未经验证的标注。
缺失的对照是人类口译员。我们知道 14.2 % 的语句被显著改变,却完全不知道在同样这些对话上,专业口译员、临时口译者、谷歌翻译或更新的模型会给出什么结果。而真正的决策问题从来不是"ChatGPT-4o 是否完美",而是"在此时此地,ChatGPT-4o 是否优于现有可得的方案"——在本文关注的场景中,现实的替代方案往往是完全没有语言协助。没有基线,读者无从作答,研究本身也没有作出这种宣称。此外,受测模型 GPT-4o 在论文上线时已属上一代:这些数字标定的是某一个配置,而非一项技术。
人群偏倚、样本极小,以及一处计数不一致。在单一医院周边五公里内便利抽样的 30 名成年人:向尼泊尔其他地区、其他方言、更年长或受教育程度更低的人群、或向临床场景的推广,既未验证也不成立。研究收集了年龄、性别和识字情况,却未纳入分析,因此无从判断表现是否取决于说话者是谁——而这本是最显而易见需要检验的假设。最后是一个算术细节:摘要称共有 329 个偏差标签,但表 3 的频数与百分比意味着分母约为 380(65 个标签对应 17.1 %,总数即 380)。这一差异不改变失败模式的排序,但摘要与表格之间分母不一致,正是同行评审会纠正的那类细节——也提醒读者:这是一篇预印本。
这意味着什么
对研究界。这篇论文挪动了评估问题本身。只要仍用相似度指标在书面文本上衡量机器翻译,优化的就是"与参考译文的接近程度"这一与风险无关的量。本研究表明,在自发口语条件下,真正重要的变量是错误能否被使用者察觉:一段流畅、语法正确却凭空捏造信息的输出,比一段明显崩坏的输出更危险,因为后者会触发"请再说一遍",前者不会。经典的忠实度指标完全捕捉不到这一属性;它呼唤的是关于提示机制的研究——显示回译、给出置信度、检测增添内容——而不是再多几个 BLEU 点。第二条开放路径是那个不对称:如果它在控制了输入类型的设计中仍然成立,就意味着这类工具"听懂别人"的能力强于"让别人听懂自己",而在诊室里,这等于放大医生的声音、削弱患者的声音。
对临床医生。本文没有任何内容支持用它取代口译员,作者在这一点上毫不含糊。但论文确实提供了一份可立即使用的预警清单,供那些别无选择只能用语音翻译器的人参考:数字(年龄、病程、剂量、频次)在 3.4 % 的标签中出错,这足以要求对任何数量都系统性地复述并确认;开放式问题是表现最差的场景,因此应尽量使用简短的封闭式问题;患者到医生的方向最脆弱,因此必须复述自己以为听懂的内容并请对方确认。最重要的一点是:听起来对的回答,不等于忠实的回答。
对患者和公众。主流直觉认为人工智能犯的错是看得见的——胡言乱语、不知所云的句子。这篇论文用一个具体、可核查的案例记录了相反的情况:系统把"我务农"变成了"我每天走一点路",而对话中没有任何一方有办法察觉。这里存在一种超出技术层面的公平性不对称。数据资源最丰富的语言——英语、汉语、西班牙语——获得更可靠的工具;资源较少的语言继承的工具,外观上的质量感完全相同,忠实度却不同。随着这类语音助手进入资源有限的卫生系统,决定"谁被正确地听见"的,将是这种看不见的差异,而不是平均性能。
延伸阅读
预印本:Accuracy and error patterns of ChatGPT-4o for real-time English–Nepali voice translation: A cross-sectional field evaluation in rural Nepal,medRxiv,DOI 10.64898/2026.08.25.26361303,2026 年 8 月 28 日上线,采用 CC BY 4.0 许可。作者:Alyssa Mandich(华盛顿大学医学院)、Shirsha Koirala(东北俄亥俄医科大学)、Sophie Westen(乔治城大学)、Saisha Adhikari(美国州与地区卫生官员协会)、Ashraya Acharya 与 Abha Shrestha(加德满都大学医学院社区医学系,杜利凯尔医院)。准确度评分与错误编码的去标识化数据集作为附件(S1 File)公开;录音和完整转录稿不公开,将于 2027 年 7 月销毁,在此之前可凭正当理由向 IRC-KUSMS 申请访问。无利益冲突声明。项目获华盛顿大学全球健康浸润项目支持。