ChatGPT-4o en traducteur vocal anglais-népalais sur le terrain : 58 % des énoncés fidèles, et 91 % des pires erreurs quand c'est le patient qui parle
Six auteurs de l'Université de Washington, de Georgetown, du NEOMED et de la Kathmandu University School of Medical Sciences ont fait passer 30 conversations réelles, dans des chemins et des échoppes autour de l'hôpital de Dhulikhel au Népal, par le mode vocal de ChatGPT-4o, puis fait noter les 485 énoncés traduits par une évaluatrice bilingue. 58,1 % des traductions préservent le sens, mais 14,2 % le perdent — et 63 de ces 69 échecs, soit 91,3 %, surviennent quand c'est le participant népalophone qui parle. Le résultat le plus utile du papier n'est pas le taux global : c'est que les traductions les plus fausses restaient assez fluides pour que l'interlocuteur anglophone ne s'aperçoive de rien.
Le contexte
La discordance linguistique — le fait que soignant et patient, ou chercheur et participant, ne partagent pas de langue — dégrade mesurablement la compréhension, la satisfaction et la qualité des soins. L'interprète professionnel reste le standard : sa présence améliore ces trois dimensions par rapport à l'interprétation ad hoc (un proche, un agent d'accueil bilingue) ou à l'absence totale d'aide. Mais le recours à l'interprète suppose du budget, des effectifs formés, une intégration dans le système de soins et une planification — quatre conditions qui manquent précisément dans les zones rurales et les rencontres non programmées.
D'où l'intérêt pour les outils numériques. La génération précédente enchaînait trois modules distincts : reconnaissance vocale, traduction automatique, synthèse vocale. Les modèles de langue multimodaux — capables de traiter directement l'audio et de produire de la parole dans une seule interface conversationnelle — suppriment ces coutures et tiennent dans un téléphone. ChatGPT a explicitement été proposé comme solution de communication multilingue dans les pays à revenu faible ou intermédiaire. Accessibilité et fiabilité sont toutefois deux choses différentes : aucun de ces systèmes n'a été développé ni validé comme substitut d'un interprète.
Le népali est ce qu'on appelle une langue peu dotée (low-resource language) : peu de corpus parallèles, peu de données audio annotées, peu de travaux de recherche. Il combine par ailleurs des traits qui compliquent la traduction automatique — structure sujet-objet-verbe, pronoms dépendants du contexte, système d'honorifiques (le tapai respectueux face au timi familier), expressions culturellement ancrées, variation dialectale régionale. Les évaluations antérieures de traduction automatique du népali avaient déjà relevé des pertes lexicales, syntaxiques, sémantiques et culturelles.
Surtout, l'essentiel des évaluations publiées porte sur du texte écrit : phrases standardisées, jeux de données figés, consignes de sortie d'hospitalisation préparées, comparaisons rétrospectives à une traduction de référence. Or l'usage réel d'un traducteur vocal, c'est de la parole spontanée avec hésitations, répétitions, phrases inachevées, bruit de fond et chevauchement de tours de parole. C'est ce vide que le papier vient combler.
La méthode
Le dispositif. Étude transversale observationnelle, menée en juillet et août 2025 dans un rayon d'environ 5 kilomètres autour de l'hôpital de Dhulikhel, district de Kavrepalanchok. Recrutement de convenance dans l'espace public — chemins de randonnée, échoppes de bord de route — explicitement hors de l'enceinte hospitalière, et aucun patient en cours de prise en charge n'a été sollicité. Critères d'inclusion : 18 ans ou plus, népalophone principal, capable de consentir. Aucune exclusion sur le niveau d'éducation, la littératie, la familiarité avec la technologie ou le recours antérieur aux soins. Le protocole visait 20 à 30 participants ; 30 ont été inclus. Aucun calcul de puissance : l'étude est descriptive et exploratoire, et les auteurs l'écrivent.
Le matériel. Abonnement payant OpenAI, modèle GPT-4o, iPhone 13 Pro sous iOS 16.6.1, réseau mobile Ncell. Une session ChatGPT neuve par participant. Une invite d'initialisation strictement identique à chaque fois, demandant au modèle de ne traduire que ce qui est dit, sans rien ajouter ni résumer. Un enregistrement audio séparé couvrait toute la conversation.
Les questions. Quatre, en anglais, arrêtées après pré-test : l'âge ; la fréquentation de l'hôpital de Dhulikhel (avec, le cas échéant, le motif et le mode de transport) ; ce que la personne fait pour rester en bonne santé ; sa fête préférée et la manière dont elle la célèbre. Elles sont volontairement non diagnostiques et à faible risque — le but est de produire de la parole naturelle, pas d'évaluer une décision clinique. Le collaborateur népalophone de l'équipe assistait au recrutement mais ne participait pas à la conversation : le modèle était seul dans la boucle.
L'évaluation. Une unique évaluatrice bilingue, de niveau ACTFL Advanced-Mid, a réécouté les enregistrements en parallèle des transcriptions ChatGPT et noté chacun des 485 énoncés traduits sur une échelle à trois points : 3 = sens central intégralement préservé et rendu naturel ; 2 = idée principale conservée avec une ou deux erreurs notables de grammaire, de lexique ou de formulation ; 1 = sens significativement altéré, obscur ou perdu. En parallèle, elle a construit de façon inductive — c'est-à-dire à partir des données, sans grille préexistante — une taxonomie de déviations, affinée au fil des transcriptions puis appliquée une seconde fois à l'ensemble du corpus avec le jeu final de catégories. Un même énoncé pouvait recevoir plusieurs étiquettes. Dix-neuf types de déviations ont été identifiés, parmi lesquels : distorsion du sens, formulation trop formelle, omission, ajout, sur-interprétation, erreur de nombre, recours à des mots hindis, perte de nuance, délai supérieur à trois secondes, absence de traduction, coupure en cours de phrase, registre trop familier, dialecte inadapté, mauvaise langue de sortie.
L'éthique. Protocole approuvé par le comité d'éthique de la Kathmandu University School of Medical Sciences (IRC-KUSMS, avis n° 171/25, 16 juillet 2025). Consentement écrit, autorisation d'enregistrement séparée, information explicite que la parole serait traitée par ChatGPT sur des serveurs externes.
Les résultats
La distribution globale. Sur 485 énoncés traduits, 282 (58,1 %) notés 3, 134 (27,6 %) notés 2, 69 (14,2 %) notés 1. Autrement dit, un peu plus d'un énoncé sur sept subit une altération de sens jugée significative, et près d'un sur trois demande une clarification.
L'asymétrie de direction est le résultat central. En anglais vers népali, note moyenne 2,63 ± 0,53 : sur 257 énoncés, 167 (65,0 %) notés 3 et seulement 6 (2,3 %) notés 1. En népali vers anglais, note moyenne 2,23 ± 0,86 : sur 228 énoncés, 115 (50,4 %) notés 3 mais 63 (27,6 %) notés 1. Sur les 69 échecs du corpus, 63 — soit 91,3 % — se produisent donc quand c'est le participant qui parle. L'écart-type est systématiquement plus grand dans ce sens, pour toutes les questions : ce n'est pas seulement moins bon, c'est moins prévisible.
La question la plus ouverte est la plus mal traduite. Côté anglais vers népali, la meilleure note va à la question sur l'âge (2,79 ± 0,48), puis à l'hôpital (2,68 ± 0,47) et à la fête préférée (2,64 ± 0,48) ; la pire à « que faites-vous pour rester en bonne santé ? » (2,33 ± 0,63). Côté népali vers anglais, la hiérarchie est la même mais tassée vers le bas : 2,33 ± 0,83 pour l'hôpital, 2,26 pour l'âge et la fête, et 1,85 ± 0,86 pour la santé. La question qui appelle une réponse libre, sans forme attendue, est celle où le système décroche.
Les modes de défaillance. La distorsion du sens arrive en tête (65 occurrences, 17,1 % des étiquettes assignées), devant la formulation trop formelle (56 ; 14,7 %), l'omission (54 ; 14,2 %) et l'ajout (44 ; 11,5 %). Suivent la sur-interprétation (23 ; 6,0 %), la demande de clarification (15 ; 3,9 %), l'erreur de grammaire (14 ; 3,7 %), l'erreur de nombre (13 ; 3,4 %), l'emploi de hindi (12 ; 3,2 %), le délai supérieur à trois secondes et l'absence totale de traduction (10 chacun ; 2,6 %), la perte de nuance (7 ; 1,8 %), la réponse en anglais alors que le népali était attendu et la coupure en cours de phrase (6 chacune ; 1,6 %). Trente-cinq étiquettes (9,2 %) correspondent à un participant passant lui-même à l'anglais — un choix conversationnel, pas une erreur du système.
Ce que ça donne concrètement. Les exemples rapportés sont plus parlants que les pourcentages. Un participant déclare « je suis agriculteur, travail agricole » ; la traduction sortie est « je marche un peu chaque jour ». Un âge de 67 ans devient 47 ans. Une personne dit aimer toutes les fêtes ; le système lui prête une préférence pour Dashain et Tihar. À la question « que faites-vous pour rester en bonne santé ? », le modèle a restitué une question antérieure, sur le mode de transport jusqu'à l'hôpital. Ailleurs, le tapai respectueux devient timi, familier, ce qui fait paraître le locuteur irrespectueux sans rien changer au sens. Le mot hindi achha remplace le népali thik cha. À l'inverse, le modèle traduit correctement l'expression idiomatique sathi bhai par « amis » plutôt que littéralement.
Traduction pratique. Pour un entretien de vingt tours de parole du côté du patient, la distribution observée dans le sens népali vers anglais donne en moyenne cinq à six énoncés dont le sens est significativement altéré, et environ dix qui ne sont que partiellement fidèles. Le point critique n'est pas le volume : c'est que ces énoncés altérés arrivent en anglais fluide, grammatical et plausible, sans aucun signal permettant à l'interlocuteur de les repérer.
Ce qui est bien
Le protocole est constant là où ça compte, et l'évaluation est faite en conditions réelles. Même facilitateur anglophone, même appareil, même compte, même version de modèle, même invite d'initialisation, mêmes questions, sur les 30 rencontres. Cette stabilité est ce qui autorise à attribuer la variance observée à la parole et au système plutôt qu'au dispositif. Et elle s'applique à des conversations spontanées en extérieur, avec bruit, hésitations et code-switching — pas à un corpus écrit. C'est précisément la condition d'usage réelle que la littérature existante ne couvrait pas.
La taxonomie sépare ce que l'AUC ou le BLEU agrègent. Note globale d'un côté, dix-neuf catégories de déviation de l'autre : la construction distingue explicitement les erreurs qui abîment le naturel de la conversation (registre trop formel, dialecte inadapté, latence) de celles qui abîment la fidélité (distorsion, ajout, erreur de nombre). Cette séparation est la contribution réutilisable du papier. Une métrique agrégée unique aurait mélangé une formulation livresque et un âge faux de vingt ans, qui n'ont pas les mêmes conséquences.
Les auteurs démontent eux-mêmes leur résultat le plus vendeur. L'asymétrie de direction est le titre potentiel de l'étude ; ils écrivent qu'elle est confondue avec le type d'entrée, puisque les questions anglaises étaient standardisées et répétées trente fois tandis que les réponses népalies étaient spontanées, de longueur et de clarté variables. Ils ajoutent qu'il leur est impossible de distinguer une erreur née à la reconnaissance vocale d'une erreur née à la traduction. Le jeu de données désidentifié des notes et des codes est publié en annexe. Aucun conflit d'intérêts déclaré, et aucun financement industriel n'apparaît.
Ce qui est moins bien
Une seule évaluatrice, aucune fiabilité inter-juges — et c'est toute la mesure. Les 485 notes et les 19 catégories de déviation proviennent d'une personne. Les auteurs le signalent, mais la portée du problème mérite d'être explicitée : ici, l'étiquette est le résultat. Il n'existe pas de vérité terrain indépendante — pas de traduction de référence produite par un interprète professionnel, pas de second codeur, pas de coefficient kappa. Toute la structure fine de la taxonomie repose sur le jugement linguistique d'une seule personne, de surcroît anglophone évaluant du népali à un niveau Advanced-Mid, soit un niveau élevé mais non natif. C'est le mode de défaillance classique des études de qualité de traduction : la métrique trompeuse prend ici la forme d'un étiquetage non validé.
Le comparateur manquant est l'interprète humain. On apprend que 14,2 % des énoncés sont significativement altérés. On ignore complètement ce que produirait, sur les mêmes conversations, un interprète professionnel, un interprète ad hoc, Google Translate ou un modèle plus récent. Or la question de décision n'est jamais « ChatGPT-4o est-il parfait ? » mais « ChatGPT-4o vaut-il mieux que ce qui est disponible ici et maintenant ? », et dans les contextes visés par le papier, l'alternative réaliste est souvent l'absence totale d'aide. Sans ligne de base, le lecteur ne peut pas répondre, et l'étude ne le prétend pas. Ajoutons que le modèle testé, GPT-4o, était déjà d'une génération antérieure au moment de la mise en ligne : les chiffres datent une configuration, pas une technologie.
Biais de population, échantillon minuscule, et une incohérence de comptage. Trente adultes recrutés par convenance dans un rayon de cinq kilomètres autour d'un seul hôpital : la généralisation à d'autres régions du Népal, à d'autres dialectes, à des populations plus âgées ou moins scolarisées, ou à un contexte clinique n'est ni testée ni acquise. L'âge, le sexe et la littératie ont été recueillis mais n'ont pas été intégrés à l'analyse, si bien qu'on ne sait pas si la performance dépend de qui parle — ce qui est pourtant l'hypothèse la plus évidente à tester. Détail arithmétique enfin : le résumé annonce 329 étiquettes de déviation, mais les effectifs et pourcentages du tableau 3 impliquent un dénominateur d'environ 380 (65 étiquettes valent 17,1 %, soit un total de 380). L'écart ne change pas le classement des modes de défaillance, mais un dénominateur incohérent entre résumé et tableau est le genre de détail qu'une relecture par les pairs corrigera — et rappelle qu'il s'agit d'un préprint.
Ce que ça change
Pour la communauté de recherche. Le papier déplace la question d'évaluation. Tant qu'on mesure la traduction automatique sur du texte écrit avec des métriques de similarité, on optimise une quantité — la ressemblance à une référence — qui ne dit rien du risque. Ce travail montre qu'en conditions de parole spontanée, la variable qui compte est la détectabilité de l'erreur par l'utilisateur : une sortie fluide et grammaticalement correcte qui invente une information est plus dangereuse qu'une sortie manifestement cassée, parce que la seconde déclenche une demande de répétition et la première non. C'est une propriété que les métriques de fidélité classiques ne capturent pas du tout, et qui appelle des travaux sur des mécanismes de signalement — traduction inverse affichée, score de confiance, détection d'ajout — plutôt que sur des points de BLEU supplémentaires. La deuxième piste ouverte est l'asymétrie : si elle se confirme dans un dispositif qui contrôle le type d'entrée, elle signifie que ces outils comprennent mieux qu'ils ne se font comprendre, ce qui, dans une consultation, revient à amplifier la voix du soignant et à dégrader celle du patient.
Pour les cliniciens. Rien ici ne justifie de remplacer un interprète, et les auteurs sont nets là-dessus. Ce que le papier fournit en revanche, c'est une liste de signaux d'alerte utilisables tout de suite par quiconque se retrouve à utiliser un traducteur vocal faute de mieux : les nombres (âge, durée, posologie, fréquence) sont mal restitués dans 3,4 % des étiquettes, ce qui suffit à faire répéter et confirmer systématiquement toute quantité ; les questions ouvertes sont le régime le plus dégradé, ce qui plaide pour des questions courtes et fermées ; le sens patient vers soignant est le plus fragile, ce qui impose de reformuler ce qu'on a cru comprendre et de le faire valider. Et surtout : une réponse qui sonne bien n'est pas une réponse fidèle.
Pour les patients et le public. L'intuition dominante veut que l'IA fasse des erreurs visibles — du charabia, une phrase qui ne veut rien dire. Ce papier documente l'inverse dans un cas concret et vérifiable : le système a transformé « je suis agriculteur » en « je marche un peu chaque jour », et personne dans la conversation n'avait de moyen de s'en apercevoir. Il y a là une asymétrie d'équité qui dépasse la technique. Les langues les mieux dotées en données — anglais, mandarin, espagnol — bénéficient d'outils plus fiables ; les langues moins dotées héritent d'outils dont l'apparence de qualité est identique et dont la fidélité ne l'est pas. À mesure que ces assistants vocaux se répandent dans les systèmes de santé à ressources limitées, c'est cette différence invisible, et non la performance moyenne, qui déterminera qui est correctement entendu.
Pour aller plus loin
Le préprint : Accuracy and error patterns of ChatGPT-4o for real-time English–Nepali voice translation: A cross-sectional field evaluation in rural Nepal, medRxiv, DOI 10.64898/2026.08.25.26361303, mis en ligne le 28 août 2026, sous licence CC BY 4.0. Auteurs : Alyssa Mandich (School of Medicine, University of Washington), Shirsha Koirala (Northeast Ohio Medical University), Sophie Westen (Georgetown University), Saisha Adhikari (Association of State and Territorial Health Officials), Ashraya Acharya et Abha Shrestha (Department of Community Medicine, Kathmandu University School of Medical Sciences, Dhulikhel Hospital). Le jeu de données désidentifié des notes d'exactitude et des codes d'erreur est publié en annexe (S1 File) ; les enregistrements audio et les transcriptions intégrales ne sont pas accessibles publiquement et seront détruits en juillet 2027, un accès sur demande motivée restant possible auprès de l'IRC-KUSMS. Aucun conflit d'intérêts déclaré. Le projet a bénéficié de l'appui du University of Washington Global Health Immersion Program.