ChatGPT-4o como intérprete de voz inglés-nepalí sobre el terreno: el 58 % de los enunciados es fiel, y el 91 % de los peores errores ocurre cuando habla el paciente

Seis autores de la Universidad de Washington, Georgetown, NEOMED y la Kathmandu University School of Medical Sciences hicieron pasar 30 conversaciones reales — en senderos y tiendas de carretera alrededor del hospital de Dhulikhel, en Nepal — por el modo de voz de ChatGPT-4o, y después una revisora bilingüe calificó los 485 enunciados traducidos. El 58,1 % de las traducciones preserva el sentido, pero el 14,2 % lo pierde — y 63 de esos 69 fallos, es decir el 91,3 %, ocurren cuando quien habla es el participante nepalí. El hallazgo más útil del artículo no es la tasa global: es que las traducciones más erróneas seguían siendo lo bastante fluidas como para que el interlocutor anglófono no notara nada.

El contexto

La discordancia lingüística — que clínico y paciente, o investigador y participante, no compartan idioma — degrada de forma medible la comprensión, la satisfacción y la calidad de la atención. El intérprete profesional sigue siendo el estándar: su presencia mejora las tres dimensiones frente a la interpretación improvisada (un familiar, un recepcionista bilingüe) o a la ausencia total de apoyo. Pero recurrir a un intérprete presupone presupuesto, personal formado, integración en el sistema sanitario y planificación — cuatro condiciones que faltan precisamente en las zonas rurales y en los encuentros no programados.

De ahí el interés por las herramientas digitales. La generación anterior encadenaba tres módulos separados: reconocimiento de voz, traducción automática, síntesis de voz. Los modelos de lenguaje multimodales — capaces de procesar audio directamente y producir habla en una sola interfaz conversacional — eliminan esas costuras y caben en un teléfono. ChatGPT ha sido propuesto explícitamente como solución de comunicación multilingüe en países de renta baja y media. Accesibilidad y fiabilidad son, sin embargo, cosas distintas: ninguno de estos sistemas fue desarrollado ni validado como sustituto de un intérprete.

El nepalí es lo que se llama una lengua de bajos recursos (low-resource language): pocos corpus paralelos, poco audio anotado, escasa investigación. Además combina rasgos que complican la traducción automática — estructura sujeto-objeto-verbo, pronombres dependientes del contexto, sistema de honoríficos (el tapai respetuoso frente al timi familiar), expresiones culturalmente arraigadas, variación dialectal regional. Evaluaciones anteriores de traducción automática del nepalí ya habían detectado pérdidas léxicas, sintácticas, semánticas y culturales.

Sobre todo, la mayor parte de las evaluaciones publicadas se refiere a texto escrito: frases estandarizadas, conjuntos de datos fijos, instrucciones de alta hospitalaria preparadas, comparaciones retrospectivas con una traducción de referencia. Pero el uso real de un traductor de voz es habla espontánea, con vacilaciones, repeticiones, frases inacabadas, ruido de fondo y solapamiento de turnos. Ese es el vacío que llena este trabajo.

El método

El dispositivo. Estudio observacional transversal, realizado en julio y agosto de 2025 en un radio de unos 5 kilómetros alrededor del hospital de Dhulikhel, distrito de Kavrepalanchok. Reclutamiento por conveniencia en espacios públicos — senderos, tiendas de carretera — explícitamente fuera del recinto hospitalario, y sin abordar a ningún paciente en curso de atención. Criterios de inclusión: 18 años o más, hablante principal de nepalí, capaz de consentir. Sin exclusiones por nivel educativo, alfabetización, familiaridad tecnológica o uso previo de servicios sanitarios. El protocolo preveía de 20 a 30 participantes; se incluyeron 30. Sin cálculo de potencia: el estudio es descriptivo y exploratorio, y los autores lo dicen.

El material. Suscripción de pago de OpenAI, modelo GPT-4o, iPhone 13 Pro con iOS 16.6.1, red móvil Ncell. Una sesión nueva de ChatGPT por participante. Una instrucción inicial estrictamente idéntica cada vez, pidiendo al modelo traducir solo lo dicho, sin añadir ni resumir nada. Una grabación de audio separada cubría toda la conversación.

Las preguntas. Cuatro, en inglés, fijadas tras un pretest: la edad; si acude al hospital de Dhulikhel (y en su caso por qué motivo y cómo llegó); qué hace para mantenerse sano; su fiesta preferida y cómo la celebra. Son deliberadamente no diagnósticas y de bajo riesgo — el objetivo es provocar habla natural, no evaluar una decisión clínica. El colaborador nepalí del equipo asistía al reclutamiento pero no participaba en la conversación: el modelo estaba solo en el bucle.

La evaluación. Una única revisora bilingüe, de nivel ACTFL Advanced-Mid, volvió a escuchar las grabaciones junto a las transcripciones de ChatGPT y calificó cada uno de los 485 enunciados traducidos en una escala de tres puntos: 3 = sentido central íntegramente preservado y expresión natural; 2 = idea principal conservada con uno o dos errores notables de gramática, léxico o formulación; 1 = sentido significativamente alterado, confuso o perdido. En paralelo construyó de forma inductiva — es decir, a partir de los datos y no de un esquema previo — una taxonomía de desviaciones, refinada a lo largo de las transcripciones y aplicada después una segunda vez a todo el corpus con el conjunto final de categorías. Un mismo enunciado podía recibir varias etiquetas. Se identificaron diecinueve tipos de desviación, entre ellos: distorsión del sentido, formulación demasiado formal, omisión, adición, sobreinterpretación, error numérico, uso de palabras hindis, pérdida de matiz, retraso superior a tres segundos, ausencia de traducción, corte a mitad de frase, registro demasiado familiar, dialecto inadecuado, idioma de salida equivocado.

La ética. Protocolo aprobado por el comité de ética de la Kathmandu University School of Medical Sciences (IRC-KUSMS, dictamen n.º 171/25, 16 de julio de 2025). Consentimiento escrito, autorización separada para la grabación e información explícita de que el habla sería procesada por ChatGPT en servidores externos.

Los resultados

La distribución global. Sobre 485 enunciados traducidos, 282 (58,1 %) con nota 3, 134 (27,6 %) con nota 2, 69 (14,2 %) con nota 1. Es decir, algo más de un enunciado de cada siete sufre una alteración del sentido considerada significativa, y casi uno de cada tres exige aclaración.

La asimetría de dirección es el resultado central. Del inglés al nepalí, nota media 2,63 ± 0,53: de 257 enunciados, 167 (65,0 %) con nota 3 y solo 6 (2,3 %) con nota 1. Del nepalí al inglés, nota media 2,23 ± 0,86: de 228 enunciados, 115 (50,4 %) con nota 3 pero 63 (27,6 %) con nota 1. De los 69 fallos del corpus, 63 — el 91,3 % — se producen por tanto cuando habla el participante. La desviación típica es sistemáticamente mayor en ese sentido, para todas las preguntas: no solo es peor, es menos predecible.

La pregunta más abierta es la peor traducida. Del inglés al nepalí, la mejor nota corresponde a la pregunta sobre la edad (2,79 ± 0,48), después al hospital (2,68 ± 0,47) y a la fiesta preferida (2,64 ± 0,48); la peor a «¿qué hace usted para mantenerse sano?» (2,33 ± 0,63). Del nepalí al inglés el orden es el mismo pero comprimido hacia abajo: 2,33 ± 0,83 para el hospital, 2,26 para la edad y la fiesta, y 1,85 ± 0,86 para la salud. La pregunta que pide una respuesta libre, sin forma esperada, es donde el sistema se descuelga.

Los modos de fallo. La distorsión del sentido encabeza la lista (65 casos, 17,1 % de las etiquetas asignadas), por delante de la formulación demasiado formal (56; 14,7 %), la omisión (54; 14,2 %) y la adición (44; 11,5 %). Siguen la sobreinterpretación (23; 6,0 %), la petición de aclaración (15; 3,9 %), el error gramatical (14; 3,7 %), el error numérico (13; 3,4 %), el uso de hindi (12; 3,2 %), el retraso superior a tres segundos y la ausencia total de traducción (10 cada uno; 2,6 %), la pérdida de matiz (7; 1,8 %), la respuesta en inglés cuando se esperaba nepalí y el corte a mitad de frase (6 cada uno; 1,6 %). Treinta y cinco etiquetas (9,2 %) corresponden a un participante que pasa por sí mismo al inglés — una elección conversacional, no un error del sistema.

Qué significa esto en concreto. Los ejemplos publicados dicen más que los porcentajes. Un participante declara «soy agricultor, trabajo agrícola»; la salida es «camino un poco cada día». Una edad de 67 años se convierte en 47. Alguien dice que le gustan todas las fiestas; el sistema le atribuye preferencia por Dashain y Tihar. A la pregunta «¿qué hace para mantenerse sano?», el modelo produjo en su lugar una pregunta anterior sobre el transporte al hospital. En otro caso el tapai respetuoso pasa a timi, familiar, lo que hace sonar irrespetuoso al hablante sin cambiar el sentido. La palabra hindi achha sustituye al nepalí thik cha. En sentido inverso, el modelo tradujo correctamente la expresión idiomática sathi bhai como «amigos» en vez de literalmente.

Traducción práctica. Para una entrevista de veinte turnos de palabra del lado del paciente, la distribución observada en el sentido nepalí-inglés da de media cinco o seis enunciados con el sentido significativamente alterado, y unos diez solo parcialmente fieles. El punto crítico no es el volumen: es que esos enunciados alterados llegan en inglés fluido, gramatical y verosímil, sin ninguna señal que permita al interlocutor detectarlos.

Lo que está bien

El protocolo es constante donde importa, y la evaluación se hace en condiciones reales. Mismo facilitador anglófono, mismo aparato, misma cuenta, misma versión del modelo, misma instrucción inicial, mismas preguntas, en los 30 encuentros. Esa estabilidad es lo que autoriza a atribuir la varianza observada al habla y al sistema, y no al dispositivo. Y se aplica a conversaciones espontáneas al aire libre, con ruido, vacilaciones y alternancia de idiomas — no a un corpus escrito. Es exactamente la condición de uso real que la literatura existente no cubría.

La taxonomía separa lo que el AUC o el BLEU agregan. Nota global por un lado, diecinueve categorías de desviación por otro: el diseño distingue explícitamente los errores que dañan la naturalidad de la conversación (registro demasiado formal, dialecto inadecuado, latencia) de los que dañan la fidelidad (distorsión, adición, error numérico). Esa separación es la contribución reutilizable del artículo. Una métrica agregada única habría mezclado una formulación libresca con una edad equivocada en veinte años, que no tienen las mismas consecuencias.

Los autores desmontan ellos mismos su hallazgo más vendible. La asimetría de dirección es el titular potencial del estudio; escriben que está confundida con el tipo de entrada, ya que las preguntas en inglés estaban estandarizadas y se repitieron treinta veces mientras que las respuestas en nepalí eran espontáneas y variaban en longitud y claridad. Añaden que les resulta imposible distinguir un error nacido en el reconocimiento de voz de otro nacido en la traducción. El conjunto de datos desidentificado de notas y códigos se publica como anexo. Sin conflictos de interés declarados y sin financiación industrial visible.

Lo que está menos bien

Una sola revisora, sin fiabilidad entre jueces — y eso es toda la medición. Las 485 notas y las 19 categorías de desviación proceden de una persona. Los autores lo señalan, pero conviene explicitar el alcance del problema: aquí la etiqueta es el resultado. No hay verdad de referencia independiente — ni traducción de referencia producida por un intérprete profesional, ni segundo codificador, ni coeficiente kappa. Toda la estructura fina de la taxonomía descansa en el juicio lingüístico de una sola persona, además anglófona evaluando nepalí a nivel Advanced-Mid, alto pero no nativo. Es el modo de fallo clásico de los estudios de calidad de traducción: la métrica engañosa adopta aquí la forma de un etiquetado no validado.

El comparador que falta es el intérprete humano. Sabemos que el 14,2 % de los enunciados está significativamente alterado. Ignoramos por completo qué habrían producido, sobre las mismas conversaciones, un intérprete profesional, un intérprete improvisado, Google Translate o un modelo más reciente. Pero la pregunta de decisión nunca es «¿es ChatGPT-4o perfecto?», sino «¿es ChatGPT-4o mejor que lo disponible aquí y ahora?», y en los contextos que el artículo aborda la alternativa realista es a menudo ninguna ayuda. Sin línea de base el lector no puede responder, y el estudio no pretende lo contrario. Añádase que el modelo probado, GPT-4o, ya era de una generación anterior en el momento de la publicación: las cifras fechan una configuración, no una tecnología.

Sesgo de población, muestra minúscula y una incoherencia de recuento. Treinta adultos reclutados por conveniencia en un radio de cinco kilómetros alrededor de un solo hospital: la generalización a otras regiones de Nepal, otros dialectos, poblaciones mayores o menos escolarizadas, o a un contexto clínico, no está ni probada ni establecida. Se recogieron edad, sexo y alfabetización pero no se incorporaron al análisis, de modo que no sabemos si el rendimiento depende de quién habla — que es la hipótesis más evidente a comprobar. Un detalle aritmético, por último: el resumen anuncia 329 etiquetas de desviación, pero los recuentos y porcentajes de la tabla 3 implican un denominador de unos 380 (65 etiquetas equivalen al 17,1 %, lo que da un total de 380). La discrepancia no cambia el orden de los modos de fallo, pero un denominador incoherente entre resumen y tabla es el tipo de detalle que corregirá la revisión por pares — y recuerda que se trata de un preprint.

Lo que cambia

Para la comunidad investigadora. El artículo desplaza la pregunta de evaluación. Mientras se mida la traducción automática sobre texto escrito con métricas de similitud, se optimiza una cantidad — el parecido con una referencia — que no dice nada del riesgo. Este trabajo muestra que en condiciones de habla espontánea la variable que importa es la detectabilidad del error por el usuario: una salida fluida y gramaticalmente correcta que inventa información es más peligrosa que una salida manifiestamente rota, porque la segunda provoca una petición de repetición y la primera no. Es una propiedad que las métricas clásicas de fidelidad no capturan en absoluto, y que exige trabajar en mecanismos de señalización — retrotraducción mostrada, puntuación de confianza, detección de añadidos — más que en puntos adicionales de BLEU. La segunda vía abierta es la asimetría: si se confirma en un diseño que controle el tipo de entrada, significa que estas herramientas entienden mejor de lo que se hacen entender, lo que en una consulta equivale a amplificar la voz del clínico y degradar la del paciente.

Para los clínicos. Nada de esto justifica sustituir a un intérprete, y los autores son tajantes al respecto. Lo que el artículo sí aporta es una lista de señales de alerta utilizables de inmediato por quien acabe usando un traductor de voz a falta de algo mejor: los números (edad, duración, dosis, frecuencia) se restituyen mal en el 3,4 % de las etiquetas, lo que basta para repetir y confirmar sistemáticamente toda cantidad; las preguntas abiertas son el régimen más degradado, lo que aboga por preguntas cortas y cerradas; el sentido paciente hacia clínico es el más frágil, lo que obliga a reformular lo que se cree haber entendido y hacerlo validar. Y sobre todo: una respuesta que suena bien no es una respuesta fiel.

Para los pacientes y el público. La intuición dominante supone que la IA comete errores visibles — galimatías, una frase sin sentido. Este artículo documenta lo contrario en un caso concreto y verificable: el sistema convirtió «soy agricultor» en «camino un poco cada día», y nadie en la conversación tenía forma de darse cuenta. Hay ahí una asimetría de equidad que va más allá de lo técnico. Las lenguas mejor dotadas de datos — inglés, mandarín, español — disponen de herramientas más fiables; las lenguas menos dotadas heredan herramientas cuya apariencia de calidad es idéntica y cuya fidelidad no lo es. A medida que estos asistentes de voz se extiendan por sistemas sanitarios con recursos limitados, será esa diferencia invisible, y no el rendimiento medio, la que determine a quién se escucha correctamente.

Para saber más

El preprint: Accuracy and error patterns of ChatGPT-4o for real-time English–Nepali voice translation: A cross-sectional field evaluation in rural Nepal, medRxiv, DOI 10.64898/2026.08.25.26361303, publicado el 28 de agosto de 2026, bajo licencia CC BY 4.0. Autores: Alyssa Mandich (School of Medicine, University of Washington), Shirsha Koirala (Northeast Ohio Medical University), Sophie Westen (Georgetown University), Saisha Adhikari (Association of State and Territorial Health Officials), Ashraya Acharya y Abha Shrestha (Department of Community Medicine, Kathmandu University School of Medical Sciences, Dhulikhel Hospital). El conjunto de datos desidentificado con las notas de exactitud y los códigos de error se publica como anexo (S1 File); las grabaciones de audio y las transcripciones íntegras no son públicas y se destruirán en julio de 2027, con acceso previa solicitud motivada al IRC-KUSMS. Sin conflictos de interés declarados. El proyecto contó con el apoyo del University of Washington Global Health Immersion Program.