La brecha entre la evidencia y la historia clínica: lo que pierden diecisiete LLM cuando deben buscar la información en un expediente real de embarazo

Un equipo de la Universidad de Fudan y de su hospital de obstetricia y ginecología construyó ObGynLongBench, un conjunto de evaluación de 1.500 puntos de decisión extraídos de 976 historias clínicas reales de embarazo, donde cada pregunta se ancla a una fecha precisa con borrado de todo lo posterior. Evaluados sobre los mismos casos, diecisiete modelos de lenguaje responden correctamente entre el 58,7 % y el 79,1 % de las veces cuando se les sirven los elementos pertinentes, y solo entre el 41,3 % y el 68,7 % cuando deben buscarlos ellos mismos en el expediente: una brecha de 7,6 a 22,7 puntos que los autores llaman el «Evidence-to-EHR Gap». El hallazgo es real y la estadística está cuidada, pero el benchmark no tiene rendimiento humano de referencia, ni condición control sin expediente, y sus etiquetas fueron fabricadas por las mismas familias de modelos que evalúa.

El contexto

Desde hace tres años, la medida de referencia para juzgar un modelo de lenguaje en medicina es la pregunta de opción múltiple: USMLE, MedQA, PubMedQA y sus variantes por especialidad. El formato tiene un mérito —es objetivo y reproducible— y un defecto que crece a medida que suben las puntuaciones: la pregunta llega con su viñeta clínica ya redactada, filtrada, resumida. Lo que importa está ahí, en trescientas palabras, y nada más estorba. Pero eso no es lo que hace un clínico. Un clínico abre un expediente.

La historia clínica electrónica es larga, redundante, mal ordenada, y sobre todo contiene una mayoría abrumadora de información que no sirve para la decisión del día. En esta cohorte, un solo punto de decisión obstétrica viene precedido en promedio por 479 resultados de laboratorio, 82 registros de constantes vitales, 25 notas clínicas, 6 informes ecográficos y 3 líneas de tratamiento. La duración mediana de un expediente de embarazo seguido es de 184 días. En conjunto, eso equivale en promedio a 30.800 tokens (las unidades de texto en que el modelo trocea la entrada, aproximadamente fragmentos de palabra) con una desviación estándar de 19.800: mucho más que una viñeta de examen, mucho menos que las ventanas de contexto que anuncian los modelos recientes.

La pregunta que plantea este equipo es, pues, la de un eslabón perdido: ¿un modelo que acierta cuando se le entrega la evidencia sigue acertando cuando debe ir a buscarla? Trabajos anteriores exploraron el expediente largo (MedAlign, MIMIC-Instr, TIMER), pero en formato abierto, sin anclaje a una recomendación trazable ni frontera temporal estricta. Ese doble anclaje —una regla clínica identificada, una fecha de corte aplicada— es lo que hace original a ObGynLongBench.

El método

Qué se mide. Cada caso es una pregunta de cuatro opciones (A–D) sobre la conducta a seguir, vinculada a una paciente, a una fecha en la cronología de su embarazo y a una regla extraída de un manual o una recomendación de obstetricia. Todo lo posterior a esa fecha se elimina del expediente entregado al modelo; en los casos hospitalizados el corte se fija en el ingreso y los diagnósticos del día se borran automáticamente. La métrica es única: el porcentaje de aciertos. Sin AUC, sin sensibilidad, sin calibración: el formato no se presta, y eso es en sí una limitación.

El dispositivo de tres alcances. Es el núcleo del artículo, y está bien concebido. Los mismos casos se plantean tres veces al mismo modelo, cambiando solo lo que se le da a leer. En modo Evidence-only se aportan únicamente las piezas justificativas prelocalizadas. En modo Visit-level, todos los registros del mismo día. En modo History-level, la totalidad del expediente previo a la decisión. Comparar un modelo consigo mismo entre alcances separa limpiamente dos cosas: lo que el modelo sabe de medicina y lo que es capaz de extraer de un expediente. Los casos se clasifican además en tres niveles: L1 (una evidencia única y visible localmente), L2 (integración de varias fuentes en la misma visita), L3 (evidencias distribuidas en el tiempo, típicamente a más de siete días de la decisión).

Los datos. 976 historias reales de embarazo procedentes de un único hospital terciario, en chino, que abarcan dieciséis subespecialidades obstétricas (trastornos hipertensivos, diabetes gestacional, colestasis intrahepática del embarazo, cribado de estreptococo del grupo B, embarazo múltiple y otras). Los 1.500 casos no son independientes: 976 corresponden al primer punto de decisión de una paciente, 524 a uno posterior, y 240 pacientes aportan dos. No se informan el periodo de recogida, la edad, la paridad ni el origen de las pacientes.

Los modelos. Diecisiete, ninguno entrenado por los autores: cuatro comerciales de gama «rápida» (Claude-Haiku-4.5, GPT-5.4-mini, Gemini-3-Flash, DeepSeek-V4-Flash), ocho abiertos de ventana larga (familias Qwen, Gemma, Phi) y cinco especializados en salud (HealthGPT-Pro, Hulu-Med, Lingshu, MedGemma). El modo de razonamiento extendido está desactivado en los abiertos y los médicos, y activo por defecto en los comerciales. Después se comparan seis estrategias de acceso al expediente: lectura directa, renderizado en imágenes, dos variantes de RAG (recuperación de pasajes por similitud), resumen deslizante y agente en bucle de herramientas.

La construcción, en cambio, se apoya en LLM. La extracción de reglas desde las recomendaciones la hace GPT-5.3-Codex, la asignación de niveles L1/L2/L3 Claude Opus 4.6, la redacción de preguntas y distractores un LLM, y la verificación de validez agentes GPT-5.4-mini. Retengan este punto: vuelve más abajo.

Los resultados

La brecha existe, y es amplia. En Evidence-only, el mejor modelo es Gemini-3-Flash con un 79,1 %, seguido de DeepSeek-V4-Flash con 78,8 % y Gemma-4-26B-A4B con 78,2 %. En History-level, Gemini-3-Flash sigue en cabeza pero cae al 68,7 %. Claude-Haiku-4.5 pasa de 75,5 a 59,8 (−15,7 puntos), GPT-5.4-mini de 77,4 a 64,9 (−12,5), Qwen3.5-35B-A3B de 76,9 a 60,1 (−16,8). Los diecisiete modelos pierden puntos, sin excepción, desde −7,6 (Phi-4-mini) hasta −22,7 (MedGemma-1.5-4B). Los intervalos de confianza del 95 %, obtenidos por remuestreo agrupado a nivel de paciente, rondan los ±2,5 puntos: la brecha no es ruido.

La dificultad sigue a la dispersión de la evidencia. Para casi todos los modelos, L1 > L2 > L3. Gemini-3-Flash obtiene 66,0 / 71,5 / 65,0; Claude-Haiku-4.5 63,0 / 61,0 / 52,3; MedGemma-1.5-4B 45,8 / 43,5 / 29,7. Esta última cifra merece mirarse de frente: con cuatro opciones, el azar está en el 25 %.

Los modelos médicos no son mejores. La diferencia entre el mejor generalista y el mejor especializado en salud pasa de 4,2 puntos en Evidence-only a 7,4 puntos en History-level. Dicho de otro modo, el entrenamiento médico añade algo de conocimiento y nada de capacidad para leer un expediente.

El error se propaga dentro de una misma paciente. En los 1.500 casos, los modelos rinden sistemáticamente peor en el segundo punto de decisión que en el primero —en los diecisiete, de −1,86 a −10,88 puntos, media −5,41, significativo con p < 0,1 para doce de ellos. Es el resultado de seguridad más interesante del artículo: un error precoz de lectura del expediente parece contaminar las decisiones posteriores para la misma paciente.

Entre las estrategias de acceso, solo una ayuda de verdad. Frente a la lectura directa (59,6 %), el renderizado en imágenes pierde 6,9 puntos, el RAG estático y el resumen deslizante no se distinguen del ruido, y solo el agente de búsqueda activa gana: +4,6 puntos, hasta el 64,2 %. El bootstrap apareado lo confirma: Image −6,91 ± 1,59 y Agent +4,53 ± 1,60 son las dos únicas diferencias significativas. Conviene señalar, aun así, que el agente consume 35.786 tokens frente a 30.951 de la lectura directa, y que el presupuesto de cómputo no se iguala entre estrategias.

Traducción clínica. Tomemos 1.000 puntos de decisión obstétrica de esta naturaleza. El mejor modelo, con la evidencia servida, falla 209. El mismo modelo, ante el expediente completo, falla 313: un centenar de decisiones pasan de correctas a incorrectas por el solo hecho de que la información había que encontrarla. En los casos L3 —aquellos en que la evidencia está dispersa en el tiempo, es decir, exactamente el seguimiento del embarazo— MedGemma-1.5-4B falla 703, apenas mejor que los 750 de un sorteo. Estas cifras no se trasladan a una sala de partos: son preguntas de opción múltiple, no consultas. Pero fijan un techo, y ese techo es bajo.

Lo que está bien

La frontera de información previa a la decisión se toma en serio. Es la ingeniería más cuidada del artículo y la que rara vez se hace bien. Se elimina todo lo posterior; también los diagnósticos del día de ingreso; una lista explícita de objetivos de limpieza retira las notas y prescripciones anteriores que ya enunciarían la conducta elegida; en cambio, los análisis y constantes previos al corte se conservan por principio, para no volver insoluble el caso. Sin esa disciplina, se mide la capacidad de un modelo para localizar la respuesta ya escrita en el expediente: un pariente cercano de la fuga circular que arruina tantos benchmarks multimodales.

La estadística está por encima de la media del campo. Los 1.500 casos no son independientes, puesto que 240 pacientes aportan varios, y los autores lo tratan: intervalos de confianza por bootstrap agrupado a nivel de paciente (10.000 remuestreos; la paciente extraída arrastra todos sus casos), bootstrap apareado para comparar las estrategias de acceso sobre los mismos casos, y pruebas unilaterales con valores p publicados modelo a modelo. Muchos benchmarks de IA médica informan un porcentaje desnudo; este informa su incertidumbre, y esa incertidumbre invalida explícitamente varias microdiferencias que el texto principal comenta, sin embargo, con cierta ligereza.

Una auditoría clínica independiente y cuantificada. Cien casos extraídos al azar de los 1.500 fueron revisados por tres residentes de obstetricia que no participaron en la construcción, con acceso al expediente completo hasta el corte. Agregado: 96 respuestas de referencia juzgadas correctas, 1 incorrecta, 3 inciertas; calidad de la pregunta juzgada clara y clínicamente pertinente en 98 casos. La concordancia entre jueces se informa mediante el AC1 de Gwet (0,927 y 0,973) en vez de un kappa, elección correcta cuando las anotaciones se concentran en una sola categoría. Por último, el código de evaluación se publica bajo licencia MIT y todos los prompts figuran en el anexo.

Lo que está menos bien

Falta la condición control más elemental: la pregunta sin el expediente. Las reglas clínicas del benchmark proceden de recomendaciones públicas ampliamente presentes en los corpus de entrenamiento. No se realiza ninguna prueba con el enunciado y las cuatro opciones solos, sin dato alguno de la paciente. No hay forma, pues, de saber qué parte del 79,1 % —e incluso del 68,7 %— se obtiene por simple restitución de una recomendación y eliminación de distractores. Es una variante de la métrica engañosa: el nivel del azar (25 %) nunca se recuerda, no se mide ningún rendimiento humano (los tres residentes auditan los ítems, no los responden) y las cifras quedan sin escala. Si una parte sustancial de la puntuación es alcanzable sin abrir el expediente, la tesis central del artículo se debilita en consecuencia.

Las etiquetas y los candidatos salen de la misma industria. GPT-5.4-mini es el agente que verifica que cada ítem es válido y respondible únicamente a partir de la evidencia previa al corte; es también el segundo mejor modelo evaluado (77,4 en Evidence, 64,9 en History, mejor puntuación L3 salvo Gemini). Los ítems retenidos son, por construcción, los que él juzga solubles. DeepSeek-V4-Flash es simultáneamente juez de las puntuaciones de uso de evidencia y modelo evaluado; y, en la matriz de robustez aportada, es el más atípico de los cuatro jueces (kappa ponderado 0,73–0,77 con los demás, frente a 0,83–0,85 entre ellos). Los autores reivindican haber evitado la circularidad eligiendo un formato cerrado; la han desplazado de la evaluación a la fabricación de las etiquetas, que no es lo mismo que haberla suprimido.

Parte de la brecha medida es probablemente un artefacto técnico, no un déficit de razonamiento. Las dos caídas más espectaculares —Hulu-Med-30A3 (−21,0) y MedGemma-1.5-4B (−22,7)— corresponden a los dos modelos con las ventanas de contexto más estrechas (75.000 y 131.000 tokens), frente a entradas de 30.800 ± 19.800 tokens. De hecho, tres modelos rinden mejor en Visit-level que en History-level, firma clásica del desbordamiento. Y sin embargo no se publica ninguna tasa de truncamiento, de desbordamiento de ventana ni de respuesta no analizable. A ello se suma una asimetría asumida pero pesada: razonamiento extendido activo por defecto en los comerciales, desactivado en los abiertos y los médicos. Toda comparación entre familias —incluida la conclusión de que «los modelos médicos no son mejores»— queda sesgada por ello. Conviene anotar por último el sesgo de población: un único hospital terciario chino, en obstetricia, es decir una casuística orientada al embarazo de riesgo, sin dato demográfico publicado, y un estatus de difusión de los 1.500 casos que nunca se explicita: solo el código se declara bajo licencia.

Lo que cambia

Para la comunidad investigadora, este artículo desplaza útilmente el listón. Muestra que una puntuación alta en un test de opción múltiple con viñeta no predice el rendimiento sobre un expediente real, y aporta un protocolo —tres alcances sobre los mismos casos— que separa limpiamente el conocimiento médico de la extracción de información. Es reproducible en otros lugares, en otras especialidades y otras lenguas, y debería serlo. El resultado del agente de búsqueda activa apunta además a una dirección concreta: más vale dejar que un modelo interrogue el expediente que esperar que lo lea bien de una sola pasada. El resultado sobre la propagación de errores dentro de una paciente merece por sí solo un trabajo dedicado.

Para los clínicos, hoy no cambia nada, y el artículo no pretende lo contrario: su sección ética afirma explícitamente que ObGynLongBench no es un sistema de ayuda a la decisión clínica. El mensaje operativo está en otra parte. Cuando les presenten una herramienta con una puntuación de benchmark, la pregunta a formular es: ¿evaluada sobre viñetas redactadas, o sobre el expediente tal como existe aquí? La brecha documentada, de diez a veinte puntos, es exactamente la que separa la demostración del despliegue. Es el mismo patrón observado en el triaje conversacional y en la decisión a mitad de recorrido: el rendimiento se desploma en cuanto la situación deja de venir masticada.

Para las pacientes y el público, la lección es simple y duradera. Un modelo que «conoce» las recomendaciones no es un modelo que sepa leer su expediente. Son dos competencias distintas, la segunda es con diferencia la menos avanzada, y es la que cuenta en un seguimiento de embarazo donde la información útil está repartida a lo largo de seis meses. Una cifra del 68,7 % de aciertos en un cuestionario no dice nada sobre la seguridad de una herramienta: no mide ni la capacidad de decir «no lo sé» ni la calibración de la confianza, dos propiedades que este trabajo, como la mayoría de los benchmarks de formato cerrado, no mide en absoluto.

Para ir más lejos

El preprint: ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making, arXiv:2609.07601, depositado el 7 de septiembre de 2026, DOI 10.48550/arXiv.2609.07601, bajo licencia CC BY 4.0. El código de evaluación y los recursos se anuncian en GitHub, bajo licencia MIT; el estatus de difusión de los propios 1.500 casos no se precisa.

Financiación declarada: National Key R&D Program of China (2023YFF1204800), programa «AI for Science» de la comisión municipal de Shanghái (2025-GZL-RGZN-BTBX-02028), National Natural Science Foundation of China (62406121), Shanghai Basic Research Program (25ZR1401034), con recursos de cómputo de la plataforma CFFF de la Universidad de Fudan. No figura declaración de conflictos de interés en el manuscrito; ningún autor está afiliado a un laboratorio que produzca alguno de los diecisiete modelos evaluados.

En el mismo terreno, los benchmarks de expediente largo anteriores citados por los autores: MedAlign, MIMIC-Instr y TIMER, todos en formato abierto y sin anclaje a una recomendación trazable.