PrecepTron: un juez de 32.000 millones de parámetros calibrado con un panel de médicos, y lo que revela sobre los benchmarks clínicos

Un equipo de Harvard Medical School, del Beth Israel Deaconess Medical Center y de Stanford publica PrecepTron, un modelo de 32.000 millones de parámetros ajustado para calificar, en lugar de un jurado de médicos, las respuestas abiertas de los LLM clínicos, junto con GRAND-ROUNDS, un conjunto público de 9.217 calificaciones otorgadas por 11 médicos en siete estudios ya publicados. Lo que importa no es que PrecepTron alcance el acuerdo entre médicos en tres de las cinco tareas, sino que los tres modelos propietarios de vanguardia usados como jueces se contradicen entre sí hasta en 17 puntos sobre las mismas respuestas con la misma rúbrica. Y es sirviéndose de ese juez como los autores descubren que GPT-5 obtiene buena calificación en el 42 % de los casos del New England Journal of Medicine con menos de cuarenta palabras de enunciado.

El contexto

Evaluar un modelo de lenguaje en medicina significó durante años someterlo a exámenes de opción múltiple — el USMLE, bancos de preguntas — donde la respuesta es única y la corrección automática. Esa época terminó: los modelos saturan esas pruebas y, sobre todo, esas pruebas no se parecen a nada de lo que un clínico hace realmente. La literatura ha pasado por tanto a las respuestas abiertas: se le pide al modelo un diagnóstico diferencial, un plan de manejo, una nota de consulta, y se hace calificar su producción por médicos según una rúbrica explícita.

Ese desplazamiento volvió los benchmarks más creíbles y la evaluación mucho más frágil. Más creíbles porque el comparador pasa a ser un humano en una tarea real. Más frágil porque la nota depende ahora de quién califica. ¿Qué expertos se reclutan: generalistas o subespecialistas, médicos promedio o de élite, académicos o de la práctica comunitaria? ¿Cuántos son? ¿Se ponen de acuerdo entre sí? Los estudios publicados en JAMA, Nature Medicine o Science se apoyan por lo general en jurados de dos a una docena de médicos, con frecuencia de una sola institución. Arjun Manrai, coautor sénior de este trabajo, resumió el problema en un comentario aparecido en Nature en 2026 bajo el título «Medical AI has a measurement problem». La FDA, por su parte, abrió en 2026 una consulta sobre la regulación de los dispositivos médicos basados en IA generativa: es decir, estas calificaciones pesarán pronto en decisiones regulatorias.

La respuesta de moda se llama LLM-as-a-judge: confiar la calificación a otro modelo de lenguaje. Es rápido, reproducible hasta el último byte, y ya se usa para zanjar cuestiones serias, como si los modelos especializados en medicina superan a los de propósito general. Dos obstáculos. Primero, un juez automático puede estar mal calibrado y arrastrar sesgos propios: preferencia por las respuestas largas, por los textos escritos por una IA, por los de su propia familia de modelos. Segundo, un juez propietario corre en casa de su proveedor: enviar historias clínicas a una API externa resulta inaceptable para la mayoría de los hospitales. Este artículo ataca ambos frentes a la vez.

El método

El conjunto de datos. GRAND-ROUNDS (Graded Responses and Annotated Notes for Diagnostic Reasoning on UNstructured Data Sets) agrega siete estudios publicados en los que médicos habían calificado a mano salidas de LLM: 9.217 calificaciones sobre 5.250 pares respuesta-rúbrica, producidos por 160 clínicos y 9 modelos de IA, evaluados por 11 médicos. Seis tareas, cinco de las cuales se usan en los experimentos: diagnóstico diferencial sobre las Clinicopathologic Conferences del NEJM (calificadas con el score de Bond, escala ordinal de cinco niveles — 0, 2, 3, 4, 5 — donde 5 significa que el diagnóstico correcto figura en el diferencial); los Landmark Diagnostic Cases de Goh y cols. 2024, con una rúbrica de 19 puntos que acredita por separado las hipótesis, los argumentos a favor y en contra, el diagnóstico final y los exámenes propuestos; los Grey Matters Management Cases de Goh y cols. 2025, sobre razonamiento de manejo; el NEJM Healer, calidad de la nota de consulta según la rúbrica R-IDEA de 10 puntos; y el BIDMC ER, precisión diagnóstica en urgencias del Beth Israel, procedente del estudio publicado en Science en 2026. La sexta tarea — planes de estudio de los CPC — se publica pero queda excluida de los experimentos porque sus calificaciones se concentran demasiado en la parte alta de la escala.

Los jueces comparados. Ocho modelos en modo cero disparos, es decir, con la sola rúbrica publicada en el prompt: cinco abiertos (Qwen3.5-9B, Qwen3-32B, Gemma-3-12B, Llama-3.1-8B, Mistral-3-8B) y tres propietarios (Claude Opus 4.6, Gemini 3.1 Pro, GPT-5), más un ensamble de los tres propietarios cuya nota es su media redondeada.

El modelo. PrecepTron es un ajuste supervisado de Qwen3-32B mediante LoRA (low-rank adaptation): en lugar de mover los 32.000 millones de pesos, solo se entrenan pequeñas matrices de rango bajo injertadas en cada capa de atención y de proyección, lo que hace viable la operación en una sola GPU y limita mecánicamente la deriva del modelo. Rango 16, factor de escala 32, dropout 0,05, AdamW, tasa de aprendizaje máxima de 2 × 10⁻⁴, planificación coseno con 3 % de calentamiento, lotes efectivos de 4, secuencias de 4.096 tokens, precisión bfloat16, tres épocas, en una única NVIDIA H100 de 80 GB. Se entrena un adaptador distinto por rúbrica; los CPC y el BIDMC ER comparten el suyo porque comparten el score de Bond. Las particiones se hacen por caso, nunca por respuesta: 20 % de los casos para entrenamiento en las tareas con al menos diez casos, solo dos casos en las dos tareas que tienen menos — es decir, de 2 a 46 casos de entrenamiento según la tarea. Un detalle que resultará decisivo: los ejemplos de entrenamiento se remuestrean por terciles de nota (baja, media, alta) hasta igualar los efectivos, con un tope de cinco repeticiones, para impedir que el juez se instale en la nota más frecuente.

Las medidas. Criterio principal, la exactitud frente a la nota humana de referencia: «a un punto» en la escala de Bond, «a un 10 %» de la nota normalizada en el resto. Criterio secundario, el kappa de Cohen ponderado cuadráticamente, una medida de acuerdo corregida por azar que penaliza más cuanto mayor es la discrepancia. Ambos se comparan sistemáticamente con el acuerdo entre médicos, calculado sobre el subconjunto de respuestas calificadas por al menos dos médicos. Intervalos de confianza al 95 % por bootstrap no paramétrico, 2.000 remuestreos, semilla fija. Se prueban sobre los mismos datos dos estrategias rivales que no actualizan pesos: el few-shot con cinco ejemplos y el optimizador de prompts GEPA.

Los resultados

Los jueces de vanguardia se contradicen. Sobre las mismas respuestas y con la misma rúbrica, las notas medias de los tres modelos propietarios difieren en 17 puntos porcentuales en los Landmark Diagnostic Cases (Gemini 74 %, GPT-5 59 %, Claude 57 %) y en 9 puntos en los CPC (GPT-5 80 %, Gemini 77 %, Claude 71 %, frente al 88 % de los médicos). Y ese desacuerdo no es un desfase constante que pudiera recalibrarse: Claude es el más severo en los CPC (71 % frente al 88 % de los médicos) y el más indulgente en el BIDMC ER (82 % frente a 78 %). Ningún modelo base alcanza el acuerdo entre médicos en las cinco tareas. Los autores comprobaron en cuatro de las cinco si algún juez favorecía sus propias salidas: no se detectó preferencia sistemática. La quinta, el BIDMC ER, no pudo probarse: su texto contiene datos de pacientes, que no salen del hospital.

El ajuste ligero cierra la brecha. Entrenado con 2 a 46 casos, PrecepTron-32B gana entre 4 y 15 puntos sobre su modelo base en las cinco tareas: 82 % → 92 % en los CPC, 46 % → 61 % en los Landmark. En esta última, la más exigente con su rúbrica de 19 puntos, 93 respuestas calificadas procedentes de dos casos bastan para llevar el kappa de 0,62 a 0,80. La tabla completa, exactitud y kappa frente a la referencia humana: CPC, PrecepTron 92 % (κ = 0,71) frente a 92 % (κ = 0,68) de los médicos; NEJM Healer, 81 % (κ = 0,80) frente a 77 % (κ = 0,83); BIDMC ER, 91 % (κ = 0,60) frente a 88 % (κ = 0,66); Landmark, 61 % (κ = 0,80) frente a 67 % (κ = 0,92); Grey Matters, 80 % (κ = 0,78) frente a 95 % (κ = 0,90). PrecepTron supera al ensamble de los tres modelos propietarios en dos tareas (CPC 92 % frente a 83 %, Landmark 61 % frente a 44 %) y lo iguala en las otras tres. Las dos estrategias por prompt fracasan: el few-shot hace caer el NEJM Healer del 76 % al 67 %, y GEPA degrada el razonamiento de manejo del 72 % al 63 %.

Reproducción de cinco estudios. Aplicado a las respuestas de las publicaciones originales con sus rúbricas originales, excluidos los casos de entrenamiento, PrecepTron recupera las conclusiones principales de cinco estudios: la precisión diagnóstica de GPT-4 en Kanjee y cols. (JAMA, 2023), el orden relativo de las notas R-IDEA entre chatbot, residentes y adjuntos en Cabral y cols. (JAMA Internal Medicine, 2024), el desempeño de GPT-4 comparable o superior al de médicos con recursos convencionales en Goh y cols. (2024 y 2025), y el aumento de la precisión diagnóstica del triaje al ingreso en Brodeur y cols. (Science, 2026).

El resultado más inquietante. Con un calificador automático, los autores pueden hacer lo que ningún jurado humano financiaría: dar a GPT-5 prefijos cada vez más largos de cada caso, en pasos de diez tokens, y calificar su respuesta en cada paso. En los CPC, GPT-5 coloca el diagnóstico correcto en su top-10 en el 42 % de los casos con 50 tokens o menos — unas cuarenta palabras — frente al 14 % para un top-3 y al 12 % para el diagnóstico único. Como referencia, la presentación de caso de un CPC ronda los 1.600 tokens. En los casos de manejo la saturación es aún más rápida: cuatro de las cinco preguntas reservadas alcanzan el 80 % del máximo de la rúbrica con 50 tokens, tres de ellas con 10. Los cuatro Landmark Diagnostic Cases lo logran todos con 50 tokens. Gemma-4-31B se comporta igual cualitativamente, necesitando algo más de texto. La memorización no lo explica: los 50 CPC utilizados son de 2025 en adelante, posteriores al corte de entrenamiento de ambos modelos, y los otros dos conjuntos nunca se habían publicado en línea. Un ejemplo de la tabla 2 da la medida del asunto: ante «Un hombre de 53 años fue evaluado en la consulta de cardiología de este hospital por disfunción ventricular izquierda grave con un aneurisma api», 30 tokens, GPT-5 propone la enfermedad de Chagas como segunda hipótesis — y ese era el diagnóstico.

Traducción concreta. Este modelo no toca a ningún paciente: califica exámenes. La unidad de daño no es por tanto el falso negativo, sino la conclusión publicada. Una diferencia de 17 puntos en la nota media de un conjunto de casos es exactamente la amplitud que separa un «el modelo supera a los médicos» de un «el modelo se queda corto». Si la elección del juez puede desplazar una media de esa magnitud, entonces parte de los titulares de la literatura de IA en salud de los últimos tres años depende de un parámetro que casi ninguno de esos estudios declara.

Lo que está bien

El resultado negativo sobre los jueces de vanguardia es la aportación real, y no se recupera con recalibrado. Mostrar que tres modelos propietarios califican los mismos exámenes con 17 puntos de diferencia habría bastado para un artículo. El detalle que importa es que esas diferencias no son coherentes dentro de un mismo modelo: Claude severo aquí, indulgente allá. Un sesgo constante se corrige con un desfase; este no, hay que medirlo por tarea. La demostración se hace con los medios necesarios: ocho jueces, cinco tareas, dos métricas — una de ellas corregida por azar — e intervalos bootstrap.

Las ablaciones van a buscar el fallo donde se esconde. Retirar el remuestreo equilibrado hunde el kappa de 0,72 a 0,51 en el NEJM Healer con exactitud comparable: los autores publican la prueba de que su juez, sin esa precaución, se derrumba hacia la nota mayoritaria manteniendo buena apariencia. También prueban el atajo más tentador — un juez que premie lo que parece texto de IA — reentrenando solo con respuestas humanas, y no encuentran atajo. Buscar uno mismo sus propios modos de fallo, y documentarlos en el suplemento, es raro.

La publicación efectiva de datos y modelo, y un tamaño que permite el uso local. Las 9.217 calificaciones, el código de entrenamiento, los adaptadores y — por primera vez — el texto de los Landmark Diagnostic Cases y de los Grey Matters están depositados en Hugging Face y GitHub. Anotaciones humanas de cinco estudios influyentes se convierten en un bien público reutilizable, que es precisamente lo que permite a otros impugnar el resto del artículo. Y 32.000 millones de parámetros caben en una sola GPU de 80 GB: un hospital puede ejecutar el juez internamente. El argumento no es teórico: es justamente porque el texto de urgencias del BIDMC no puede salir del hospital que los tres jueces propietarios no pudieron probarse allí en la cuestión de la autopreferencia.

Lo que está menos bien

La «reproducción» de los cinco estudios es circular, y eso es un comparador sesgado. Kanjee, Rodman, Crowe, Brodeur, Goh, Chen y Abdulnour son coautores de este artículo y de los estudios que reproduce. PrecepTron se entrena con el 20 % de los casos de esos mismos corpus, con las notas de esos mismos jurados, y luego «recupera» los resultados en el 80 % restante. Es un control de coherencia interna, no una replicación independiente: ningún estudio de otro equipo, calificado por un panel con el que los autores no entrenaron, se usó para poner a prueba el dispositivo. Los autores lo escriben sin rodeos entre sus limitaciones — reproducir un estudio con PrecepTron reproduce el estándar de evaluación de ese estudio, no el juicio clínico subyacente — pero la figura 4 dirá «reproduce cinco estudios publicados», y esa es la frase que circulará. El mismo esquema de validación cerrada sobre sí misma se señaló aquí a propósito de un benchmark cuyas etiquetas venían del modelo evaluado.

El criterio principal es permisivo, y una métrica contradice a la otra donde nadie mira. «A un punto» en una escala de Bond que solo tiene cinco niveles tolera confundir un 4 con un 5, es decir, un diferencial que se acerca al diagnóstico con otro que lo contiene. Sobre todo: en el BIDMC ER, PrecepTron muestra un 91 % de exactitud pero su kappa retrocede de 0,68 (modelo base) a 0,60, por debajo del 0,66 de los médicos. Exactitud que sube y acuerdo corregido por azar que baja es la firma exacta de un juez que se repliega sobre la nota frecuente de una distribución desequilibrada — el defecto que el remuestreo debía impedir, y el motivo por el que la sexta tarea se retiró de los experimentos. El artículo despacha el punto en un inciso («declinó modestamente»). Añádase que el hallazgo de los prefijos cortos se establece con este juez, cuya indulgencia es precisamente lo que está en cuestión; los autores señalan un caso límite en el que PrecepTron es probablemente demasiado generoso, sin que una relectura humana a escala venga a zanjarlo.

Lo que queda congelado en los pesos es un panel, y su composición no es neutra. Los 11 médicos calificadores proceden en su abrumadora mayoría del eje Boston-Stanford: Beth Israel Deaconess, Massachusetts General, Brigham and Women's, Harvard, Stanford. El artículo presenta como funcionalidad la posibilidad de «cambiar de panel» para volver a jugar un estudio con subespecialistas, o de localizar un benchmark nacional; pero lo que se entrega es ese panel, académico y estadounidense, cuyas preferencias latentes pasan a ser la referencia contra la que se evaluarán otros modelos. Un adaptador por rúbrica, entrenado con 2 a 46 casos, y el paso 2 del protocolo lo dice explícitamente: una validación sobre la tarea de otro no se transfiere. El objeto reutilizable es, pues, la receta, no el juez. Por último, este preprint no incluye ninguna declaración de financiación ni de conflictos de intereses, la licencia de los datos no se precisa, y el texto de los casos del BIDMC — la única tarea sobre atenciones reales en urgencias — no se publica, lo que vuelve esa parte inverificable desde fuera.

Qué cambia

Para la comunidad investigadora, el mensaje operativo es doble. Primero, el juez pasa a ser un parámetro de método que hay que declarar como se declara un reactivo: modelo, versión, prompts, datos de calibración, acuerdo juez-médicos puesto junto al acuerdo médicos-médicos. El protocolo de cinco pasos que se ofrece en un recuadro es directamente aplicable y debería convertirse en una exigencia de la revisión por pares. Segundo, y esto pesa más: si un modelo acierta el 42 % de los casos del NEJM con cuarenta palabras, entonces las rúbricas actuales premian en gran medida el reconocimiento de patrones — asociar una edad, un sexo y un síntoma con una presentación prototípica — y dejan sin evaluar lo que constituye el razonamiento clínico: integrar información nueva, revisar una hipótesis, resistirse al cierre prematuro. Los próximos benchmarks deberán variar la información en el tiempo y acreditar la revisión, no solo la nota final.

Para los clínicos, hoy no cambia nada a pie de cama. El efecto indirecto merece anticiparse: si los hospitales despliegan LLM en clínica, necesitarán vigilancia a escala, y un juez local como este es la forma que probablemente adoptará esa vigilancia. Lo que convierte al juez en un nuevo órgano de seguridad, y en un nuevo punto de fallo. Un juez mal calibrado no produce un error visible: produce un panel de control tranquilizador. La pauta de lectura que conviene conservar cabe en una pregunta, ante cualquier titular del tipo «la IA iguala a los médicos»: quién calificó, cuántos eran y si estaban de acuerdo entre sí. La misma prudencia vale para los benchmarks clínicos evaluados por jueces automáticos.

Para los pacientes y el público, una distinción sencilla. Cuando una noticia anuncia que un modelo «resolvió» casos complejos, está informando de una calificación, y esa calificación la dio alguien: un pequeño jurado de médicos o, cada vez más, una máquina. Este artículo muestra que ese alguien cambia el resultado. Muestra también que las pruebas que sirven para coronar a estos modelos se dejan resolver en parte con una primera impresión sobre un puñado de palabras, lo cual es una manera de responder bien sin haber razonado. Un modelo que parece un excelente diagnosticador en un benchmark no ha demostrado que sepa cambiar de opinión cuando el paciente no encaja en el prototipo. La misma brecha entre puntuación en viñeta y comportamiento real ya se observó en el triaje conversacional en condiciones reales.

Para saber más

El artículo: Scaling Clinical Judgment to Evaluate Medical AI, Thomas A. Buckley, Zahir Kanjee, Peter G. Brodeur, Byron Crowe, Anthony M. Pettinato, Aashna P. Shah, Adrian D. Haimovich, Liam G. McCoy, Daniel Restrepo, Ethan Goh, Jonathan H. Chen, Laura Zwaan, Katherine E. Goodman, Daniel J. Morgan, Raja-Elie E. Abdulnour, Adam Rodman y Arjun K. Manrai, preprint de arXiv depositado el 11 de septiembre de 2026, categoría cs.AI, DOI 10.48550/arXiv.2609.12822. Aún no evaluado por pares.

Afiliaciones: Department of Biomedical Informatics, Harvard Medical School; Department of Medicine y Department of Emergency Medicine, Beth Israel Deaconess Medical Center; Stanford Division of Hospital Medicine, Division of Computational Medicine y Clinical Excellence Research Center, Stanford University; Division of Neurology, University of Alberta; Institute for Medical Engineering and Science, MIT; Department of Medicine, Massachusetts General Hospital; Institute of Medical Education Research, Erasmus Medical Center, Róterdam; Department of Epidemiology and Public Health, University of Maryland School of Medicine y University of Maryland Institute for Health Computing; VA Maryland Healthcare System; Department of Pulmonary and Critical Care Medicine, Brigham and Women's Hospital. Adam Rodman y Arjun K. Manrai son coautores sénior.

Datos y código: el código de entrenamiento y evaluación, los prompts de los jueces y las líneas base few-shot y GEPA en github.com/2v/PrecepTron; los adaptadores PrecepTron-32B en la colección de Hugging Face; el conjunto GRAND-ROUNDS, que incluye por primera vez el texto de los Landmark Diagnostic Cases y de los Grey Matters Management Cases; documentación en preceptron.net. El texto de los casos de urgencias del Beth Israel contiene datos de salud identificables y no se publica. La licencia del conjunto de datos no se precisa en el preprint.

Financiación y conflictos de intereses: el preprint no incluye declaración de financiación ni de conflictos de intereses. Siete de los diecisiete autores son coautores de los estudios que el artículo se propone reproducir (Kanjee y cols. 2023, Cabral y cols. 2024, Goh y cols. 2024 y 2025, Brodeur y cols. 2026).

También en Tatakoto: un benchmark clínico alemán calificado por un juez automático, la fuga circular cuando las etiquetas vienen del modelo evaluado, y la brecha entre viñetas y triaje real.