Tuberculosis en radiografía de tórax: los modelos visión-lenguaje médicos se hunden en cuanto los controles sanos se sustituyen por enfermos
Tres investigadores del Indian Institute of Technology Indore sometieron cuatro modelos visión-lenguaje — tres médicos (BioMedCLIP, CheXficient, MedSigLIP) y uno generalista (OpenCLIP) — a una auditoría de cribado de tuberculosis sobre 12 200 radiografías de tórax de cuatro conjuntos de datos públicos, cambiando una sola cosa cada vez: la cohorte, la redacción del texto, el tipo de controles, la prevalencia supuesta, el umbral de decisión. Las clasificaciones resisten mal: sustituir controles sanos por pacientes con otras enfermedades reduce el AUROC entre 0,075 y 0,306 puntos, y frente a la neumonía o el tumor pulmonar los tres modelos médicos caen por debajo de 0,5, el nivel del azar; una red supervisada con 0,999 en validación interna baja a 0,629 en dos cohortes externas. El artículo no propone ningún modelo nuevo, y esa es su fuerza: muestra que una puntuación de benchmark no es una propiedad de un modelo, sino de una especificación de evaluación completa.
El contexto
La tuberculosis sigue siendo una de las principales causas de muerte infecciosa en el mundo, y la radiografía de tórax es la herramienta de cribado masivo más barata de la que se dispone. Desde 2021, la Organización Mundial de la Salud admite la detección asistida por ordenador (CAD) como alternativa a la lectura humana para el cribado y el triaje de personas de 15 años o más. Varios programas comerciales ya están desplegados en países de alta carga, donde faltan radiólogos.
Esos programas son clasificadores supervisados: entrenados con miles de imágenes etiquetadas «tuberculosis» o «no tuberculosis». Los modelos visión-lenguaje (VLM) prometen otra cosa. Un codificador de imágenes y un codificador de texto se entrenan juntos, con pares imagen-leyenda, para proyectar una radiografía y una frase en el mismo espacio matemático. Así se puede clasificar una imagen en zero-shot, es decir, sin ningún reentrenamiento: se escribe «radiografía que muestra tuberculosis» y «radiografía sin tuberculosis», y se mira a qué frase se parece más la imagen. Para un programa de cribado sin datos locales etiquetados, el argumento es atractivo.
Queda por saber qué mide un benchmark. Un AUROC alto no dice qué pacientes servían de controles, qué frase definía el clasificador, ni si un umbral fijado en otro lugar funcionará aquí. Los autores describen toda evaluación con siete componentes — modelo, texto, cohorte, definición de los negativos, prevalencia, umbral, métrica — y cambiar uno equivale a evaluar otro sistema.
El método
Los datos. Cuatro conjuntos públicos. Montgomery (Estados Unidos, 58 tuberculosis, 80 normales) y Shenzhen (China, 336 tuberculosis, 326 normales), las dos colecciones históricas de la National Library of Medicine. TBX11K, que tiene el raro mérito de distinguir tres categorías: tuberculosis, sano y enfermo no tuberculoso; su validación incluye 200 tuberculosis, 800 sanos y 800 enfermos. Por último, el conjunto de prueba de VinDr-CXR (3 000 imágenes de dos hospitales vietnamitas, etiquetadas por consenso de cinco radiólogos), que nombra los diagnósticos competidores: 164 tuberculosis, 2 051 radiografías sin hallazgos, 210 neumonías y 73 tumores pulmonares sin tuberculosis asociada.
Los modelos, todos congelados. OpenCLIP, entrenado con dos mil millones de imágenes de la web, sirve de comparador generalista. BioMedCLIP (Microsoft) aprendió de 15 millones de pares figura-leyenda de la literatura biomédica. CheXficient (Stanford AIMI) está especializado en radiografía de tórax — y VinDr-CXR figura explícitamente entre sus datos de entrenamiento, algo que los autores señalan en todo momento. MedSigLIP (Google) cubre varias especialidades médicas.
Los prompts. Cinco familias de formulaciones publicadas palabra por palabra: una familia «clínica» de cuatro frases por clase, designada de antemano como principal, y cuatro variantes de una frase (estilo informe, presencia/ausencia, etc.). En total, 244 000 puntuaciones.
Los análisis, fijados antes de mirar los resultados. Discriminación mediante el AUROC — la probabilidad de que una imagen con tuberculosis reciba una puntuación mayor que una sin tuberculosis; 0,5 corresponde al azar. Fiabilidad de las puntuaciones mediante la puntuación de Brier (error cuadrático medio entre puntuación y realidad) y el error de calibración (diferencia entre probabilidad anunciada y frecuencia observada). Después, dos pruebas de orientación operativa: reponderar las clases para simular distintas prevalencias, y transportar un umbral elegido para alcanzar un 95 % de sensibilidad en TBX11K a las demás cohortes, sin retocarlo. Por último, una ResNet-50 supervisada clásica, entrenada en TBX11K con cinco semillas aleatorias, sirve de referencia; los autores también buscan imágenes casi duplicadas entre conjuntos mediante huella perceptual.
Los resultados
Ningún modelo gana en todas partes. Con el prompt clínico, MedSigLIP supera a CheXficient en Montgomery (0,976 frente a 0,969) y TBX11K (0,800 frente a 0,795), sin diferencia estadísticamente resuelta; CheXficient gana claramente en Shenzhen (0,950 frente a 0,907). En VinDr-CXR, CheXficient alcanza 0,878, MedSigLIP 0,829, BioMedCLIP 0,713, OpenCLIP 0,528 — pero CheXficient vio ese conjunto durante el entrenamiento. En TBX11K, los AUROC son casi idénticos mientras la puntuación de Brier de CheXficient es casi dos veces mejor (0,099 frente a 0,171).
El texto forma parte del modelo. Cambiar de familia de prompts modifica significativamente el AUROC en 21 de 48 comparaciones, tras corrección por comparaciones múltiples. CheXficient pasa de 0,835 con la formulación «informe» a 0,622 con «presencia/ausencia» sobre las mismas imágenes de TBX11K.
El resultado central: los controles. Con las mismas 200 tuberculosis, sustituir 800 controles sanos por 800 controles enfermos hace caer el AUROC de todos los modelos: MedSigLIP de 0,953 a 0,647, BioMedCLIP de 0,872 a 0,611, CheXficient de 0,865 a 0,725. En VinDr-CXR es aún más claro. Frente a radiografías sin hallazgos, CheXficient alcanza 0,945; frente a la neumonía, 0,466; frente al tumor pulmonar, 0,372. MedSigLIP y BioMedCLIP caen entre 0,31 y 0,38. Dicho de otro modo, ante otra enfermedad, estos modelos asignan con más frecuencia una puntuación «tuberculosis» alta a la imagen de neumonía que a la de tuberculosis.
Los umbrales no viajan. Un umbral ajustado al 95 % de sensibilidad en TBX11K solo conserva esa sensibilidad en 4 de 16 transportes. Y cuando la conserva, a veces es declarando positivo a casi todo el mundo: OpenCLIP mantiene su sensibilidad en Shenzhen con una especificidad de 0,043. CheXficient en VinDr-CXR alcanza un 97,6 % de sensibilidad y un 35,4 % de especificidad; frente a las neumonías, solo rechaza correctamente una de 210, y ninguno de los 73 tumores.
Traducción clínica (cálculo de Tatakoto a partir de estas cifras, no una estimación de los autores): de 1 000 radiografías con la prevalencia observada en VinDr-CXR (5,5 %), este ajuste detectaría unas 54 de las 55 tuberculosis, pero también enviaría a unas 610 personas sin tuberculosis a una prueba de confirmación. Como comparación, el perfil de producto objetivo de la OMS para una prueba de triaje exige al menos un 90 % de sensibilidad y un 70 % de especificidad.
Lo supervisado no salva la situación. La ResNet-50 alcanza 0,997 en validación interna (0,999 para el conjunto de las cinco semillas), y luego 0,629 tanto en Shenzhen como en Montgomery. El cribado por huella perceptual detecta 249 pares sospechosos que implican 313 imágenes; retirarlos y reentrenar mejora Shenzhen de 0,633 a 0,733 y Montgomery de 0,627 a 0,678, sin cerrar brechas de unos 0,27 y 0,32 puntos.
Lo que está bien
Comparaciones emparejadas que aíslan un solo factor. La prueba de controles sanos frente a enfermos conserva exactamente las mismas 200 tuberculosis y la misma prevalencia (20 %); solo cambia la naturaleza de los negativos. Eso permite atribuir la caída del AUROC al espectro de los controles y no a un cambio en la población positiva. Las cuatro diferencias son significativas tras corrección de Holm (p ≈ 0,0004).
Una transparencia poco habitual sobre lo que podría sesgar la auditoría. Los prompts se publican textualmente, se dan las revisiones exactas de los pesos para dos de los cuatro modelos, la exposición de CheXficient a VinDr-CXR se señala en cada tabla, y los autores precisan que su preprocesamiento de MedSigLIP difiere del del desarrollador (redimensionado PIL y no TensorFlow), por lo que sus cifras no reproducen la model card.
Separar tres afirmaciones que la literatura confunde. «Este modelo clasifica bien», «sus puntuaciones son fiables» y «su umbral conserva la sensibilidad en otro lugar» son tres proposiciones distintas, y la auditoría muestra que pueden divergir para un mismo modelo. Ejemplo: con una prevalencia fijada en el 50 %, MedSigLIP tiene mejor puntuación de Brier que CheXficient en las tres cohortes; al 10 %, el orden se invierte — sin que haya cambiado una sola puntuación.
Lo que está menos bien
Etiquetas que no son una verdad microbiológica. Ninguno de los cuatro conjuntos aporta una confirmación bacteriológica armonizada; VinDr-CXR se basa en impresiones radiológicas. Parte de los «fallos» frente a la neumonía puede reflejar imágenes realmente ambiguas o etiquetados discutibles más que un error del modelo. Los autores lo reconocen: los AUROC por debajo de 0,5 describen una ordenación, no una tasa de error diagnóstico en la clínica. Es el clásico sesgo de espectro aplicado al propio estándar de referencia.
La unidad es la imagen, no el paciente. Los manifiestos no vinculan las imágenes de un mismo paciente, y el cribado de duplicados excluye VinDr-CXR y no puede certificar que ninguna imagen de evaluación haya servido para el preentrenamiento de estos modelos, cuyos corpus son en parte no públicos. El riesgo de data leakage queda acotado, no descartado, y los intervalos de confianza probablemente son demasiado estrechos. La brecha supervisada 0,999 → 0,629, en particular, deja margen de interpretación: los autores muestran que retirar los casi duplicados sospechosos ayuda algo, sin poder decir cuáles eran duplicados reales.
Una auditoría que se detiene antes de la pregunta clínica. Sin estudio de lectores, sin análisis de equidad por sexo o edad, sin evaluación de un sistema recalibrado localmente — que es lo que haría cualquier programa de cribado serio. Los comparadores son VLM genéricos y una ResNet-50, no los programas CAD comerciales realmente desplegados para la tuberculosis: la auditoría no dice nada de su comportamiento frente a los mismos controles enfermos. Por último, la versión examinada no menciona financiación, conflictos de intereses ni código publicado, lo que impide repetir el análisis tal cual.
Lo que cambia
Para la comunidad investigadora, el artículo ofrece una lista directamente reutilizable: toda publicación de un VLM médico en zero-shot debería dar sus prompts exactos, su definición de los negativos, e informar del rendimiento frente a controles enfermos nombrados, no solo frente a sanos. Es la versión instrumentada de un problema conocido, la estratificación oculta — un AUROC global de 0,878 en VinDr-CXR puede coexistir con una ordenación peor que el azar frente a la neumonía, porque 2 051 imágenes normales dominan el denominador. El mismo mecanismo aparecía en nuestro análisis sobre la transportabilidad de los modelos de radiografía pediátrica y en el de la auditoría de las etiquetas de MIMIC-CXR.
Para los clínicos y los programas de cribado, el mensaje es práctico. En una población real, las personas cribadas no son «tuberculosas o sanas»: muchas tienen neumonía, secuelas, cáncer. Un modelo presentado con un AUROC favorable en Montgomery o Shenzhen, que solo comparan la tuberculosis con pulmones normales, no aporta ninguna prueba sobre ese escenario. Y un umbral nunca debe importarse tal cual: debe reajustarse y validarse localmente, con sensibilidad y especificidad informadas juntas.
Para los pacientes y el público, una herramienta que confunde neumonía y tuberculosis satura los laboratorios con pruebas de confirmación y retrasa otros diagnósticos. La promesa del zero-shot — un modelo utilizable en cualquier lugar sin datos locales — no queda demostrada aquí para la tuberculosis.
Para profundizar
El artículo: Beyond Benchmark Scores: Auditing Medical Vision-Language Models for Chest X-Ray Tuberculosis Screening, Mushir Akhtar, M. Tanveer, Mohd. Arshad (Department of Mathematics, Indian Institute of Technology Indore), arXiv:2609.21763 (cs.CV), depositado el 18 de septiembre de 2026, DOI 10.48550/arXiv.2609.21763. Preprint no revisado por pares.
Los conjuntos de datos: Montgomery y Shenzhen (National Library of Medicine), TBX11K, VinDr-CXR v1.0.0 (PhysioNet). Sobre el marco de la OMS: las directrices consolidadas sobre cribado de la tuberculosis (2021). Sobre otro caso de correlación espuria ligada al origen de los datos: el shortcut learning en mamografía.