Radiografía de tórax pediátrica: el AUROC sobrevive al cruce de fronteras, el umbral de decisión no

Un investigador de la American International University-Bangladesh congeló un ensemble DenseNet121 de tres semillas entrenado con las 5.824 radiografías de tórax pediátricas de Guangzhou — AUROC interno 0,976, sensibilidad 95,1 % — y lo aplicó sin ningún ajuste a 3.257 imágenes de Bangladés y a 1.077 imágenes de Vietnam nunca tocadas. El AUROC desciende a 0,798 y 0,742, una degradación severa que aun así deja el ordenamiento utilizable; en el umbral de decisión congelado sobre los datos fuente, la sensibilidad se desploma al 6,2 % y luego al 0 %, sobre 2.377 y 170 neumonías respectivamente. Recalibrar con 163 etiquetas locales devuelve la sensibilidad al 88,3 % sin tocar el ordenamiento, pero genera alerta en el 78,5 % de las radiografías: lo que el artículo demuestra sobre todo es que «se puede arreglar» y «es desplegable» no son la misma frase.

El contexto

La clasificación de neumonía pediátrica en radiografía de tórax es uno de los terrenos más saturados de la IA médica y uno de los peor evaluados. Casi todos los trabajos publicados desde 2018 se entrenan y se prueban sobre el mismo recurso: el conjunto de Guangzhou difundido por Kermany et al. en Cell, unas 5.800 imágenes de niños de un único centro chino. Las revisiones sistemáticas de radiología pediátrica lo repiten desde hace cuatro años: la prueba externa sigue siendo rara y la generalizabilidad clínica, incierta.

Sin embargo, el problema que ataca este preprint no es la ausencia de validación externa. Es su reducción a una sola cifra. Cuando un artículo anuncia una «validación externa», casi siempre reporta un AUROC y nada más. Pero detrás de una cifra de rendimiento se esconden tres preguntas distintas. El AUROC (área bajo la curva ROC) mide la capacidad de ordenar: si se extrae al azar un niño enfermo y uno sano, ¿qué probabilidad hay de que el modelo dé la puntuación más alta al enfermo? Ignora por completo la escala de las puntuaciones. La calibración mide si una probabilidad anunciada de 0,8 corresponde realmente a un 80 % de casos positivos. El punto de funcionamiento, por último, es el umbral concreto por encima del cual el software dispara una alerta: es él, y solo él, quien produce las sensibilidades y especificidades publicadas.

Estas tres cosas se mueven de forma independiente. Un desplazamiento monótono de las puntuaciones en la población diana — todas las puntuaciones empujadas hacia abajo, pero en el mismo orden — deja el AUROC intacto y vuelve el umbral fuente completamente inoperante. A la inversa, una recalibración puede reparar las probabilidades sin mejorar ni una milésima el ordenamiento. Eso es lo que este trabajo se propone demostrar experimentalmente, con un protocolo bloqueado de antemano.

El método

Tres cohortes, tres papeles. Guangzhou/Kermany (China) sirve al desarrollo: entrenamiento, ajuste, escalado de temperatura, elección de umbral, prueba interna. BDCXR-3257 (Bangladés, 3.257 imágenes, 880 normales y 2.377 neumonías, un 73 % de prevalencia) es la prueba externa primaria. VinDr-PCXR/PediCXR (Vietnam) aporta una segunda cohorte externa, armonizada antes de cualquier inferencia a 1.077 exámenes (907 normales, 170 de la «familia neumonía»), y nunca utilizada para nada más que la inferencia final.

La jerarquía de análisis está bloqueada. Es la decisión de diseño más importante. BDCXR se evalúa primero como cohorte completa con el sistema fuente congelado, y ese resultado se conserva tal cual. Solo después se corta BDCXR en un fondo de adaptación de 651 imágenes y un conjunto de retención disjunto de 2.606. VinDr nunca se usa para entrenar, calibrar, seleccionar modelo ni elegir umbral. Dicho de otro modo, el autor se prohíbe explícitamente repintar como «validación externa» un resultado obtenido tras haber mirado los datos diana.

El control de fuga en la fuente. Cada imagen de Guangzhou se decodifica y se hashea: se retiran 32 duplicados exactos, quedando 5.824 radiografías únicas. Como los identificadores numéricos se reutilizan entre los nombres de archivo bacterianos y virales, la agrupación derivada de nombres de archivo se hace dentro de cada espacio de nombres patológico. División final: 4.165 entrenamiento, 1.041 ajuste, 618 prueba interna, con solapamiento nulo de hash y de grupo. El autor precisa honestamente que estos grupos son proxies de control de fuga, no identificadores de paciente verificados.

El modelo. Un codificador DenseNet121 preentrenado en ImageNet, compartido entre dos vistas de la misma radiografía: la imagen entera y una imagen condicionada a los pulmones obtenida con el segmentador anatómico PSPNet de TorchXRayVision. Una compuerta aprendida, canal a canal, combina ambas representaciones. La regularización MixStyle — que durante el entrenamiento mezcla estadísticas de estilo entre ejemplos para desalentar que el modelo se aferre a la apariencia de un escáner concreto — solo está activa en la fuente. Preprocesado: escalado robusto de intensidad, letterboxing con relación de aspecto preservada, 320 × 320, replicación en tres canales, normalización ImageNet; los DICOM de VinDr se reescalan y la inversión MONOCHROME1 se trata antes. Tres semillas (42, 52, 62) se promedian a nivel de logits y luego se ajusta un escalado de temperatura — un único parámetro que aplana o endurece las probabilidades — solo sobre los logits de ajuste fuente (T = 0,8313).

El umbral. Es la elección más discutible del estudio y conviene retenerla: el punto de funcionamiento primario es el punto ROC de mayor especificidad que alcanza al menos un 90 % de sensibilidad en los datos de ajuste fuente. Vale 0,9999728. Siete nueves tras la coma. Un segundo umbral, llamado liberal, se deriva a posteriori pero siempre a partir de datos fuente únicamente: 0,314311.

Las pruebas de robustez. Tres variantes emparejadas con semilla 42, sobre la misma división fuente, comprueban si el desplome depende de la arquitectura propuesta: un DenseNet121 convencional sobre imagen entera, la doble vista sin compuerta ni MixStyle, y el modelo completo. Cada una recibe su propia temperatura y su propio umbral fuente. Pruebas de estrés buscan una señal de atajo (shortcut) reevaluando BDCXR en cuatro vistas: imagen completa, pulmones, solo fondo, solo borde. Clasificadores de dominio separados miden la separabilidad fuente/diana. Estadística: intervalos de Wilson para proporciones, 2.000 remuestreos bootstrap estratificados a nivel de imagen para VinDr, 2.000 bootstraps emparejados para la comparación de ajuste fino. Informe conforme a los principios CLAIM 2024 y TRIPOD+AI.

Los resultados

Internamente todo va bien. AUROC 0,976, AUPRC 0,982, sensibilidad 95,1 % (368/387; IC 95 % 92,5–96,8), especificidad 90,9 % (210/231; 86,5–94,0), exactitud equilibrada 93,0 %. El tipo de resultado que da titular.

En Bangladés el ordenamiento aguanta, la decisión no. AUROC 0,798, AUPRC 0,912. Pero solo 147 de las 2.377 neumonías superan el umbral fuente: sensibilidad 6,2 % (IC 5,3–7,2), especificidad 99,9 % (879/880), exactitud equilibrada 53,0 %. Traducción clínica: por cada 100 radiografías pasadas por el sistema, 4,5 disparan una alerta y se pierden 68,5 neumonías. La calibración también se hunde (ECE 0,258, Brier 0,268).

En Vietnam el umbral no se dispara nunca. AUROC 0,742 (IC bootstrap 0,701–0,782), AUPRC 0,396. Ninguno de los 170 exámenes de la familia neumonía cruza el umbral: sensibilidad 0 % (IC de Wilson 0–2,2), especificidad 100 %, exactitud equilibrada 50,0 %. La pendiente de calibración es de 0,196. Dos definiciones más estrictas del criterio dan AUROC de 0,729 y 0,734, y la misma sensibilidad nula.

No es culpa de la arquitectura propuesta. El DenseNet121 convencional sobre imagen entera pasa de 0,961 a 0,749 en BDCXR, con la sensibilidad del 94,8 % al 16,2 %. Doble vista sin compuerta: 0,977 → 0,766, sensibilidad 96,1 % → 4,7 %. Modelo completo: 0,966 → 0,789, 95,9 % → 4,4 %. El fenómeno es idéntico en todos los casos; el modelo «mejorado» gana algo de AUROC externo y pierde más sensibilidad al umbral.

La recalibración repara las probabilidades, no la decisión. Sobre el conjunto de retención de 2.606 imágenes, el modelo fuente bloqueado da AUROC 0,799, sensibilidad 6,4 %, ECE 0,256. Una recalibración de Platt — una simple transformación logística de la puntuación, por tanto monótona, por tanto sin efecto sobre el AUROC — ajustada con 163 etiquetas locales (5 % de la cohorte) da: sensibilidad 88,3 %, ECE 0,044, pero especificidad 47,9 %, VPP 0,821, tasa de alerta 78,5 % y 14,1 falsas alertas por 100 exámenes. Con 326 etiquetas: sensibilidad 91,9 %, especificidad 38,6 %, tasa de alerta 83,7 %, 16,6 falsas alertas por 100. Con 651 etiquetas, ninguna mejora adicional (90,7 % / 42,5 %). El presupuesto de etiquetas satura de inmediato, y lo que compra es una política que señala cuatro radiografías de cada cinco.

Y esa reparación es inestable. En 200 extracciones repetidas de 163 etiquetas, la sensibilidad media es del 91,5 % (percentiles 2,5–97,5: 86,8–95,5 %) pero la especificidad media del 37,1 % con un rango de 21,0 a 49,3 %. La dirección de la recuperación es reproducible; el punto de funcionamiento obtenido depende mucho de qué 163 imágenes se etiquetaron.

El ajuste fino no aporta nada más. La comparación preespecificada con 326 etiquetas — ajuste fino del último bloque frente a recalibración de Platt emparejada — da 0,7907 contra 0,7893, es decir +0,00136 (IC 95 % −0,00117 a +0,00382; p = 0,293). Los ensembles de tres semillas suben a 0,805 con 326 etiquetas y a 0,815 con 651: ganancias de ordenamiento reales pero marginales.

La señal existe fuera de los pulmones. En BDCXR, el AUROC para neumonía se mantiene por encima del azar en la imagen completa (0,794), en los pulmones (0,760), en el fondo solo (0,719) y en el borde solo (0,667). La clasificación fuente-contra-diana es casi perfecta en todas las vistas.

El umbral patológico solo explica parte del desastre. El umbral liberal (0,314311) lleva la sensibilidad interna al 100 %, pero solo da un 69,0 % en Bangladés y un 15,9 % en Vietnam. El umbral de siete nueves amplificó el fracaso; no lo creó.

Lo que está bien

La jerarquía de análisis está bloqueada y el autor la respeta hasta autoinculparse. BDCXR se evalúa como cohorte completa y ese resultado se conserva antes de mirar una sola etiqueta local; VinDr no se toca en ningún momento. Es exactamente la disciplina que pide TRIPOD+AI y que casi nadie aplica, porque prohíbe presentar como externo un resultado obtenido tras la adaptación. El autor va más lejos: revela que una versión anterior de su propio pipeline comparaba nombres de institución en texto plano y filtraba, y que los pliegues publicados fueron recortados. También precisa que los grupos de control de fuga de Guangzhou derivan de nombres de archivo y no son identificadores de paciente verificados. Este nivel de autodeclaración es raro.

El brazo de robustez arquitectónica desactiva la objeción más obvia. Un lector apresurado concluiría que la doble vista con compuerta es mala idea. El autor prueba precisamente eso: un DenseNet121 desnudo, entrenado sobre la misma división con su propia calibración y su propio umbral, también se desploma (0,961 → 0,749, sensibilidad 94,8 % → 16,2 %). El resultado de transporte no es, pues, un artefacto de una implementación concreta. Es una contribución negativa sobre su propia arquitectura, publicada como tal: el autor escribe explícitamente que el artículo no presenta un nuevo backbone de visión y que la contribución es la descomposición reproducible del fracaso.

La «recuperación» se cuantifica en carga de trabajo, no solo en métricas. Es lo que distingue este artículo de la literatura de adaptación de dominio. Casi todos los trabajos que muestran que una recalibración ligera restaura la sensibilidad se detienen en la sensibilidad. Aquí se lee, en la misma fila de tabla: sensibilidad 88,3 %, especificidad 47,9 %, tasa de alerta 78,5 %, 14,1 falsas alertas por 100 exámenes. Y el análisis de 200 remuestreos muestra que la especificidad obtenida varía del 21 % al 49 % según la extracción. Es decir, el autor mide no solo el coste operativo de la reparación, sino también su imprevisibilidad.

Lo que está menos bien

El umbral primario de 0,9999728 fabrica parte del resultado que encabeza el resumen. Un punto de funcionamiento con siete nueves no es una elección clínica, es el síntoma de un sigmoide saturado sobre un conjunto fuente fácil — el modelo emite probabilidades pegadas a 1 para casi todas las neumonías de Guangzhou, así que la regla «máxima especificidad con sensibilidad ≥ 90 %» aterriza en un punto absurdo. Las cifras de titular — 6,2 % y 0 % — son en parte producto de esa mecánica. El autor lo reconoce, prueba un umbral liberal y concluye con razón que este «amplificó pero no creó» el fracaso. Pero el resumen sigue encabezando con 6,2 % y 0 %, cuando las cifras honestamente transportables están más cerca del 69,0 % en Bangladés y el 15,9 % en Vietnam. Es un caso de manual de métrica engañosa, aquí en perjuicio del modelo en vez de a su favor — lo que sigue siendo una distorsión.

No hay ningún comparador humano, y el estándar de referencia es débil en los tres pisos. Nada se compara con un radiólogo, un pediatra, ni siquiera con una regla clínica sencilla: no sabemos, por tanto, si una sensibilidad del 69 % en Bangladés es buena, mala o irrelevante. Las etiquetas de Guangzhou proceden de un recurso cuyas limitaciones están documentadas desde 2018. El criterio de valoración vietnamita tuvo que ser armonizado por el propio autor antes de la inferencia (Pneumonia, Broncho-pneumonia y Pleuro-pneumonia contadas como positivas, «No finding» limpio como negativo) — una decisión defendible, congelada antes del análisis y verificada con dos definiciones más estrictas, pero que sigue siendo una decisión del experimentador sobre la variable que mide. Por último, BDCXR no tiene ningún identificador de paciente verificado: el bootstrap a nivel de imagen no puede tener en cuenta posibles radiografías múltiples de un mismo niño, lo que probablemente subestima la incertidumbre — el autor lo escribe con todas las letras.

El título dice «tres países» cuando el estudio no puede atribuir nada al país. Los tres recursos difieren simultáneamente en geografía, distribución de edad, prevalencia (¡73 % frente a 15,8 %!), equipamiento, compresión, espectro de enfermedad, protocolo de anotación y estándar de referencia. El autor lo dice explícitamente en las limitaciones y rechaza toda conclusión causal sobre la geografía — pero el título y el resumen siguen vendiendo «across three countries». A ello se suman tres debilidades de reproducibilidad. El análisis de atajos es sugerente, no causal: que el fondo sea predictivo a 0,719 muestra que existe señal correlacionada con la etiqueta fuera de la anatomía, no que el modelo la haya usado, y el autor lo concede. El código se anuncia como «archivo de reproducibilidad suministrado con esta remisión» — sin repositorio público, sin DOI de código, sin pesos publicados, y el preprint lleva licencia CC BY-NC-ND 4.0, ni comercial ni derivable. Y se trata de un trabajo de autor único, sin financiación, sin validación prospectiva, sin readjudicación radiológica local y sin curva de decisión: lo que el artículo documenta con rigor es un fracaso de transporte, no un camino al despliegue.

Lo que cambia

Para la comunidad investigadora. El resultado transferible no es ninguna de las cifras, es el protocolo de cinco componentes: discriminación, calibración, comportamiento en el punto de funcionamiento congelado, señal de atajo y recuperabilidad con presupuesto de etiquetas limitado. Esos cinco ejes cuestan unas horas extra de cómputo sobre datos que ya se poseen, y separan situaciones que el AUROC por sí solo confunde por completo. La demostración más nítida del artículo cabe en una línea: AUROC 0,742 y sensibilidad 0 % sobre la misma cohorte, con el mismo modelo, en el mismo instante. Toda revisión sistemática que cuente «validaciones externas exitosas» a partir de un AUROC está contando mal. Ya habíamos visto este desdoblamiento en la transportabilidad de los modelos de delirium en cuidados intensivos entre eICU y MIMIC, y el mecanismo es idéntico.

Para clínicos y compradores de dispositivos. La cifra que hay que recordar es 78,5 %. Es la tasa de alerta tras una recalibración presentada como exitosa — sensibilidad restaurada al 88,3 %, calibración excelente con un ECE de 0,044. Un software que señala cuatro radiografías de cada cinco en un servicio que produce doscientas al día no es una herramienta de triaje, es una fuente de ruido. La consecuencia práctica es que una cláusula contractual que exija «un AUROC ≥ 0,80 sobre nuestros datos» resulta insuficiente: hay que exigir el umbral, la sensibilidad y la especificidad y la tasa de alerta a ese umbral, sobre la población local, más el procedimiento de recalibración cuando deriven. El corolario es que un modelo comprado con su umbral de fábrica probablemente sea inutilizable tal cual — pero recalibrarlo localmente exige etiquetas locales, es decir tiempo de radiólogo, es decir un presupuesto que nadie provisiona.

Para los pacientes y el público. En los 1.077 exámenes vietnamitas, el modelo detectó cero neumonías de 170. No porque no «vea» nada — su ordenamiento se mantiene claramente por encima del azar — sino porque el dial ajustado en China no correspondía a nada en Vietnam. Es el modo de fallo más insidioso de la IA médica: el sistema no se equivoca ruidosamente, se calla. Y que el fondo y el borde de las radiografías de Bangladés sigan siendo predictivos de neumonía recuerda que estos modelos aprenden en parte el hospital, no la enfermedad — el mismo aprendizaje por atajo que describimos en la fusión de conjuntos de datos en mamografía de cribado. La lección general, para un lector no especialista: cuando un comunicado anuncia que un modelo alcanza un 95 % de sensibilidad, la pregunta no es «¿en cuántos pacientes?» sino «¿a qué umbral, y se fijó ese umbral sobre los mismos datos?».

Para saber más

El preprint: Cross-dataset transportability of pediatric chest X-ray deep learning across three countries: discrimination, calibration, operating-point failure, and limited-label recovery, arXiv:2609.05140 [eess.IV], DOI 10.48550/arXiv.2609.05140, depositado el 4 de septiembre de 2026, bajo licencia CC BY-NC-ND 4.0. Autor único: Nazim-E-Alam, Departamento de Informática, American International University-Bangladesh (AIUB), Daca. Sin financiación pública, comercial ni de organizaciones sin ánimo de lucro; sin conflictos de interés declarados. El autor declara haber usado ChatGPT (OpenAI) para la síntesis bibliográfica, la depuración de código, la estructuración del manuscrito y la mejora del lenguaje, e indica haber verificado las afirmaciones numéricas frente a las salidas de análisis conservadas; ninguna imagen científica fue generada ni alterada por IA. Los datos fuente permanecen en sus repositorios respectivos: Guangzhou/Kermany (Cell, 2018), PediCXR (Scientific Data, 2023) y VinDr-PCXR en PhysioNet, cuyos DICOM son de acceso restringido y no se redistribuyen. Un archivo de código de reproducibilidad acompaña la remisión pero no está depositado públicamente. Sobre el contexto metodológico, dos lecturas fundacionales: Zech et al., PLOS Medicine 2018, sobre un modelo de neumonía que codifica la identidad del centro, y Van Calster et al., BMC Medicine 2019, «Calibration: the Achilles heel of predictive analytics». Las guías de reporte citadas son CLAIM 2024 y TRIPOD+AI.