Mezcla jerárquica de expertos para la enfermedad pulmonar intersticial de la esclerodermia: añadir la historia clínica al TC gana 0,0104 puntos de AUC, con p = 0,804
Once autores de Northwestern University ensamblan un experto de imagen congelado — cinco subredes, una por lóbulo pulmonar — y una rama de historia clínica dividida en grupos clínicos, unidas por dos etapas de puertas aprendidas, para detectar enfermedad pulmonar intersticial en 597 pacientes con esclerosis sistémica. El AUC medio alcanza 0,8750 frente a 0,8646 de la misma arquitectura privada de la historia clínica: una diferencia de 0,0104 puntos que los autores contrastan y declaran no significativa (p = 0,804). El artículo vale menos por su rendimiento que por lo que informa con honestidad y por lo que revelan sus puertas.
El contexto
Una mezcla de expertos (mixture-of-experts, MoE) es una arquitectura en la que coexisten varias subredes especializadas — los expertos — y una pequeña red adicional, la puerta (gate), decide para cada entrada qué parte de la decisión corresponde a cada una. Los grandes modelos de lenguaje la popularizaron por una razón de coste: activar solo dos expertos de sesenta y cuatro permite tener muchos parámetros sin pagar mucho cálculo. En imagen médica el argumento es distinto. Lo que se busca no es ahorro de cómputo sino especialización por región anatómica, y la interpretabilidad que dan los pesos de puerta: saber qué parte del pulmón, o qué familia de pruebas, sostuvo realmente la decisión.
La enfermedad pulmonar intersticial (EPI) designa un grupo de enfermedades que afectan al tejido de sostén situado entre los alvéolos pulmonares, lo engrosan y lo fibrosan, dificultando el paso de oxígeno a la sangre. En pacientes con esclerosis sistémica — enfermedad autoinmune que endurece la piel y fibrosa los órganos internos — la EPI se ha convertido en la primera causa de muerte. Su diagnóstico descansa en la tomografía computarizada torácica de alta resolución, leída región por región: lo que cuenta no es la simple presencia de anomalías sino su distribución, con un predominio característico basal y subpleural. Sin embargo, la mayoría de las redes profundas tratan el pulmón como un volumen único, diluyendo precisamente la señal regional que el radiólogo busca.
El mismo equipo publicó en 2025 REN, una MoE solo de imagen estructurada por lóbulos que explotaba esta intuición anatómica. El presente trabajo le añade la historia clínica electrónica estructurada (EHR): pruebas de función pulmonar, autoanticuerpos, analítica, constantes vitales. La pregunta que plantea es la de toda la literatura de fusión multimodal en salud: cuando dos fuentes de información tienen un valor diagnóstico que varía de un paciente a otro, ¿hay que concatenarlas, hacerlas dialogar por atención cruzada, o enrutarlas explícitamente?
El método
La cohorte. Retrospectiva, del registro de esclerodermia de Northwestern: 597 pacientes y 1.898 TC torácicas longitudinales adquiridas entre 2001 y 2023. 489 mujeres (81,9 %), edad media 63,7 ± 12,7 años. Subtipos: forma cutánea limitada 47,6 %, forma cutánea difusa 41,0 %, esclerodermia sin esclerodermia 4,7 %, otros 6,7 %. Se confirmó EPI en 365 pacientes (61,1 %), que forman la clase positiva. Estudio aprobado por el comité ético de Northwestern con consentimiento informado.
El preprocesado. Los volúmenes se remuestrean a 1 mm isotrópico, se segmentan en cinco lóbulos pulmonares (superior e inferior izquierdos, superior, medio e inferior derechos) mediante LungMask R231, se ventanan entre −175 y 250 unidades Hounsfield y se redimensionan a 96 × 96 × 96 vóxeles.
Los pesos de lóbulo por radiómica. Antes de entrenar la red, los autores estiman qué importancia diagnóstica dar a cada lóbulo. Para cada partición de validación cruzada extraen 107 descriptores de PyRadiomics por lóbulo — medidas de textura, forma e intensidad calculadas sobre la imagen — y entrenan un XGBoost por lóbulo únicamente sobre la partición de entrenamiento. El AUC de validación obtenido se convierte en peso mediante una transformación afín acotada por abajo: w = 0,1 + (AUC − 0,5) × 3,8 si el AUC supera 0,5, y 0,1 en caso contrario. Estos pesos se recalculan en cada partición y luego se congelan durante todo el entrenamiento multimodal.
El experto de imagen. Cinco expertos especializados, uno por lóbulo, cada uno un SwinUNETR 3D — un transformer de ventanas desplazadas diseñado para volúmenes médicos — aplicado al volumen enmascarado por su lóbulo. Sus representaciones se agregan mediante los pesos radiómicos normalizados y se reducen a un vector de 48 dimensiones. Este experto se entrena solo sobre el TC y luego se congela: durante la fase multimodal sus parámetros ya no se mueven.
La rama de historia clínica. Para cada TC, cada variable clínica se empareja con la medición más reciente anterior a la fecha del estudio; en su defecto, con la medición posterior más próxima dentro de una ventana de gracia de 30 días; si no, el valor se pone a cero tras la estandarización. La estandarización se ajusta únicamente sobre la partición de entrenamiento de cada pliegue. Se comparan dos configuraciones. La jerarquía completa reparte 69 variables en siete grupos clínicos: hemograma completo (21), pruebas de función pulmonar (3), bioquímica sérica (14), marcadores de laboratorio y funcionales (4), constantes vitales (7), demografía estática (14) y demografía específica de la enfermedad (6). La jerarquía selectiva conserva solo 12 variables en tres grupos: función pulmonar (CVF, VEMS, DLCO), fenotipo de la enfermedad (subtipos lcSSc, dcSSc y esclerodermia sin esclerodermia, más el estado de anticuerpos Scl-70, anticentrómero y ARN polimerasa III) y biomarcadores clave (pico de creatinina, puntuación cutánea de Rodnan modificada, péptido natriurético tipo B).
Las dos etapas de puertas. Cada grupo pasa por su propia red pequeña con proyección residual, produciendo un vector de 24 dimensiones; una primera puerta softmax pondera los grupos entre sí y produce la representación clínica en 48 dimensiones. Una segunda puerta, la puerta de modalidad, toma la concatenación de ambas representaciones y produce dos pesos que suman uno: la representación final es su combinación convexa, enviada a un clasificador binario ligero. El interés de esta estructura es tanto teórico como práctico: agrupar las variables reduce la dimensionalidad de las interacciones cruzadas del orden del cuadrado del número de variables al orden del número de grupos, lo que controla la varianza.
El protocolo. AdamW (tasa de aprendizaje 4 × 10⁻⁴, decaimiento de pesos 10⁻⁵), lotes de 4, parada temprana con paciencia 10, ponderación inversa a la frecuencia de clases. Evaluación por validación cruzada de cinco pliegues a nivel de paciente: todas las TC de un mismo paciente permanecen en el mismo pliegue. Las comparaciones usan pruebas t pareadas bilaterales sobre los AUC de pliegue calculados con particiones idénticas. Implementación en PyTorch y MONAI, GPU A100.
Los resultados
La clasificación completa. MoE jerárquica selectiva 0,8750 ± 0,0443 (IC 95 % [0,820; 0,930]); REN solo imagen 0,8646 ± 0,0467 ([0,806; 0,923]); concatenación más regresión logística 0,8595 ± 0,0438; MoE jerárquica completa 0,8496 ± 0,0449; concatenación más MLP 0,8337 ± 0,0551; historia clínica sola con regresión logística 0,8280 ± 0,0517; SwinUNETR sobre el pulmón entero 0,7685 ± 0,0759; CNN 0,7584 ± 0,0919; Mamba 0,6775 ± 0,0454; ViT 0,6535 ± 0,0356. Recordatorio de lectura: un AUC de 0,875 significa que si se extraen al azar un estudio de un paciente con EPI y otro de un paciente sin ella, el modelo ordena correctamente el par unas 88 veces de cada 100, frente a 50 de cada 100 por puro azar.
El resultado principal es negativo, y los autores lo escriben. La diferencia de 0,0104 puntos entre el modelo propuesto y la arquitectura solo imagen de la que deriva da t(4) = 0,265, p = 0,804. Los intervalos de confianza se solapan en casi toda su longitud. Frente a SwinUNETR aplicado al pulmón entero la diferencia sí es clara (p < 0,001), pero es una comparación sin apuesta: mide sobre todo la aportación de la descomposición anatómica, ya establecida en el trabajo anterior.
El orden de las filas informa más que la fila superior. Una regresión logística sobre las solas variables clínicas, sin ninguna imagen, alcanza 0,8280 — lo esencial de la señal. Una concatenación trivial de ambas modalidades seguida de regresión logística alcanza 0,8595, a 0,0155 puntos del modelo jerárquico completo de dos etapas. Dicho de otro modo, en esta cohorte toda la maquinaria de enrutamiento compra alrededor de punto y medio en la tercera decimal frente a lo más simple que se puede escribir.
Menos historia clínica vale más que más. La jerarquía selectiva (12 variables) supera a la completa (69 variables) por 0,0254 puntos. El análisis de puertas propone una explicación: en la configuración completa el enrutamiento se dispersa entre siete grupos, varios de ellos estáticos o redundantes, y la rama clínica acaba dominando a la imagen en los niveles de confianza altos — el régimen asociado a predicciones positivas sobreconfiadas. En la configuración selectiva el enrutamiento se concentra en las pruebas de función pulmonar y el equilibrio entre modalidades permanece estable (pesos medios: imagen 0,498 ± 0,122, historia clínica 0,502 ± 0,122).
Calibración, errores y traducción clínica. El error de calibración esperado es de 0,131 ± 0,038 y la puntuación de Brier de 0,135 ± 0,037. De 960 muestras de test, 167 se clasifican mal (17,4 %), de las cuales 71 — el 42,5 % de los errores — con una confianza igual o superior a 0,8. Los casos mal clasificados se apoyan menos en la historia clínica (peso medio de puerta 0,383 frente a 0,527 en las predicciones correctas), y los falsos positivos están sobre todo impulsados por la imagen. El artículo no informa ni de sensibilidad ni de especificidad, así que no cabe una traducción clínica fina; lo que se puede derivar es tosco pero elocuente: unos 174 estudios mal clasificados por cada 1.000, cerca de 74 de ellos con confianza alta. Un sistema que se equivoca una vez de cada seis y que, en dos de cada cinco errores, se equivoca con seguridad, no puede situarse aguas abajo de una decisión sin revisión.
Estabilidad. Entre los 192 pacientes con más de un TC, la desviación típica intrapaciente de la probabilidad predicha es de 0,0812 ± 0,0964, con un rango medio de 0,2004 ± 0,2406: de un estudio a otro en el mismo paciente la probabilidad anunciada puede moverse veinte puntos, mientras que la etiqueta es fija. Variar la ventana temporal de gracia entre 0 y 90 días no cambia casi nada (AUC de 0,8746 a 0,8750), lo que descarta al menos una fuente de artefacto.
Lo que está bien
La disciplina antifuga es explícita y completa. Se tapan a la vez tres lugares por donde la literatura de IA en salud suele filtrar. Todas las TC de un paciente permanecen en el mismo pliegue, lo que impide la fuga a nivel de paciente — la trampa clásica de las cohortes longitudinales, donde un modelo puede reconocer un pulmón ya visto en vez de una enfermedad. Los pesos radiómicos de lóbulo se recalculan dentro de cada pliegue sobre la sola partición de entrenamiento, en vez de estimarse una vez sobre toda la cohorte. La estandarización de las variables clínicas se ajusta sobre el entrenamiento y se aplica sin cambios a validación y test. En un campo donde la fuga de datos es el primer productor de AUC infladas, este es el punto más sólido del artículo.
El resultado negativo se contrasta y se publica. La comparación directa con la arquitectura anterior se hace sobre pliegues idénticos, que es la forma correcta de contrastar una mejora incremental, y el p = 0,804 figura en el cuerpo del texto, no en un anexo. Muchos artículos se habrían quedado en la columna «+13,9 % frente a SwinUNETR», que es exacta y carece de interés. Los autores escriben explícitamente que la mejora numérica «requiere confirmación en una evaluación más amplia».
La batería de controles supera lo exigible. Sensibilidad de la ventana de emparejamiento historia-TC sobre seis valores, varianza intrapaciente en las series longitudinales, calibración medida con dos métricas, análisis de errores estratificado por peso de puerta, y una escala completa de comparadores de fusión ingenuos que permite al lector situar la ganancia. A lo que se añade una precaución rara: los autores escriben con claridad que las activaciones de puerta reflejan un comportamiento de enrutamiento y no una importancia causal, y que un peso alto no establece la importancia clínica independiente de una prueba.
Lo que está menos bien
El ganador se elige dentro de la validación cruzada que lo mide, y no hay comparador humano. Dos configuraciones de la historia clínica se evalúan sobre los mismos cinco pliegues, y la mejor de las dos se convierte en «el modelo» — una selección sobre el conjunto de evaluación que produce mecánicamente una estimación optimista. Además, con cinco pliegues una prueba t pareada apenas tiene potencia: t(4) solo detecta diferencias grandes. Decir «no significativo» es honesto, pero no poder concluir no es concluir que no hay efecto — el diseño no zanja nada en ningún sentido. Más de fondo, el comparador sesgado aquí es la ausencia de comparador: el estándar para diagnosticar una EPI asociada a esclerodermia es la lectura de la TC de alta resolución por un radiólogo, eventualmente en comité multidisciplinar. No se informa de ningún rendimiento humano, así que se ignora si 0,875 es bueno, mediocre o trivial en este contexto concreto.
Métrica engañosa y unidad de análisis equivocada. Solo se informa del AUC: ni sensibilidad, ni especificidad, ni umbral operativo, cuando el despliegue depende enteramente del umbral elegido. La prevalencia es del 61,1 % en este registro — una población ya seleccionada por esclerodermia y ya estudiada por imagen — lo que nada tiene que ver con la prevalencia a la que se usaría tal herramienta en otro sitio, y hace el rendimiento no transferible tal cual. Sobre todo, la unidad de evaluación es el estudio y no el paciente: las 1.898 TC producen predicciones que, como se ha visto, pueden variar veinte puntos dentro de un mismo paciente cuyo estado es sin embargo único y fijo. Los autores sí incluyen los criterios a nivel de paciente en sus trabajos futuros. Por último, un ECE de 0,131 se describe como «calibración razonable»: trece puntos de desviación media entre probabilidad anunciada y frecuencia observada es una calificación generosa.
Sesgo de población, valores ausentes indistinguibles de la media y opacidad. Centro único, 81,9 % de mujeres, esclerodermia exclusivamente: la generalización a otras etiologías de EPI — fibrosis pulmonar idiopática, artritis reumatoide, neumonitis por hipersensibilidad — no está ni contrastada ni adquirida, y los autores lo reconocen. Ninguna validación externa. El punto más discreto es también el más problemático: los valores clínicos ausentes se ponen a cero después de la estandarización, sin indicador de ausencia. En ese espacio, «dato ausente» y «valor exactamente medio» son el mismo número. Ahora bien, en medicina la ausencia de una prueba de función pulmonar nunca es aleatoria — depende de la gravedad, del acceso a la atención, del año de inclusión. El modelo no puede distinguir ambas situaciones, y el artículo señala la limitación sin medir su efecto. A lo que se añade que ni un enlace a código o pesos, ni una declaración de financiación, ni una declaración de conflictos de interés figuran en el preprint; el registro no se describe como accesible.
Lo que cambia
Para la comunidad investigadora. La contribución reutilizable no es la ganancia, es la escala de comparadores. Leída de abajo arriba dice tres cosas. Un ViT o un Mamba aplicado al volumen pulmonar entero apenas supera al azar en esta tarea (0,65 y 0,68). Imponer la estructura anatómica por lóbulos vale unos diez puntos de AUC (0,7685 → 0,8646). Y todo el aparato multimodal jerárquico añade después una centésima de punto, no significativa. El mensaje para quien diseña este tipo de sistemas es nítido: el rendimiento está en el prior anatómico, no en la sofisticación de la fusión. La segunda lección atañe a las puertas mismas — restringir la rama clínica a las variables mecanísticamente próximas supera a darle sesenta y nueve, porque una puerta no restringida acaba sobreponderando la historia clínica allí donde la imagen porta la información.
Para los clínicos. Hoy no cambia nada, y merece la pena ver por qué la tarea misma es discutible. Detectar una EPI en un paciente con esclerodermia que ya se ha hecho una TC de alta resolución y pruebas de función pulmonar no es un problema clínico abierto: es lo que produce el informe radiológico, y las dos entradas del modelo son exactamente las dos pruebas ya realizadas. La necesidad real está en otra parte — identificar quién va a progresar, a qué velocidad, y quién se beneficiaría de un tratamiento antifibrótico precoz. Los autores lo señalan en trabajos futuros. Mientras tanto, la parte transferible es el análisis de enrutamiento: el modelo se apoya en la imagen para excluir y en la historia clínica para confirmar, reproduciendo el proceder clínico sin que se le haya impuesto.
Para pacientes y público. Este trabajo no produce ninguna herramienta en evaluación clínica ni regulatoria, y por ahora afecta a una enfermedad rara en un único hospital estadounidense. Lo que ilustra merece en cambio conocerse fuera del campo técnico: en la literatura de IA en salud, la distancia entre «nuestro modelo obtiene el mejor AUC» y «nuestro modelo es mejor» suele ser del tamaño del ruido estadístico, y esa diferencia solo se ve leyendo el contraste que la acompaña — cuando lo hay. Aquí los autores hicieron el contraste y publicaron su resultado, que va contra su interés inmediato. Debería ser la conducta esperada por defecto; sigue siendo lo bastante rara como para merecer una mención.
Para saber más
El preprint: Hierarchical MoE for Multi-Modal ILD Diagnosis, arXiv:2608.25261, depositado el 26 de agosto de 2026, de próxima aparición en las actas del taller Machine Learning in Medical Imaging (MLMI 2026) de la conferencia MICCAI. La arquitectura solo imagen de la que deriva este trabajo se describe en REN: Anatomically-Informed Mixture-of-Experts for Interstitial Lung Disease Diagnosis (arXiv:2510.04923). La segmentación lobar usa LungMask R231, los descriptores de imagen provienen de PyRadiomics, y la implementación se apoya en PyTorch y MONAI. No se publica código ni pesos con el preprint, y el registro de esclerodermia de Northwestern no se describe como accesible.