Alzheimer en resonancia: fusionar las puntuaciones cognitivas gana 28 puntos de exactitud y degrada lo que el modelo aprende de la imagen
Dos investigadores de la Universidad Nacional de Ciencia y Tecnología POLITEHNICA de Bucarest entrenaron un clasificador de Alzheimer con 1.075 resonancias magnéticas T1 de la cohorte ADNI-1 y después le añadieron variables clínicas mediante aprendizaje contrastivo. Fusionar las puntuaciones cognitivas — MMSE, CDR-SB, ADAS11, RAVLT — eleva la exactitud de tres clases del 58,7 % al 87,3 %, pero esas puntuaciones son precisamente los instrumentos que sirven para asignar la etiqueta diagnóstica en ADNI: el modelo no lee mejor la imagen, recupera la regla de etiquetado. El resultado verdaderamente útil está en otro sitio: con arquitectura, partición de sujetos y entrenamiento idénticos, el codificador alineado con volúmenes anatómicos produce una representación de imagen que alcanza el 73,8 % en MCI frente a controles, contra el 52,4 % — el azar — del codificador alineado con las puntuaciones cognitivas.
El contexto
La enfermedad de Alzheimer se ve en una resonancia estructural T1 — la que muestra la anatomía y no la función — en forma de atrofia: el tejido cerebral se adelgaza, primero en el lóbulo temporal medial, donde se sitúan el hipocampo y la corteza entorrinal. Desde hace una década, la tarea estándar consiste en clasificar una exploración en tres categorías: cognitivamente normal (CN), deterioro cognitivo leve (MCI, la fase prodrómica) y Alzheimer establecido (AD). Separar AD de CN es relativamente fácil, porque la atrofia tardía se ve. Separar MCI de CN es difícil, y esa es la frontera que importa clínicamente, porque es la ventana en la que una intervención aún podría servir.
Dos problemas se repiten en esta literatura, y el artículo los aborda de frente. El primero tiene que ver con qué mira el modelo: una red convolucional que recibe un corte entero no tiene ninguna razón para limitarse al tejido cerebral, y puede explotar el contraste del cráneo, las órbitas o los bordes ventriculares. Es un caso de manual de shortcut learning — el modelo aprende una correlación espuria en lugar de la patología —, el mismo mecanismo documentado en la firma de origen de los conjuntos de datos de mamografía de cribado.
El segundo tiene que ver con qué se le da al modelo. Las grandes cohortes como ADNI incluyen tablas clínicas ricas, y los trabajos recientes de fusión imagen-tabla reportan ganancias llamativas al añadirlas a la resonancia. Salvo que varias columnas de esas tablas — el MMSE, la Clinical Dementia Rating — están entre los criterios que sirvieron para asignar la etiqueta diagnóstica en ADNI. Predecir la etiqueta a partir de esas variables equivale en gran medida a rederivar la regla que la produjo. Es la fuga de etiqueta (label leakage), prima hermana de la fuga circular ya vista en las etiquetas de benchmark producidas por un LLM.
El método
Los datos. 1.075 resonancias T1 adquiridas a 1,5 teslas en la colección ADNI-1 Screening, de 982 sujetos — algunos participantes tuvieron más de una adquisición de cribado. El reparto es de aproximadamente 289 CN, 507 MCI y 279 AD. Todos los volúmenes se procesaron con FastSurfer, la reimplementación en aprendizaje profundo de FreeSurfer, que lleva cada exploración a una rejilla de 256³ vóxeles isotrópicos de 1 mm y produce una parcelación cortical DKT con etiquetas subcorticales.
La partición. Los autores particionan a nivel de sujeto: ningún paciente aparece en dos conjuntos. Es el punto sobre el que Wen y colaboradores mostraron, en 2020, que la literatura de Alzheimer inflaba sus cifras al particionar por corte en lugar de por paciente. El conjunto de prueba está equilibrado, 21 exploraciones por clase, 63 en total; las tareas binarias usan 42. Quedan unas 862 exploraciones de entrenamiento y 150 de validación.
El codificador de imagen. Deliberadamente ligero: un ResNet18 preentrenado en ImageNet, del que solo se reajusta el último bloque residual, aplicado corte a corte (90 cortes axiales, índices 62 a 152, redimensionados a 224 × 224). Los descriptores de corte pasan por una única capa Transformer con 8 cabezas de atención — un mecanismo que permite a cada corte ponderar la información de los demás — y después una media da un descriptor de sujeto, proyectado a un vector de 128 dimensiones (el embedding, la representación numérica compacta de la exploración).
La rama tabular y el espectro de fuga. Las variables clínicas provienen de la tabla consolidada ADNIMERGE (16.421 filas sujeto-visita), organizadas en cinco grupos ordenados por su proximidad a la etiqueta: cog (CDR-SB, ADAS11, MMSE, RAVLT inmediato — riesgo de fuga alto, son los instrumentos diagnósticos); bio (Aβ, tau, p-tau en LCR); pet (FDG, AV45); vol (hipocampo, cerebro completo, corteza entorrinal, temporal medio — riesgo bajo, son correlatos de atrofia, no criterios); demo (APOE4, edad). Solo se usan cog y vol: el grupo bio está cumplimentado en apenas el 14 % de las filas, lo que habría exigido una imputación masiva. En cog y vol faltan menos del 3 % de las celdas y se sustituyen por la media del entrenamiento.
El alineamiento contrastivo. Las dos ramas se acercan mediante una pérdida CLIP simétrica — el objetivo de entrenamiento que empuja el embedding de imagen de un sujeto a parecerse a su embedding tabular y a diferenciarse de los de los demás sujetos del lote. Un detalle metodológico honesto y rara vez reportado: la pérdida debía calcularse en precisión simple, porque en precisión mixta se quedaba clavada en su valor de azar. Encima se entrenan dos cabezas: una cabeza solo-imagen, clasificador lineal que no ve ninguna variable clínica en inferencia, y una cabeza de fusión sobre la concatenación de ambos embeddings.
Los resultados
Dónde mira el clasificador. Modelos YOLOv8 entrenados con las etiquetas derivadas de FastSurfer localizan las estructuras relevantes con una mAP₅₀ de al menos 0,95 — hasta 0,969 en la variante media. Comparados con esas detecciones, los mapas Grad-CAM del clasificador de imagen muestran dos regímenes: en muchos cortes sí atiende a los ventrículos y luego a los lóbulos temporales; en un número sustancial de otros, la atención cae sobre el cráneo, el cuello, las órbitas o fuera de la cabeza. Los autores precisan que este análisis es cualitativo y que no cuantificaron la fracción de masa Grad-CAM que cae dentro del cerebro.
La fusión que gana es la que tiene fuga. En las 63 exploraciones de prueba, la tarea de tres clases da 58,7 % con solo imagen (intervalo de Wilson al 95 %: 46,4 a 70,0), 87,3 % con fusión de puntuaciones cognitivas (76,9 a 93,4) y 73,0 % con fusión de volúmenes (61,0 a 82,4). Los autores tratan explícitamente el 87,3 % como una cota superior debida a la fuga, no como un resultado de imagen.
El resultado principal: el objetivo contrastivo moldea el codificador. Es una comparación controlada. Dos entrenamientos idénticos en arquitectura, datos, partición de sujetos, calendario en dos fases, hiperparámetros y conjunto de prueba. Única diferencia: la tabla con la que la pérdida contrastiva alinea la imagen. En MCI frente a CN, la cabeza solo-imagen — que no recibe ningún dato clínico en la prueba — alcanza el 73,8 % (31/42) cuando el codificador se alineó con volúmenes, y el 52,4 % (22/42) cuando se alineó con puntuaciones cognitivas. Veintiún puntos de diferencia, sin que haya ninguna variable tabular presente en la evaluación. Y el orden se invierte en fusión: la configuración que parece mejor de extremo a extremo es la que aprendió la representación visual más débil.
Recortar al lóbulo temporal medial ayuda. Al restringir la entrada a una caja de 96 × 48 × 64 vóxeles centrada, sujeto a sujeto, en el centroide de ocho estructuras segmentadas (hipocampo, amígdala, corteza entorrinal y parahipocampal, bilateralmente), la exactitud solo-imagen de tres clases sube del 58,7 % al 65,1 % (41/63, IC 52,8 a 75,7), y MCI frente a CN del 73,8 % al 81,0 %. La ganancia es mayor en MCI que en AD frente a CN, coherente con una señal precoz y localizada.
Traducción clínica — y sus límites. De 1.000 personas extraídas de una población artificialmente equilibrada entre las tres categorías, el mejor modelo solo-imagen clasificaría correctamente a unas 651 y erróneamente a 349; el azar acertaría con 333. Pero la cifra no debe sobreinterpretarse: sobre 63 exploraciones el intervalo de confianza cubre unos ±12 puntos, y la mejora del 58,7 al 65,1 % corresponde a cuatro exploraciones. La diferencia de 21 puntos del objetivo contrastivo corresponde a nueve exploraciones, con una prueba z de dos proporciones no apareadas a p ≈ 0,04 en una única ejecución — los propios autores la califican de sugerente, no de establecida.
Lo que está bien
El espectro de fuga es explícito, ordenado y asumido en el protocolo. En lugar de fusionar todo lo que hay en ADNIMERGE y publicar la cifra más alta, los autores ordenan los grupos de variables según su proximidad a la regla de etiquetado, entrenan una ejecución por grupo y declaran de antemano que el grupo cognitivo es una cota superior de control. Es una disciplina metodológica que cuesta apariencia de rendimiento y que debería ser la norma.
La cabeza solo-imagen se reporta junto a la cabeza fusionada. Es el gesto que hace útil el artículo. Sin él, la conclusión habría sido «la fusión cognitiva da 87,3 %, publiquemos»; con él, se ve que esa configuración produjo el codificador más débil. La recomendación que se deriva — reportar siempre la cabeza unimodal bajo cada objetivo — es directamente trasladable a cualquier trabajo de fusión multimodal, y completa lo que ya se sabía sobre los modelos clínicos en los que el texto domina a la imagen.
La autocrítica está cuantificada y colocada antes de la conclusión. Los autores enumeran los protocolos que impiden la comparación con Huang (63 exploraciones a nivel de sujeto frente a 882 cortes, solo ADNI-1 frente a una selección más amplia, un grupo de variables cada vez frente a todos fusionados incluido uno que contiene el diagnóstico de referencia, una ejecución frente a cinco particiones promediadas). Escriben explícitamente que la proximidad de las cifras prueba que su reimplementación funciona, no que sea mejor. También señalan que un codificador 3D probado en preliminar iba unos veinte puntos por delante de su codificador 2D.
Lo que está menos bien
El conjunto de prueba es demasiado pequeño para la conclusión que sostiene — métrica engañosa por tamaño muestral. Sesenta y tres exploraciones, veintiuna por clase, una sola ejecución por configuración. Con intervalos de Wilson de ±12 puntos, casi todas las comparaciones del artículo se solapan. El resultado principal, la diferencia de 21 puntos entre objetivos contrastivos, se sostiene sobre nueve exploraciones y no se ha probado de forma apareada ni repetido con varias semillas aleatorias — los autores lo dicen, lo cual es honesto, pero no cambia el estatus de la prueba.
Ninguna validación externa, una sola cohorte, una sola intensidad de campo — sesgo de población. Todo procede de ADNI-1 a 1,5 teslas. ADNI es una cohorte de investigación, reclutada por voluntariado en un número limitado de centros norteamericanos; nada indica que un codificador ajustado a sus convenciones de adquisición aguantase en una resonancia de 3 T de rutina, en una población no seleccionada o en otro sistema sanitario. La pregunta es la misma que para los modelos de fundación en patología probados bajo perturbación: una cifra interna no dice nada sobre la transportabilidad.
El recorte MTL desplaza la dependencia en lugar de eliminarla, y faltan resultados. La caja anatómica exige una segmentación FastSurfer en inferencia: cualquier error de segmentación se propaga directamente a la posición del recorte, y el pipeline queda dependiente de una herramienta externa costosa en cómputo. Además, los autores escriben que entrenaron variantes axiales y sagitales del recorte pero omiten sus cifras «a la espera de la extracción final de los registros» — una omisión que merece señalarse en un artículo cuyo argumento central es no seleccionar los resultados favorables. Por último, no se menciona ningún repositorio de código ni de pesos.
Lo que cambia
Para la comunidad de investigación, el artículo aporta un protocolo reproducible y barato: ordenar las variables auxiliares en un eje de fuga, entrenar una ejecución por grupo y publicar sistemáticamente el rendimiento unimodal junto al fusionado. La observación de que un objetivo contrastivo con fuga degrada el codificador de imagen — y no solo que infla la puntuación final — es nueva y merece probarse en otros contextos: si se confirma, parte de las ganancias reportadas por la literatura de fusión imagen-tabla mide la facilidad de la tabla, no la calidad del modelo de imagen. La prueba decisiva es sencilla: retomar los benchmarks existentes y publicar la cabeza unimodal.
Para los clínicos, hoy no cambia nada. Una exactitud del 65 % en tres clases sobre 63 exploraciones de una cohorte de investigación no es una herramienta, y los autores no pretenden lo contrario en ningún momento. Lo directamente transferible es una rejilla de lectura: cuando una publicación anuncia que un modelo «multimodal» alcanza el 87 % en el diagnóstico de Alzheimer, la primera pregunta es si el MMSE o la CDR figuran entre las entradas. Si es así, la cifra mide sobre todo la coherencia interna del protocolo de etiquetado.
Para los pacientes y el público, conviene retener algo contraintuitivo. Una IA que dice correctamente nueve de cada diez veces «esta persona tiene Alzheimer» no ha leído necesariamente el cerebro: puede haber leído el resultado del test cognitivo que sirvió para hacer el diagnóstico, lo que no diagnostica nada nuevo. El valor de un modelo de imagen se mide por lo que añade al examen clínico, nunca por su capacidad de reproducirlo.
Para saber más
El artículo: Anatomical Grounding and Leakage-Aware Multimodal Contrastive Learning for Alzheimer's Disease Classification from Structural MRI, Paul-Gabriel Nicolae e Irina Mocanu, departamento de informática de la Universidad Nacional de Ciencia y Tecnología POLITEHNICA de Bucarest, depositado en arXiv el 14 de septiembre de 2026 (arXiv:2609.15888, cs.CV), 13 páginas, DOI 10.48550/arXiv.2609.15888. Preprint no revisado por pares en la fecha de publicación de este decriptaje.
Datos: cohorte ADNI (Alzheimer's Disease Neuroimaging Initiative), colección ADNI-1 Screening 1,5 T y tabla consolidada ADNIMERGE. La recogida y el intercambio de datos ADNI están financiados por los National Institutes of Health (subvención U01 AG024904) y el Department of Defense (W81XWH-12-2-0012). Los experimentos corrieron en el clúster FEP de POLITEHNICA de Bucarest, con un límite de doce horas por tarea que los autores citan como restricción que impidió el entrenamiento longitudinal multifase.
Herramientas: FastSurfer (Henschel y cols., NeuroImage, 2020) para la segmentación y la parcelación DKT; YOLOv8 de Ultralytics, con licencia AGPL-3.0, para la detección y la segmentación de instancias; Grad-CAM (Selvaraju y cols., ICCV 2017) para los mapas de atención; CLIP (Radford y cols., ICML 2021) para el objetivo contrastivo; TabTransformer (Huang y cols., 2020) para la rama tabular. No se indica ningún repositorio de código ni de pesos en el artículo.
Referencias de contexto citadas por los autores: Wen y cols., Medical Image Analysis, 2020, sobre la fuga de datos en la clasificación de Alzheimer con redes convolucionales; Petersen y cols., Neurology, 2010, para los criterios diagnósticos de ADNI; Huang, ICCVW 2023, por el trabajo de fusión contrastiva cuyo protocolo este artículo retoma y corrige; Hager y cols., CVPR 2023, por el aprendizaje contrastivo imagen-tabla.