Alzheimer sur IRM : fusionner les scores cognitifs gagne 28 points d'exactitude et dégrade ce que le modèle apprend de l'image
Deux chercheurs de l'Université nationale de science et technologie POLITEHNICA de Bucarest ont entraîné un classifieur d'Alzheimer sur 1 075 IRM T1 de la cohorte ADNI-1, puis lui ont ajouté des variables cliniques par apprentissage contrastif. Fusionner les scores cognitifs — MMSE, CDR-SB, ADAS11, RAVLT — fait passer l'exactitude à trois classes de 58,7 % à 87,3 %, mais ces scores sont précisément ceux qui servent à poser l'étiquette diagnostique dans ADNI : le modèle ne lit pas mieux l'image, il retrouve la règle d'étiquetage. Le résultat vraiment utile est ailleurs : à architecture, découpage des patients et entraînement identiques, l'encodeur aligné sur des volumes anatomiques produit une représentation image qui atteint 73,8 % sur la distinction MCI contre témoins, contre 52,4 % — le hasard — pour l'encodeur aligné sur les scores cognitifs.
Le contexte
La maladie d'Alzheimer se voit sur une IRM structurelle T1 — celle qui montre l'anatomie plutôt que la fonction — sous forme d'atrophie : le tissu cérébral se raréfie, d'abord dans le lobe temporal médial, là où siègent l'hippocampe et le cortex entorhinal. Depuis dix ans, la tâche standard consiste à classer un examen en trois catégories : sujet cognitivement normal (CN), trouble cognitif léger (MCI, le stade prodromal), et Alzheimer constitué (AD). Séparer AD de CN est relativement facile, parce que l'atrophie tardive est visible à l'œil. Séparer MCI de CN est difficile, et c'est précisément la frontière qui compte en clinique, puisque c'est la fenêtre où une intervention pourrait encore servir.
Deux problèmes reviennent dans cette littérature, et ce papier les prend de front. Le premier concerne ce que le modèle regarde : un réseau convolutif qui reçoit une coupe entière n'a aucune raison de se limiter au tissu cérébral, et peut exploiter le contraste du crâne, des orbites ou des bords ventriculaires. C'est un cas classique de shortcut learning — le modèle apprend une corrélation parasite plutôt que la pathologie —, le même mécanisme que celui documenté sur la signature d'origine des jeux de données de mammographie.
Le second concerne ce qu'on donne au modèle. Les grandes cohortes comme ADNI livrent des tables cliniques riches, et les travaux récents de fusion image-tableau rapportent des gains spectaculaires quand on les ajoute à l'IRM. Sauf que plusieurs colonnes de ces tables — le MMSE, le Clinical Dementia Rating — font partie des critères qui ont servi à poser l'étiquette diagnostique dans ADNI. Prédire l'étiquette à partir de ces variables revient en grande partie à redériver la règle qui l'a produite. C'est la fuite d'étiquette (label leakage), un cousin proche de la fuite circulaire déjà rencontrée sur les étiquettes de benchmark produites par un LLM.
La méthode
Les données. 1 075 IRM T1 pondérées, acquises à 1,5 tesla dans la collection ADNI-1 Screening, chez 982 sujets — quelques participants ont eu plusieurs acquisitions de dépistage. La répartition est d'environ 289 CN, 507 MCI, 279 AD. Tous les volumes ont été traités par FastSurfer, la réimplémentation en apprentissage profond de FreeSurfer, qui ramène chaque examen sur une grille de 256³ voxels isotropes de 1 mm et produit une parcellisation corticale DKT avec labels sous-corticaux.
Le découpage. Les auteurs ont découpé au niveau du sujet : aucun patient n'apparaît dans deux ensembles. C'est le point sur lequel Wen et collègues avaient montré, en 2020, que la littérature Alzheimer gonflait ses chiffres en découpant à la coupe plutôt qu'au patient. Le jeu de test est équilibré, 21 examens par classe, soit 63 examens ; les tâches binaires en utilisent 42. Restent environ 862 examens d'entraînement et 150 de validation.
L'encodeur image. Délibérément léger : un ResNet18 préentraîné sur ImageNet, dont seul le dernier bloc résiduel est réajusté, appliqué coupe par coupe (90 coupes axiales, indices 62 à 152, redimensionnées en 224 × 224). Les descripteurs de coupes passent par une seule couche de Transformer à 8 têtes d'attention — un mécanisme qui laisse chaque coupe pondérer l'information des autres — puis une moyenne donne un descripteur de sujet, projeté en un vecteur de 128 dimensions (l'embedding, la représentation numérique compacte de l'examen).
La branche tabulaire et le spectre de fuite. Les variables cliniques viennent de la table consolidée ADNIMERGE (16 421 lignes sujet-visite) et sont rangées en cinq groupes, ordonnés par leur proximité avec l'étiquette : cog (CDR-SB, ADAS11, MMSE, RAVLT immédiat — risque de fuite élevé, ce sont les instruments diagnostiques) ; bio (Aβ, tau, p-tau dans le LCR) ; pet (FDG, AV45) ; vol (hippocampe, cerveau entier, cortex entorhinal, temporal moyen — risque faible, ce sont des corrélats d'atrophie, pas des critères) ; demo (APOE4, âge). Seuls cog et vol sont utilisés : le groupe bio n'est renseigné que pour environ 14 % des lignes, ce qui aurait exigé une imputation massive. Dans cog et vol, moins de 3 % des cellules manquent et sont remplacées par la moyenne d'entraînement.
L'alignement contrastif. Les deux branches sont rapprochées par une perte CLIP symétrique — l'objectif d'apprentissage qui pousse l'embedding image d'un sujet à ressembler à son embedding tabulaire et à se différencier de ceux des autres sujets du lot. Détail méthodologique honnête et rarement rapporté : la perte devait être calculée en précision simple, car en précision mixte elle restait bloquée à sa valeur de hasard. Deux têtes sont entraînées au-dessus : une tête image seule, classifieur linéaire qui ne voit aucune variable clinique à l'inférence, et une tête de fusion sur la concaténation des deux embeddings.
Les résultats
Où regarde le classifieur. Des modèles YOLOv8 entraînés sur les labels dérivés de FastSurfer localisent les structures pertinentes avec une mAP₅₀ d'au moins 0,95 — jusqu'à 0,969 pour la variante moyenne. Comparées à ces détections, les cartes Grad-CAM du classifieur image montrent deux régimes : sur beaucoup de coupes il regarde effectivement les ventricules puis les lobes temporaux ; sur un nombre substantiel d'autres, l'attention tombe sur le crâne, le cou, les orbites, ou hors de la tête. Les auteurs précisent que cette analyse est qualitative et qu'ils n'ont pas quantifié la fraction de masse Grad-CAM tombant dans le cerveau.
La fusion qui gagne est celle qui fuit. Sur les 63 examens de test, la tâche à trois classes donne 58,7 % pour l'image seule (intervalle de confiance de Wilson à 95 % : 46,4 à 70,0), 87,3 % avec fusion des scores cognitifs (76,9 à 93,4) et 73,0 % avec fusion des volumes (61,0 à 82,4). Les auteurs traitent explicitement le 87,3 % comme une borne supérieure due à la fuite, et non comme un résultat d'imagerie.
Le résultat principal : la cible contrastive façonne l'encodeur. C'est une comparaison contrôlée. Deux entraînements identiques en architecture, données, découpage des sujets, calendrier en deux phases, hyperparamètres et jeu de test. Seule différence : la table à laquelle la perte contrastive aligne l'image. Sur MCI contre CN, la tête image seule — qui ne reçoit aucune donnée clinique au moment du test — atteint 73,8 % (31/42) quand l'encodeur a été aligné sur les volumes, et 52,4 % (22/42) quand il a été aligné sur les scores cognitifs. Vingt et un points d'écart, sans qu'aucune variable tabulaire ne soit présente à l'évaluation. Et l'ordre s'inverse en fusion : c'est la configuration qui paraît la meilleure de bout en bout qui a produit la représentation visuelle la plus faible.
Recadrer sur le lobe temporal médial aide. En restreignant l'entrée à une boîte de 96 × 48 × 64 voxels centrée, sujet par sujet, sur le barycentre de huit structures segmentées (hippocampe, amygdale, cortex entorhinal et parahippocampique, bilatéralement), l'exactitude image seule à trois classes passe de 58,7 % à 65,1 % (41/63, IC 52,8 à 75,7), et MCI contre CN de 73,8 % à 81,0 %. Le gain est plus net sur MCI que sur AD contre CN, ce qui est cohérent avec un signal précoce localisé.
Traduction clinique — et ses limites. Sur 1 000 personnes tirées d'une population artificiellement équilibrée entre les trois catégories, le meilleur modèle image seule en classerait environ 651 correctement et 349 à tort ; le tirage au sort en classerait 333 correctement. Mais le chiffre ne doit pas être surinterprété : sur 63 examens, l'intervalle de confiance couvre environ ±12 points, et l'amélioration de 58,7 à 65,1 % correspond à quatre examens. L'écart de 21 points sur la cible contrastive correspond à neuf examens, avec un test z de comparaison de proportions à p ≈ 0,04 sur un seul run — les auteurs le qualifient eux-mêmes de suggestif, pas d'établi.
Ce qui est bien
Le spectre de fuite est explicite, ordonné, et assumé dans le protocole. Plutôt que de fusionner tout ce qui traîne dans ADNIMERGE et de publier le chiffre le plus élevé, les auteurs classent les groupes de variables selon leur proximité avec la règle d'étiquetage, entraînent un run par groupe, et déclarent d'avance que le groupe cognitif est une borne supérieure de contrôle. C'est une discipline méthodologique qui coûte cher en apparence de performance et qui devrait être la norme.
La tête image seule est rapportée à côté de la tête fusionnée. C'est le geste qui rend le papier utile. Sans lui, la conclusion aurait été « la fusion cognitive donne 87,3 %, publions » ; avec lui, on voit que cette configuration a produit l'encodeur le plus faible. La recommandation qui en découle — toujours rapporter l'unimodal sous chaque cible — est directement transposable à n'importe quel travail de fusion multimodale, et complète ce qu'on savait déjà sur les modèles cliniques où le texte domine l'image.
L'auto-critique est chiffrée et placée avant la conclusion. Les auteurs listent les protocoles qui empêchent la comparaison avec Huang (63 examens au niveau sujet contre 882 coupes, ADNI-1 seulement contre une sélection plus large, un groupe de variables à la fois contre tous fusionnés dont un groupe contenant le diagnostic de référence, un run contre cinq découpages moyennés). Ils écrivent explicitement que la proximité des chiffres prouve que leur réimplémentation fonctionne, pas qu'elle fait mieux. Ils signalent aussi qu'un encodeur 3D testé en préliminaire était environ vingt points devant leur encodeur 2D.
Ce qui est moins bien
Le jeu de test est trop petit pour la conclusion qu'il porte — métrique trompeuse par taille d'échantillon. Soixante-trois examens, vingt et un par classe, un seul run par configuration. Avec des intervalles de Wilson de ±12 points, la quasi-totalité des comparaisons du papier se recouvrent. Le résultat principal, l'écart de 21 points entre cibles contrastives, tient sur neuf examens et n'a pas été testé en apparié ni répété sur plusieurs graines aléatoires — les auteurs le disent, ce qui est honnête, mais ne change pas le statut de la preuve.
Aucune validation externe, une seule cohorte, une seule intensité de champ — biais de population. Tout vient d'ADNI-1 à 1,5 tesla. ADNI est une cohorte de recherche, recrutée sur volontariat dans un nombre limité de centres nord-américains ; rien ne dit qu'un encodeur ajusté sur ses conventions d'acquisition tiendrait sur une IRM 3 T de service, sur une population non sélectionnée, ou dans un autre système de santé. La question est la même que pour les modèles de fondation en pathologie testés sous perturbation : un chiffre interne ne dit rien de la transportabilité.
Le recadrage MTL déplace la dépendance plutôt qu'il ne la supprime, et des résultats manquent. La boîte anatomique exige une segmentation FastSurfer à l'inférence : toute erreur de segmentation se propage directement à la position du recadrage, et le pipeline devient dépendant d'un outil externe coûteux en calcul. Par ailleurs, les auteurs écrivent avoir entraîné des variantes axiales et sagittales du recadrage mais omettent leurs chiffres « en attendant l'extraction finale des journaux » — une omission qui, sur un papier dont l'argument central est de ne pas sélectionner les résultats favorables, mérite d'être relevée. Enfin, aucun dépôt de code ni de poids n'est mentionné.
Ce que ça change
Pour la communauté de recherche, le papier fournit un protocole reproductible et peu coûteux : ranger les variables auxiliaires sur un axe de fuite, entraîner un run par groupe, et publier systématiquement la performance unimodale à côté de la performance fusionnée. L'observation qu'une cible contrastive fuitante dégrade l'encodeur image — et pas seulement qu'elle gonfle le score final — est nouvelle et mérite d'être testée ailleurs : si elle se confirme, une partie des gains rapportés par la littérature de fusion image-tableau mesure la facilité de la table, pas la qualité du modèle d'image. Le test décisif est simple à faire : reprendre les benchmarks existants et publier la tête unimodale.
Pour les cliniciens, rien ne change aujourd'hui. Une exactitude de 65 % à trois classes sur 63 examens d'une cohorte de recherche n'est pas un outil, et les auteurs ne le prétendent nulle part. Ce qui est directement transférable, c'est une grille de lecture : quand une publication annonce qu'un modèle « multimodal » atteint 87 % sur le diagnostic d'Alzheimer, la première question est de savoir si le MMSE ou le CDR figurent dans les entrées. Si oui, le chiffre mesure surtout la cohérence interne du protocole d'étiquetage.
Pour les patients et le public, il faut retenir une chose contre-intuitive. Une IA qui dit correctement neuf fois sur dix « cette personne a Alzheimer » n'a pas forcément lu le cerveau : elle peut avoir lu le résultat du test cognitif qui a servi à poser le diagnostic, ce qui ne diagnostique rien de nouveau. La valeur d'un modèle d'imagerie se mesure à ce qu'il ajoute par rapport à l'examen clinique, jamais à sa capacité à le reproduire.
Pour aller plus loin
Le papier : Anatomical Grounding and Leakage-Aware Multimodal Contrastive Learning for Alzheimer's Disease Classification from Structural MRI, Paul-Gabriel Nicolae et Irina Mocanu, département d'informatique de l'Université nationale de science et technologie POLITEHNICA de Bucarest, déposé sur arXiv le 14 septembre 2026 (arXiv:2609.15888, cs.CV), 13 pages, DOI 10.48550/arXiv.2609.15888. Preprint non relu par les pairs à la date de publication de ce décryptage.
Données : cohorte ADNI (Alzheimer's Disease Neuroimaging Initiative), collection ADNI-1 Screening 1,5 T et table consolidée ADNIMERGE. La collecte et le partage des données ADNI sont financés par les National Institutes of Health (subvention U01 AG024904) et le Department of Defense (W81XWH-12-2-0012). Les expériences ont tourné sur le cluster FEP de POLITEHNICA Bucarest, avec une limite de douze heures par tâche que les auteurs citent comme contrainte ayant empêché l'entraînement longitudinal multi-phases.
Outils : FastSurfer (Henschel et coll., NeuroImage, 2020) pour la segmentation et la parcellisation DKT ; YOLOv8 d'Ultralytics, sous licence AGPL-3.0, pour la détection et la segmentation d'instances ; Grad-CAM (Selvaraju et coll., ICCV 2017) pour les cartes d'attention ; CLIP (Radford et coll., ICML 2021) pour l'objectif contrastif ; TabTransformer (Huang et coll., 2020) pour la branche tabulaire. Aucun dépôt de code ni de poids n'est indiqué dans le papier.
Références de contexte citées par les auteurs : Wen et coll., Medical Image Analysis, 2020, sur la fuite de données dans la classification Alzheimer par réseaux convolutifs ; Petersen et coll., Neurology, 2010, pour les critères diagnostiques d'ADNI ; Huang, ICCVW 2023, pour le travail de fusion contrastive dont ce papier reprend et corrige le protocole ; Hager et coll., CVPR 2023, pour l'apprentissage contrastif image-tableau.