Mélange d'experts hiérarchique pour la pneumopathie interstitielle de la sclérodermie : ajouter le dossier patient au scanner fait gagner 0,0104 point d'AUC, avec p = 0,804
Onze auteurs de Northwestern University assemblent un expert d'imagerie gelé — cinq sous-réseaux, un par lobe pulmonaire — et une branche dossier patient découpée en groupes cliniques, reliés par deux étages de portes apprises, pour détecter la pneumopathie interstitielle diffuse chez 597 patients atteints de sclérodermie systémique. L'AUC moyenne atteint 0,8750 contre 0,8646 pour la même architecture privée du dossier patient : un écart de 0,0104 point que les auteurs testent et déclarent non significatif (p = 0,804). Le papier vaut moins pour sa performance que pour ce qu'il rapporte honnêtement et pour ce que révèlent ses portes.
Le contexte
Un mélange d'experts (mixture-of-experts, MoE) est une architecture où plusieurs sous-réseaux spécialisés — les experts — coexistent, et où un petit réseau supplémentaire, la porte (gate), décide pour chaque entrée quelle part de la décision revient à chacun. Les grands modèles de langage l'ont popularisé pour une raison de coût : n'activer que deux experts sur soixante-quatre permet d'avoir beaucoup de paramètres sans payer beaucoup de calcul. En imagerie médicale, l'argument est différent. Ce qu'on cherche n'est pas l'économie de calcul mais la spécialisation par région anatomique, et l'interprétabilité que donnent les poids de porte : savoir quelle partie du poumon, ou quelle famille d'examens, a effectivement porté la décision.
La pneumopathie interstitielle diffuse (PID, interstitial lung disease) désigne un groupe de maladies qui atteignent le tissu de soutien situé entre les alvéoles pulmonaires, l'épaississent et le fibrosent, ce qui gêne le passage de l'oxygène vers le sang. Chez les patients atteints de sclérodermie systémique — maladie auto-immune qui durcit la peau et fibrose les organes internes — la PID est devenue la première cause de décès. Son diagnostic repose sur le scanner thoracique haute résolution, lu région par région : ce qui compte n'est pas la simple présence d'anomalies mais leur distribution, avec une prédominance caractéristique aux bases et sous la plèvre. Or la plupart des réseaux profonds traitent le poumon comme un volume unique, ce qui dilue précisément le signal régional que le radiologue cherche.
La même équipe avait publié en 2025 REN, un MoE imagerie seule structuré par lobe, qui exploitait cette intuition anatomique. Le présent travail y ajoute le dossier patient structuré (electronic health records, EHR) : explorations fonctionnelles respiratoires, auto-anticorps, biologie, constantes. La question posée est celle que pose toute la littérature de fusion multimodale en santé : quand deux sources d'information ont une valeur diagnostique qui varie d'un patient à l'autre, faut-il les concaténer, les faire dialoguer par attention croisée, ou les router explicitement ?
La méthode
La cohorte. Rétrospective, issue du registre de sclérodermie de Northwestern : 597 patients et 1 898 scanners thoraciques longitudinaux acquis entre 2001 et 2023. 489 femmes (81,9 %), âge moyen 63,7 ± 12,7 ans. Sous-types : forme cutanée limitée 47,6 %, forme cutanée diffuse 41,0 %, sclérodermie sans sclérodermie 4,7 %, autres 6,7 %. Une PID est confirmée chez 365 patients (61,1 %), qui forment la classe positive. Étude approuvée par le comité d'éthique de Northwestern avec consentement éclairé.
Le prétraitement. Les volumes sont rééchantillonnés à 1 mm isotrope, segmentés en cinq lobes pulmonaires (supérieur et inférieur gauches, supérieur, moyen et inférieur droits) par LungMask R231, fenêtrés entre −175 et 250 unités Hounsfield, puis redimensionnés en 96 × 96 × 96 voxels.
Les poids de lobes par radiomique. Avant l'entraînement du réseau, les auteurs estiment quelle importance diagnostique accorder à chaque lobe. Pour chaque pli de validation croisée, ils extraient 107 descripteurs PyRadiomics par lobe — mesures de texture, de forme et d'intensité calculées sur l'image — et entraînent un XGBoost par lobe sur la seule partition d'entraînement. L'AUC de validation obtenue est convertie en poids par une transformation affine bornée par le bas : w = 0,1 + (AUC − 0,5) × 3,8 si l'AUC dépasse 0,5, et 0,1 sinon. Ces poids sont recalculés à chaque pli, puis figés pendant tout l'entraînement multimodal.
L'expert imagerie. Cinq experts spécialisés, un par lobe, chacun un SwinUNETR 3D — un transformer à fenêtres glissantes conçu pour les volumes médicaux — appliqué sur le volume masqué par son lobe. Leurs représentations sont agrégées par les poids radiomiques normalisés, puis réduites à un vecteur de 48 dimensions. Cet expert est entraîné seul sur le scanner, puis gelé : pendant la phase multimodale, ses paramètres ne bougent plus.
La branche dossier patient. Pour chaque scanner, chaque variable clinique est appariée à la mesure la plus récente antérieure à la date de l'examen ; à défaut, à la mesure suivante la plus proche dans une fenêtre de rattrapage de 30 jours ; sinon la valeur est mise à zéro après standardisation. La standardisation est ajustée sur la seule partition d'entraînement de chaque pli. Deux configurations sont comparées. La hiérarchie complète découpe 69 variables en sept groupes cliniques : numération formule sanguine (21), explorations fonctionnelles respiratoires (3), chimie sérique (14), marqueurs biologiques et fonctionnels (4), constantes vitales (7), démographie statique (14) et démographie spécifique à la maladie (6). La hiérarchie sélective ne retient que 12 variables en trois groupes : explorations fonctionnelles (CVF, VEMS, DLCO), phénotype de la maladie (sous-types lcSSc, dcSSc, sclérodermie sans sclérodermie, et auto-anticorps Scl-70, anticentromère, ARN polymérase III) et biomarqueurs clés (pic de créatinine, score cutané de Rodnan modifié, peptide natriurétique de type B).
Les deux étages de portes. Chaque groupe passe par son propre petit réseau avec projection résiduelle, produisant un vecteur de 24 dimensions ; une première porte softmax pondère les groupes entre eux et produit la représentation dossier patient en 48 dimensions. Une seconde porte, la porte de modalité, prend en entrée la concaténation des deux représentations et produit deux poids qui somment à un : la représentation finale est leur combinaison convexe, envoyée dans un classifieur binaire léger. L'intérêt de cette structure est théorique autant que pratique : grouper les variables ramène la dimensionnalité des interactions croisées de l'ordre du carré du nombre de variables à l'ordre du nombre de groupes, ce qui contrôle la variance.
Le protocole. AdamW (taux d'apprentissage 4 × 10⁻⁴, décroissance de poids 10⁻⁵), lots de 4, arrêt précoce avec patience 10, pondération inverse de la fréquence des classes. Évaluation par validation croisée à cinq plis au niveau patient : tous les scanners d'un même patient restent dans le même pli. Comparaisons par test t apparié bilatéral sur les AUC de plis, calculées sur des partitions identiques. Implémentation PyTorch et MONAI, GPU A100.
Les résultats
Le classement complet. MoE hiérarchique sélectif 0,8750 ± 0,0443 (IC 95 % [0,820 ; 0,930]) ; REN imagerie seule 0,8646 ± 0,0467 ([0,806 ; 0,923]) ; concaténation suivie d'une régression logistique 0,8595 ± 0,0438 ; MoE hiérarchique complet 0,8496 ± 0,0449 ; concaténation suivie d'un MLP 0,8337 ± 0,0551 ; dossier patient seul en régression logistique 0,8280 ± 0,0517 ; SwinUNETR sur le poumon entier 0,7685 ± 0,0759 ; CNN 0,7584 ± 0,0919 ; Mamba 0,6775 ± 0,0454 ; ViT 0,6535 ± 0,0356. Rappel de lecture : une AUC de 0,875 signifie que si l'on tire au hasard un examen de patient avec PID et un examen de patient sans PID, le modèle range correctement la paire environ 88 fois sur 100, contre 50 fois sur 100 par pur hasard.
Le résultat principal est négatif, et les auteurs l'écrivent. L'écart de 0,0104 point entre le modèle proposé et l'architecture imagerie seule dont il dérive donne t(4) = 0,265, p = 0,804. Les intervalles de confiance se recouvrent sur presque toute leur longueur. Contre SwinUNETR appliqué au poumon entier, en revanche, la différence est nette (p < 0,001), mais c'est une comparaison sans enjeu : elle mesure surtout l'apport du découpage anatomique, déjà acquis dans le travail précédent.
L'ordre des lignes est plus instructif que la ligne du haut. Une régression logistique appliquée aux seules variables du dossier patient, sans aucune image, atteint 0,8280 — l'essentiel du signal. Une concaténation triviale des deux modalités suivie d'une régression logistique atteint 0,8595, soit à 0,0155 point du modèle hiérarchique complet à deux étages de portes. Autrement dit, sur cette cohorte, toute la machinerie de routage achète environ un point et demi de troisième décimale par rapport à l'approche la plus simple qu'on puisse écrire.
Moins de dossier patient vaut mieux que plus. La hiérarchie sélective (12 variables) bat la hiérarchie complète (69 variables) de 0,0254 point. L'analyse des portes propose une explication : dans la configuration complète, le routage se disperse sur sept groupes dont plusieurs sont statiques ou redondants, et la branche dossier finit par dominer l'imagerie aux niveaux de confiance élevés — le régime associé aux prédictions positives surconfiantes. Dans la configuration sélective, le routage se concentre sur les explorations fonctionnelles et l'équilibre entre modalités reste stable (poids moyens : imagerie 0,498 ± 0,122, dossier 0,502 ± 0,122).
Calibration, erreurs et traduction clinique. L'erreur de calibration attendue (ECE) est de 0,131 ± 0,038 et le score de Brier de 0,135 ± 0,037. Sur 960 échantillons de test, 167 sont mal classés (17,4 %), dont 71 — soit 42,5 % des erreurs — avec une confiance supérieure ou égale à 0,8. Les cas mal classés s'appuient moins sur le dossier patient (poids de porte moyen 0,383 contre 0,527 pour les prédictions correctes), et les faux positifs sont surtout portés par l'imagerie. Le papier ne rapporte ni sensibilité ni spécificité, donc aucune traduction clinique fine n'est possible ; ce qu'on peut dériver est brut mais parlant : environ 174 examens mal classés pour 1 000, dont environ 74 avec une confiance élevée. Un système qui se trompe une fois sur six et qui, dans deux erreurs sur cinq, se trompe avec assurance, ne peut pas être placé en aval d'une décision sans relecture.
Stabilité. Chez les 192 patients ayant plus d'un scanner, l'écart-type intra-patient de la probabilité prédite est de 0,0812 ± 0,0964, avec une étendue moyenne de 0,2004 ± 0,2406 : d'un examen à l'autre chez le même patient, la probabilité annoncée peut bouger de vingt points alors que l'étiquette, elle, est fixe. Faire varier la fenêtre de rattrapage temporel entre 0 et 90 jours ne change quasiment rien (AUC de 0,8746 à 0,8750), ce qui écarte au moins une source d'artefact.
Ce qui est bien
La discipline anti-fuite est explicite et complète. Trois endroits où la littérature IA-santé fuit couramment sont bouchés simultanément. Tous les examens d'un même patient restent dans le même pli, ce qui interdit la fuite au niveau patient — le piège classique des cohortes longitudinales, où un modèle peut reconnaître un poumon déjà vu plutôt qu'une maladie. Les poids radiomiques de lobes sont recalculés dans chaque pli sur la seule partition d'entraînement, au lieu d'être estimés une fois sur toute la cohorte. La standardisation des variables cliniques est ajustée sur le train et appliquée telle quelle en validation et en test. Dans un domaine où le data leakage est le premier producteur d'AUC gonflées, c'est le point le plus solide du papier.
Le résultat négatif est testé et publié. La comparaison directe avec l'architecture précédente est faite sur des plis identiques, ce qui est la bonne façon de tester une amélioration incrémentale, et le p = 0,804 figure dans le corps du texte, pas dans une annexe. Beaucoup d'articles se seraient contentés de la colonne « +13,9 % contre SwinUNETR », qui est exacte et sans intérêt. Les auteurs écrivent explicitement que l'amélioration numérique « demande confirmation dans une évaluation plus large ».
La batterie de contrôles dépasse ce qu'on exige. Sensibilité à la fenêtre d'appariement dossier-scanner sur six valeurs, variance intra-patient sur les séries longitudinales, calibration mesurée par deux métriques, analyse d'erreur stratifiée par poids de porte, et une échelle complète de comparateurs de fusion naïfs qui permet au lecteur de situer le gain. S'y ajoute une précaution rare : les auteurs écrivent noir sur blanc que les activations de portes traduisent un comportement de routage et non une importance causale, et qu'un poids élevé n'établit pas l'importance clinique indépendante d'un examen.
Ce qui est moins bien
Le gagnant est choisi dans la validation croisée qui le mesure, et il n'y a aucun comparateur humain. Deux configurations du dossier patient sont évaluées sur les mêmes cinq plis, et c'est la meilleure des deux qui devient « le modèle » — une sélection sur le jeu d'évaluation qui produit mécaniquement une estimation optimiste. Par ailleurs, avec cinq plis, un test t apparié n'a presque aucune puissance : t(4) ne détecte que des écarts importants. Dire « non significatif » est honnête, mais ne pas pouvoir conclure n'est pas conclure à l'absence d'effet — le dispositif ne tranche ni dans un sens ni dans l'autre. Plus fondamental, le comparateur biaisé est ici l'absence de comparateur : le standard de diagnostic d'une PID sclérodermique est la lecture du scanner haute résolution par un radiologue, éventuellement en réunion pluridisciplinaire. Aucune performance humaine n'est rapportée, donc on ignore si 0,875 est bon, médiocre ou trivial dans ce contexte précis.
Métrique trompeuse et mauvaise unité d'analyse. Seule l'AUC est rapportée : ni sensibilité, ni spécificité, ni seuil opérationnel, alors qu'un déploiement dépend entièrement du seuil retenu. La prévalence est de 61,1 % dans ce registre — une population déjà sélectionnée sur la sclérodermie et déjà scanographiée — ce qui n'a rien à voir avec la prévalence à laquelle un tel outil serait utilisé ailleurs, et rend la performance non transposable telle quelle. Surtout, l'unité d'évaluation est l'examen et non le patient : les 1 898 scanners produisent des prédictions dont on a vu qu'elles varient de vingt points au sein d'un même patient dont le statut est pourtant unique et fixe. Les auteurs listent d'ailleurs les critères au niveau patient dans leurs travaux futurs. Enfin, une ECE de 0,131 est décrite comme une « calibration raisonnable » : treize points d'écart moyen entre probabilité annoncée et fréquence observée est une qualification généreuse.
Biais de population, valeurs manquantes indistinguables de la moyenne, et opacité. Centre unique, 81,9 % de femmes, sclérodermie exclusivement : la généralisation à d'autres étiologies de PID — fibrose pulmonaire idiopathique, polyarthrite rhumatoïde, pneumopathie d'hypersensibilité — n'est ni testée ni acquise, et les auteurs le reconnaissent. Aucune validation externe. Le point le plus discret est aussi le plus problématique : les valeurs cliniques manquantes sont mises à zéro après standardisation, sans indicateur de manquant. Dans cet espace, « donnée absente » et « valeur exactement moyenne » sont le même nombre. Or en médecine, l'absence d'une exploration fonctionnelle n'est jamais aléatoire — elle dépend de la sévérité, de l'accès aux soins, de l'année d'inclusion. Le modèle ne peut pas distinguer les deux situations, et le papier signale la limite sans en mesurer l'effet. À quoi s'ajoute qu'aucun lien vers du code ou des poids, aucune déclaration de financement et aucune déclaration de conflits d'intérêts ne figurent dans le préprint ; le registre n'est pas décrit comme accessible.
Ce que ça change
Pour la communauté de recherche. La contribution réutilisable n'est pas le gain, c'est l'échelle de comparateurs. Lue de bas en haut, elle dit trois choses. Un ViT ou un Mamba appliqué au volume pulmonaire entier fait à peine mieux que le hasard sur cette tâche (0,65 et 0,68). Imposer la structure anatomique en lobes vaut environ dix points d'AUC (0,7685 → 0,8646). Et tout l'appareillage multimodal hiérarchique ajoute ensuite un centième de point, non significatif. Le message pour qui conçoit ce type de système est net : le rendement est dans le prior anatomique, pas dans la sophistication de la fusion. Le second enseignement porte sur les portes elles-mêmes — restreindre la branche clinique aux variables mécanistiquement proches fait mieux que lui en donner soixante-neuf, parce qu'une porte non contrainte finit par surpondérer le dossier là où l'imagerie porte l'information.
Pour les cliniciens. Rien ne change aujourd'hui, et il vaut la peine de voir pourquoi la tâche elle-même est discutable. Détecter une PID chez un patient sclérodermique qui a déjà passé un scanner haute résolution et des explorations fonctionnelles n'est pas un problème clinique ouvert : c'est ce que produit la lecture radiologique, et les deux entrées du modèle sont exactement les deux examens déjà réalisés. Le besoin réel porte ailleurs — identifier qui va progresser, à quelle vitesse, et qui bénéficierait d'un traitement antifibrotique précoce. Les auteurs le pointent en travaux futurs. En attendant, la partie transposable est l'analyse de routage : le modèle s'appuie sur l'imagerie pour exclure et sur le dossier pour confirmer, ce qui reproduit la démarche clinique sans qu'on la lui ait imposée.
Pour les patients et le public. Ce travail ne produit aucun outil en évaluation clinique ni réglementaire, et ne concerne pour l'instant qu'une maladie rare dans un seul hôpital américain. Ce qu'il illustre mérite en revanche d'être connu hors du champ technique : dans la littérature IA-santé, l'écart entre « notre modèle obtient la meilleure AUC » et « notre modèle est meilleur » est souvent de l'ordre du bruit statistique, et cette différence ne se voit qu'en lisant le test qui l'accompagne — quand il y en a un. Ici, les auteurs ont fait le test et publié son résultat, qui va contre leur intérêt immédiat. C'est le comportement qu'on devrait attendre par défaut ; il reste assez rare pour mériter d'être signalé.
Pour aller plus loin
Le préprint : Hierarchical MoE for Multi-Modal ILD Diagnosis, arXiv:2608.25261, déposé le 26 août 2026, à paraître dans les actes de l'atelier Machine Learning in Medical Imaging (MLMI 2026) de la conférence MICCAI. L'architecture imagerie seule dont ce travail dérive est décrite dans REN: Anatomically-Informed Mixture-of-Experts for Interstitial Lung Disease Diagnosis (arXiv:2510.04923). La segmentation lobaire utilise LungMask R231, les descripteurs d'image proviennent de PyRadiomics, et l'implémentation repose sur PyTorch et MONAI. Aucun code ni poids n'est publié avec le préprint, et le registre de sclérodermie de Northwestern n'est pas décrit comme accessible.