Segmenter le pancréas indifféremment au scanner et à l'IRM : ce que montre, et ce que ne mesure jamais, l'alignement adversarial de modalités
Une équipe du département de radiologie de Northwestern University, avec deux gastro-entérologues de Northwestern et de la Mayo Clinic de Floride, a entraîné un seul réseau à segmenter le pancréas sur 4 604 examens de scanner et d'IRM confondus, en ajoutant au modèle une contrainte explicite : ne plus pouvoir reconnaître de quelle modalité vient l'image. Le score de recouvrement atteint 87,31 % sur le test interne et reste entre 84,20 et 88,09 % sur quatre jeux de données externes, et les représentations ainsi apprises permettent de découper le pancréas en tête, corps et queue sur des scanners alors qu'aucune annotation de sous-région n'a jamais été vue au scanner. Le problème est ailleurs : les deux tables de résultats du papier ne contiennent que la méthode proposée, sans aucun comparateur chiffré, sans écart-type, sans test statistique — et le résultat présenté comme le plus remarquable repose sur dix-sept examens annotés par un seul lecteur.
Le contexte
Le pancréas est l'organe abdominal que les algorithmes de segmentation ratent le plus. Il est rétropéritonéal, c'est-à-dire plaqué au fond de l'abdomen derrière l'estomac ; sa forme et sa position varient fortement d'une personne à l'autre ; et son contraste avec le duodénum, la rate et les vaisseaux qui l'entourent est faible. Segmenter, ici, veut dire attribuer à chaque voxel — le pixel en trois dimensions d'un examen volumique — une étiquette « pancréas » ou « pas pancréas ». C'est la brique de base de tout le reste : mesurer un volume, suivre un kyste, poser un contour avant une radiothérapie, extraire des descripteurs de texture.
Deux modalités coexistent dans la pratique. Le scanner (CT) reste la référence en oncologie pancréatique. L'IRM monte en charge pour la surveillance des lésions kystiques, notamment les TIPMP, parce qu'elle n'irradie pas et qu'on répète ces examens pendant des années. Les deux images n'ont rien en commun sur le plan des intensités : au scanner, la valeur d'un voxel est une unité Hounsfield physique et reproductible ; en IRM, elle dépend de la séquence, de la machine et du réglage, et n'a pas d'unité absolue.
La réponse habituelle est de faire deux modèles, un par modalité. C'est coûteux en annotation, et cela n'apprend rien de commun sur l'anatomie. Mélanger naïvement les deux jeux fait généralement baisser les performances : le réseau se met à exploiter la signature d'intensité propre à chaque modalité plutôt que la forme de l'organe — un cas d'école de shortcut learning, l'apprentissage d'un raccourci corrélé à la réponse plutôt que de la structure qu'on cherche. La littérature d'adaptation de domaine propose depuis longtemps un remède, l'entraînement adversarial de domaine introduit par Ganin et ses collègues, décliné en imagerie médicale par Kamnitsas sur les lésions cérébrales puis par SIFA sur le transfert scanner-IRM. Les auteurs citent par ailleurs PaNSegNet comme l'état de l'art actuel sur le pancréas en IRM. Retenez ce nom : il ne réapparaîtra plus.
La méthode
Un encodeur partagé, un discriminateur, et une couche qui inverse les gradients. L'ossature est un nnU-Net 3D standard — l'architecture encodeur-décodeur qui reste, en 2026, la référence difficile à battre en segmentation médicale. L'encodeur compresse le volume en une représentation abstraite ; le décodeur la redéploie en masque. Ici, un seul encodeur-décodeur est partagé par les deux modalités, et la fonction de coût de segmentation combine une perte de Dice et une entropie croisée.
La contribution est branchée sur le goulot d'étranglement du réseau, là où la représentation est la plus compacte. Un petit classifieur, le discriminateur de domaine, y est ajouté avec une seule tâche : deviner si l'image est un scanner ou une IRM. Entre l'encodeur et ce discriminateur, les auteurs insèrent une couche d'inversion de gradient — un dispositif qui laisse passer l'information intacte à l'aller, mais retourne le signe du gradient au retour. Conséquence : le discriminateur apprend à distinguer les modalités, pendant que l'encodeur, lui, est poussé à le faire échouer. À l'équilibre, la représentation ne porte plus de signature de modalité. Le coût total pondère les deux objectifs par un facteur lambda, initialisé à 0 et monté progressivement jusqu'à 0,5 ; le calendrier exact de cette montée est qualifié par les auteurs eux-mêmes d'« empirique ».
L'entraînement. Deux étapes : 2 000 époques de segmentation seule sur scanner et IRM mélangés, puis 1 000 époques avec le discriminateur. Patchs de 80 × 160 × 192 voxels, optimiseur Adam à 0,001, normalisation z-score, inférence par fenêtre glissante, sur un serveur à huit A6000. Le nombre de paramètres, l'architecture du discriminateur, la taille de lot et le détail de l'augmentation de données ne sont pas rapportés.
Le transfert de sous-région. C'est la seconde moitié du papier, et l'idée est propre. Une fois l'encodeur entraîné, on le gèle et on branche dessus un nouveau décodeur, entraîné à découper le pancréas en tête, corps et queue — mais uniquement sur des étiquettes d'IRM, celles du jeu Cyst-X, le seul des quatre jeux d'entraînement à fournir ce découpage. Puis on applique le tout à des scanners. Si l'encodeur est réellement indifférent à la modalité, le décodeur entraîné sur IRM devrait fonctionner sur CT. Aucune définition anatomique opérationnelle des trois sous-régions n'est donnée — ni plan de coupe, ni repère vasculaire de type veine mésentérique supérieure.
Les données. 4 604 examens en distribution : 1 461 IRM Cyst-X, 1 888 IRM d'un jeu privé non décrit, 1 000 scanners AbdomenCT-1K, 255 scanners d'un jeu « œdème péri-pancréatique ». Trois séquences IRM sont représentées — T1, T2 et opposition de phase — sans que leur répartition soit chiffrée. Le tout est réparti en 8:1:1 entre entraînement, validation et test, sans que le texte précise si ce découpage est fait au niveau du patient ou de l'examen. S'y ajoutent 440 examens déclarés hors distribution : AMOS en IRM (60) et en CT (300), U-Mamba en IRM (50), BTCV en CT (30). Aucune démographie, aucun critère d'inclusion ou d'exclusion, aucune liste de centres malgré la revendication « multicentrique », aucune information sur le jeu privé qui représente pourtant 41 % du corpus.
Les résultats
Pancréas entier. Sur le test interne, Dice global de 87,31 %, HD95 de 5,23 mm, ASSD de 0,94 mm, IoU de 78,42 %. Par sous-groupe : T1 à 85,59, T2 à 88,27, opposition de phase à 89,76, scanner à 87,53. Sur les quatre jeux externes : AMOS-CT à 84,20, BTCV-CT à 84,58, AMOS-IRM à 86,87, U-Mamba-IRM à 88,09. Le Dice mesure le recouvrement entre le masque prédit et le masque de référence ; le HD95 mesure, en millimètres, l'erreur de contour au 95e centile, c'est-à-dire à quelle distance se trouvent les points les plus faux une fois les cas extrêmes écartés. Les deux ne disent pas la même chose, et le papier en donne un bel exemple : la séquence en opposition de phase a le meilleur Dice de tout le test set (89,76) et le pire HD95 (8,47 mm, près du triple du T2 à 2,92 mm). Un bon recouvrement de volume avec des contours localement très faux — typiquement, un fragment de voisin capturé loin de l'organe.
Sous-régions. En IRM, moyenne de 80,53 % : tête 85,19, corps 80,23, queue 76,18. Au scanner, sans aucune étiquette de sous-région vue à l'entraînement, moyenne de 83,05 % : tête 82,29, corps 83,26, queue 83,61. C'est le résultat que les auteurs présentent comme le plus notable, et il repose sur dix-sept examens — 7 AMOS et 10 BTCV — annotés à la main pour l'occasion par un radiologue expert, seul, sans double lecture ni mesure d'accord inter-observateurs.
Ce que les tables ne contiennent pas. Aucun écart-type, aucun intervalle de confiance, aucun test statistique, nulle part. Et surtout : aucune ligne de comparaison. Pas de nnU-Net sans discriminateur, pas de lambda à zéro, pas de modèle entraîné sur une seule modalité, pas de PaNSegNet. Les tables II et III ne contiennent que la méthode proposée.
Traduction clinique. Un Dice de 76 % sur la queue du pancréas signifie qu'environ un quart du volume délimité est en désaccord avec la référence. Pour une mesure de volume glandulaire en recherche sur le diabète, c'est acceptable ; pour tracer la limite corps-queue qui sépare l'indication d'une duodéno-pancréatectomie céphalique de celle d'une pancréatectomie gauche, c'est très loin d'une marge chirurgicale. Le papier ne prétend d'ailleurs rien de tel : il ne comporte aucun critère de jugement clinique, aucune évaluation par des cliniciens du caractère utilisable des contours, aucune mesure de temps de correction.
Ce qui est bien
L'échelle et l'hétérogénéité sont réelles. 4 604 examens en interne et 440 en externe, deux modalités, trois séquences IRM, quatre jeux externes nommés et accessibles publiquement. Beaucoup de travaux de segmentation pancréatique se contentent encore de quelques centaines de scanners issus d'un centre unique. Ici, la revendication « multicentrique » n'est pas documentée, mais le volume et la diversité de séquences ne se discutent pas.
Le test de transfert de sous-région est honnête dans sa conception. Les auteurs auraient pu se contenter d'une figure qualitative montrant de jolis contours au scanner. Ils sont allés faire annoter dix-sept volumes à la main pour produire un chiffre. L'échantillon est minuscule, mais l'intention méthodologique est la bonne : on ne revendique pas un transfert sans aller le mesurer dans la modalité cible.
Les métriques de distance sont publiées à côté du Dice, et détaillées. HD95, ASSD et IoU figurent séquence par séquence et jeu par jeu, pas seulement en agrégat. C'est ce qui rend visible l'anomalie de l'opposition de phase évoquée plus haut. Publier les chiffres qui contredisent partiellement son propre récit est une qualité, même quand le texte ne les commente pas.
Ce qui est moins bien
La contribution centrale n'est jamais mesurée. C'est la faiblesse dominante, et elle est structurelle. Le papier affirme que l'alignement adversarial produit des représentations indépendantes de la modalité et que c'est ce qui fait la performance. La seule preuve avancée est une projection t-SNE — une visualisation en deux dimensions de l'espace latent — dont les auteurs reconnaissent eux-mêmes qu'elle est « qualitative ». L'ablation existe, mais elle ne porte que sur le réglage fin en aval, ses valeurs ne sont que dans une figure, et sa formulation est déjà une concession : le modèle pré-entraîné « fait mieux ou est comparable » à une ligne de base qui n'est jamais définie dans le texte. « Comparable » n'est pas un résultat. C'est un comparateur absent plutôt que biaisé, ce qui est une variante plus radicale du même défaut. PaNSegNet, désigné état de l'art quelques paragraphes plus haut, est un travail du même laboratoire, sur des données largement recouvrantes : son absence de la table est difficile à expliquer autrement que par le choix de ne pas la faire.
Le risque de fuite de données n'est pas écarté. Le découpage 8:1:1 est annoncé sans un mot sur la stratification par patient. Or Cyst-X fournit T1, T2 et opposition de phase pour les mêmes patients, et la table de résultats rapporte précisément la performance par séquence. Un tirage au niveau de l'examen placerait le T1 d'un patient à l'entraînement et son T2 au test — même anatomie, même kyste, même morphologie glandulaire. C'est le mode d'échec le plus banal de la littérature IA-santé, celui qui fait chuter les scores publiés dès qu'on le contrôle correctement, et c'est aussi celui qu'une phrase de trois mots suffirait à lever. Elle n'y est pas. Un doute voisin plane sur le statut « hors distribution » d'AMOS-CT et de BTCV : AbdomenCT-1K, utilisé à l'entraînement, est par construction une agrégation de jeux de scanners abdominaux publics, et aucune procédure de déduplication n'est décrite. Le même mécanisme de signature d'origine des jeux de données a déjà été documenté en mammographie.
Le résultat phare compare deux populations, pas deux modalités. Le scanner fait mieux que l'IRM sur les sous-régions — 83,05 contre 80,53 — alors qu'il n'a vu aucune étiquette de sous-région. Les auteurs ne commentent pas cette inversion. Une explication simple est disponible et n'est pas discutée : le test IRM vient de Cyst-X, une cohorte constituée pour l'étude des lésions kystiques, donc des pancréas pathologiques et déformés ; le test scanner vient d'AMOS et de BTCV, des jeux de segmentation d'organes abdominaux majoritairement normaux. L'écart mesure donc autant la difficulté des cas que la capacité du modèle : c'est un biais de population doublé d'une métrique trompeuse. La même critique vaut pour le chiffre de 87,31 % mis en avant dans le résumé : il agrège 3 349 IRM et 1 255 scanners sans pondération explicite, et reflète donc surtout la performance en IRM. À quoi s'ajoute l'absence totale de caractérisation des cohortes — pas d'âge, pas de sexe, pas de statut pathologique, rien sur les 1 888 IRM privées — qui rend toute analyse de sous-groupe impossible, y compris par proxy.
Ce que ça change
Pour la communauté de recherche, l'idée vaut d'être reprise, indépendamment de la manière dont elle est ici démontrée. Un encodeur indifférent à la modalité est un objet réutilisable : il transforme un stock d'annotations disponibles dans une modalité en supervision exploitable dans l'autre, et l'annotation de sous-régions pancréatiques au scanner est exactement le genre de travail que personne ne veut faire deux fois. Mais la question à laquelle ce papier ne répond pas est la seule qui décide de la reprise : est-ce que l'alignement adversarial apporte quelque chose qu'un nnU-Net entraîné sur les deux modalités mélangées n'apporte pas déjà ? Une seule ligne supplémentaire dans la table II y répondrait. Tant qu'elle manque, le lecteur ne peut pas distinguer l'effet de la méthode de l'effet des 4 604 examens.
Pour les cliniciens, rien aujourd'hui. Le code et les poids sont annoncés « à l'acceptation », c'est-à-dire indisponibles, et le préprint lui-même est sous licence CC BY-NC-ND, qui interdit les dérivés et l'usage commercial. Il n'y a ni validation prospective, ni lecture par des radiologues des contours produits, ni mesure du temps qu'il faudrait pour les corriger. La question de fond — un contour automatique est-il assez bon pour qu'un opérateur gagne du temps plutôt qu'en perdre — n'est pas posée, alors qu'elle est le vrai critère d'adoption et qu'on sait la mesurer, comme l'ont fait d'autres travaux sur la charge de travail de l'opérateur.
Pour les patients et le public, une distinction utile : segmenter n'est pas diagnostiquer. Un Dice de 87 % ne veut pas dire « 87 % de diagnostics justes », il veut dire que le contour tracé par la machine recouvre à 87 % celui tracé par un humain. C'est de la plomberie, indispensable et invisible, en amont de tout le reste. La question intéressante, pour un patient suivi pour un kyste du pancréas, n'est pas le Dice du modèle mais de savoir si le volume mesuré cette année est comparable à celui mesuré l'an dernier sur une autre machine — une question de reproductibilité que ce papier rend plausible sans la mesurer.
Pour aller plus loin
Le préprint : Unified CT and MRI Pancreas Segmentation for Label-Efficient Cross-Modality Subregion Transfer, arXiv:2609.13043, déposé le 11 septembre 2026 en cs.CV, DOI 10.48550/arXiv.2609.13043, sous licence CC BY-NC-ND 4.0. Auteurs : Ziliang Hong, Hongyi Pan, Halil Ertugrul Aktas, Andrea Bejar, Elif Keles, Frank H. Miller, Michael B. Wallace, Rajesh N. Keswani, Gorkem Durak et Ulas Bagci, département de radiologie de Northwestern University, avec la division de gastro-entérologie et hépatologie de Northwestern et celle de la Mayo Clinic de Floride.
Code et poids : annoncés comme publiés « à l'acceptation », donc indisponibles à ce jour ; aucun dépôt n'est indiqué. Jeux de données publics utilisés : AbdomenCT-1K, AMOS, BTCV, U-Mamba. Les modalités d'accès à Cyst-X et au jeu « œdème péri-pancréatique » ne sont pas précisées dans ce manuscrit, et le jeu privé de 1 888 IRM n'est pas partagé. Aucune mention d'approbation d'un comité d'éthique ne figure au texte.
Financements déclarés : subventions NIH U01-CA268808 et NHLBI R01-HL171376. Aucune déclaration de conflits d'intérêts ne figure au manuscrit, alors que deux des auteurs sont gastro-entérologues cliniciens en exercice.
Sur le même terrain, les travaux cités comme antécédents : DANN de Ganin et collègues pour l'inversion de gradient, SIFA de Chen et collègues pour l'adaptation scanner-IRM, nnU-Net d'Isensee et collègues pour l'ossature, et PaNSegNet du même groupe pour l'état de l'art en IRM pancréatique.