Dépistage du cancer du poumon : MedGemma affiné face à douze radiologues Lung-RADS, plus constant mais moins sensible
Une équipe de la société française Median Technologies (Valbonne) a comparé MedGemma, le modèle vision-langage médical de Google, à douze radiologues qui classaient en Lung-RADS v2022 les scanners de 481 patients du National Lung Screening Trial, dont 132 cancers confirmés. Utilisé tel quel, le modèle atteint une AUC de 0,70 ; affiné sur 7 585 autres patients NLST, il monte à 0,83, contre 0,90 en moyenne pour les radiologues (0,80 à 0,94 selon le lecteur), mais ne repère alors que 63 % des cancers contre 85 %. Le papier met en avant la constance du modèle face à la variabilité humaine ; c'est une vraie question, mais un modèle constant peut aussi se tromper de façon constante, et tout ici reste interne à une seule base de données vieille de vingt ans.
Le contexte
Le dépistage du cancer du poumon par scanner faible dose réduit la mortalité chez les gros fumeurs : c'est la leçon des essais NLST (États-Unis, 2011) et NELSON (Pays-Bas, 2020). Pour transformer chaque examen en décision, l'American College of Radiology a créé Lung-RADS, une grille qui range chaque scanner en catégories de 1 (rien de suspect) à 4X (très suspect), chacune associée à une conduite à tenir : contrôle à un an, à six mois, à trois mois, ou biopsie. La grille réduit les faux positifs, mais pas le désaccord entre lecteurs : deux radiologues placent régulièrement le même nodule dans deux catégories différentes, donc dans deux parcours différents.
Les modèles d'IA spécialisés — le réseau 3D de Google publié en 2019, Sybil du MIT en 2023 — ont montré de bonnes performances sur NLST. La nouveauté est l'arrivée des foundation models : des modèles généralistes pré-entraînés sur d'immenses corpus, censés s'adapter à de nombreuses tâches. MedGemma, publié par Google en 2025, est un modèle vision-langage (il lit des images et produit du texte) qui accepte des volumes de scanner sous forme de suites de coupes. La question du papier est simple : un tel modèle peut-il faire un classement Lung-RADS, que gagne-t-on à l'affiner, et comment se situe-t-il par rapport à la dispersion des radiologues ?
La méthode
Les données. 481 patients issus d'un sous-ensemble de NLST déjà annoté par la même équipe et publié sur The Cancer Imaging Archive. 132 cancers (27,4 %), confirmés par biopsie dans l'année suivant le scanner, et 349 non-cancers, confirmés par au moins trois ans de suivi sans tumeur. La cohorte est donc enrichie : dans la population NLST, la proportion de cancers est d'environ 4 %, selon les auteurs. Un scanner par patient, en coupes fines (moins de 5 mm), de plusieurs constructeurs.
Les lecteurs. Douze radiologues diplômés, juniors (moins de trois ans d'exercice) et seniors, sans accès à la vérité terrain ni aux données cliniques. Chaque patient a été lu par trois radiologues différents, soit 1 443 lectures ; chaque radiologue a vu environ 120 cas. Point important : aucune imagerie antérieure n'était disponible, alors que Lung-RADS s'appuie beaucoup sur l'évolution d'un nodule dans le temps.
Le modèle natif. MedGemma 1.5 dans sa version à 4 milliards de paramètres, utilisé sans réentraînement (zero-shot). Le scanner est découpé en blocs de 25 coupes consécutives, avec un pas de 5. Pour chaque bloc, un prompt « du global au détail » (coarse-to-fine) demande d'abord une analyse d'ensemble des poumons, puis une description des nodules, puis une catégorie Lung-RADS, lue dans les probabilités que le modèle attribue à chaque catégorie. Le score du patient est le maximum sur tous les blocs, un choix qui favorise la sensibilité.
Le modèle affiné. Le même modèle, adapté par QLoRA : au lieu de réentraîner les 4 milliards de paramètres, on gèle le modèle compressé en 4 bits et on n'apprend que de petites matrices additionnelles. Données d'entraînement : 7 585 autres patients NLST (393 cancers), avec 21 533 nodules annotés à la main. Seuls les blocs contenant un nodule malin sont étiquetés positifs, et une focal loss — une fonction de perte qui donne plus de poids aux exemples difficiles — compense le déséquilibre.
L'évaluation. Radiologues et modèles produisent un score sur la même échelle ordinale de Lung-RADS. On mesure l'AUC (la probabilité qu'un cancer reçoive un score plus élevé qu'un non-cancer ; 0,5 = hasard, 1 = parfait), puis sensibilité et spécificité au point qui maximise l'indice de Youden (sensibilité + spécificité − 1). Les intervalles de confiance viennent de 5 000 rééchantillonnages. L'accord entre radiologues est mesuré par le kappa de Fleiss et le coefficient de corrélation intraclasse (ICC).
Les résultats
Les radiologues ne sont pas d'accord entre eux. Kappa de Fleiss de 0,33, soit un accord « passable » ; ICC de 0,68, fiabilité « modérée ». Les seniors s'accordent mieux (kappa 0,38) que les juniors (0,24). En moyenne, deux lecteurs diffèrent d'un peu moins d'une catégorie.
La discrimination. Radiologues : AUC 0,90 [0,88-0,92], de 0,80 pour le moins bon à 0,94 pour le meilleur. MedGemma natif : 0,70 [0,64-0,75]. MedGemma affiné : 0,83 [0,78-0,87]. Sur les 120 cas environ du radiologue le moins performant, le modèle affiné obtient 0,84 contre 0,80, avec des intervalles très larges (0,76-0,92 et 0,67-0,92) : l'écart n'est pas démontré.
Le point de fonctionnement. Au seuil de Youden, les radiologues ont une sensibilité de 85 % et une spécificité de 90 %. Le modèle affiné : 63 % et 91 %. Le modèle natif : 75 % et 58 %. L'affinage améliore surtout la spécificité.
Traduction clinique. Transposons ces chiffres à 1 000 personnes dépistées avec la prévalence d'environ 4 % citée par les auteurs, soit 40 cancers. Les radiologues en repéreraient environ 34 et en manqueraient 6, avec quelque 96 faux positifs. Le modèle affiné en repérerait 25 et en manquerait 15, avec environ 86 faux positifs. Le modèle natif en repérerait 30 mais déclencherait plus de 400 faux positifs. Ce calcul est optimiste : les seuils ont été choisis sur les données de test elles-mêmes.
Ce qui est bien
Un vrai comparateur humain, avec sa dispersion. Douze radiologues, trois lectures indépendantes par patient, 1 443 lectures au total, en aveugle, avec la grille clinique réellement utilisée. Beaucoup de papiers comparent un modèle à « un radiologue » ou à une moyenne ; ici, on voit l'éventail des performances humaines et l'on peut situer le modèle dedans, ce qui est plus honnête.
Une vérité terrain solide et un échec affiché. Les cancers sont confirmés par biopsie, les non-cancers par trois ans de suivi. Et les auteurs rapportent clairement que MedGemma utilisé tel quel (0,70) n'atteint pas un niveau cliniquement utile : c'est une information précieuse face au discours sur les modèles généralistes qui marcheraient partout sans adaptation.
Des limites reconnues et un code ouvert. Le papier nomme lui-même l'enrichissement de la cohorte, l'absence de validation externe, le risque de surapprentissage sur NLST et l'absence d'ablation. Le code et le protocole sont publiés sur GitHub, et le sous-ensemble annoté est déposé sur The Cancer Imaging Archive.
Ce qui est moins bien
Aucune validation externe, et un risque de fuite non exclu. Le modèle est affiné sur NLST et testé sur NLST : même époque (début des années 2000), mêmes centres, mêmes scanners. Le papier ne précise pas explicitement que les 481 patients de test sont disjoints du jeu d'entraînement de 7 585 patients, et les auteurs écrivent eux-mêmes qu'ils ne peuvent exclure un surapprentissage. C'est la configuration typique du data leakage et du biais de population : une AUC de 0,83 interne à une base ne dit rien de la performance sur un parc de scanners actuel, en Europe ou en Asie.
Un comparateur désavantagé et des métriques qui flattent. Les radiologues lisaient sans examen antérieur, alors que la croissance d'un nodule est centrale dans Lung-RADS : c'est un comparateur biaisé, même s'il l'est pour tous. Surtout, les seuils de Youden sont optimisés sur les données de test, et la prévalence enrichie à 27 % rend l'exactitude trompeuse. La comparaison favorable au « radiologue le moins bon » repose sur environ 120 cas et des intervalles qui se chevauchent largement : c'est une métrique trompeuse si on la lit comme une équivalence. Et 63 % de sensibilité reste loin des 85 % humains.
La constance n'est pas la fiabilité, et les auteurs sont juges et parties. Le modèle donne toujours la même réponse à entrée identique parce que sa température est fixée à zéro : c'est de la répétabilité mécanique, pas de la robustesse. Aucun test n'a été fait avec des variations de prompt, de reconstruction ou de scanner, ce que le papier reconnaît. Un modèle qui manque un cancer sur trois de façon constante n'est pas plus sûr qu'un lecteur variable. Enfin, tous les auteurs sont affiliés à Median Technologies, qui développe les logiciels d'aide au dépistage eyonis ; aucun financement ni conflit d'intérêts n'est détaillé dans le preprint.
Ce que ça change
Pour la communauté de recherche, le papier fournit un repère utile : un foundation model vision-langage de 4 milliards de paramètres, affiné de façon légère, reste nettement en dessous de radiologues sur une tâche de dépistage structurée, et l'écart se voit surtout en sensibilité. La proposition de mesurer la variabilité humaine à côté de la performance est bonne, mais elle appelle l'expérience symétrique : mesurer la variabilité du modèle sous perturbations réalistes, et le comparer aux modèles spécialisés existants (Sybil, réseaux 3D), absents de l'analyse.
Pour les cliniciens, rien ne change aujourd'hui. Un outil qui manquerait 15 cancers sur 40 là où les radiologues en manquent 6 ne peut pas servir de lecteur autonome, ni même de filet de sécurité. L'argument d'un soutien « dans les contextes où l'expertise manque » n'est pas démontré : il faudrait une étude où des radiologues lisent avec et sans l'outil.
Pour les patients et le public, le message est prudent : les grands modèles médicaux polyvalents ne sont pas prêts à interpréter seuls un scanner de dépistage pulmonaire. Le désaccord entre radiologues est réel, et c'est une bonne raison de chercher des outils d'aide ; mais un outil constant et moins sensible n'est pas encore une réponse.
Pour aller plus loin
Le papier : Performance vs Consistency: Evaluating a Foundation Model in Lung-RADS Screening, Benjamin Renoust, Pierre Baudot, Tiffany Foriel, Yousra Haddou, Charles Voyton, Pierre-Henri Siot, Ezequiel Geremia, Danny Francis, Jean-Christophe Brisset, Valérie Bourdès, Sylvain Bodard, Benoit Huet (Median Technologies, Valbonne ; affiliations secondaires : University of Osaka, AP-HP Necker, Memorial Sloan Kettering, Massachusetts General Hospital, Sorbonne Université), arXiv:2609.22281 (cs.CV), déposé le 13 septembre 2026, workshop MICCAI CAPTION 2026, DOI 10.48550/arXiv.2609.22281. Preprint non relu par les pairs.
Le code : EYONIS-AIDS-DS/medgemma-miccai. Le modèle de base : MedGemma (Sellergren et al., 2025, arXiv:2507.05201). La grille : ACR Lung-RADS v2022. Sur le dépistage pulmonaire par scanner faible dose, voir aussi notre décryptage sur la dégradation synthétique des scanners et la radiomique des nodules.