Un seul modèle pour tout le PSMA PET/CT : compte rendu, questions-réponses et segmentation — avec des étiquettes d'évaluation écrites par Gemini

Quatorze auteurs, University of Florida en tête, assemblent un seul modèle vision-langage qui rédige le compte rendu d'un PSMA PET/CT, répond à des questions dessus et segmente les lésions, entraîné sur 5 747 examens internes et sur le sous-ensemble PSMA d'AutoPET. Il devance ses comparateurs partout : BLEU 36,2 contre 27,4 pour PET2REP, 83,6 % de bonnes réponses aux questions à choix multiples contre 70,9 %, Dice lésionnel 0,588 contre 0,550 pour nnUNet. Mais les 10 274 questions du jeu de test ont été écrites puis validées par Gemini-2.5-Pro sans qu'aucun humain les relise, aucun médecin nucléaire n'a lu une seule sortie du modèle, et l'ancrage au voxel revendiqué dans le résumé n'est — de l'aveu des auteurs — ni entraîné ni évalué.

Le contexte

Le PSMA PET/CT est devenu en une poignée d'années l'examen pivot du cancer de la prostate. Le sigle désigne le prostate-specific membrane antigen, une protéine massivement surexprimée à la surface des cellules prostatiques cancéreuses. On injecte au patient une molécule qui s'y fixe, marquée par un isotope émetteur de positons — ici le 18F-DCFPyL — et la caméra TEP montre où le traceur s'accumule, pendant que le scanner X (le CT) fournit le repère anatomique. Le résultat est un examen corps entier d'une sensibilité très supérieure à l'imagerie conventionnelle pour le bilan d'extension et la recherche de récidive après traitement.

Cette sensibilité a un coût de lecture. Un examen peut comporter des dizaines de foyers dispersés du bassin au squelette axial, et le médecin nucléaire doit distinguer les lésions des captations physiologiques — le traceur se fixe normalement dans les reins, la vessie, le foie, la rate et les glandes salivaires, parfois avec une intensité supérieure à celle d'une métastase. La lecture prend du temps et sa reproductibilité entre lecteurs n'est pas parfaite.

L'IA appliquée à cette modalité a jusqu'ici progressé par tâches séparées : des modèles de segmentation qui délimitent les lésions — le challenge public AutoPET a structuré ce travail —, des modèles de génération de comptes rendus comme PET2REP, des modèles de questions-réponses visuelles (visual question answering, ou VQA : poser une question en langage naturel sur une image et obtenir une réponse textuelle). Chacun avec ses données, son pipeline, ses métriques. L'argument du papier est d'architecture : un lecteur humain ne sépare pas ces gestes, il décrit ce qu'il voit et pointe ce qu'il décrit. Un modèle unique pourrait donc ancrer son texte dans les voxels qu'il a segmentés. C'est la promesse annoncée ; la suite consiste à regarder si elle est tenue.

La méthode

Les données langage. Une cohorte rétrospective de l'University of Florida : 5 747 examens PSMA PET/CT corps entier réalisés entre 2022 et 2025, tous au 18F-DCFPyL, avec leur compte rendu clinique apparié, converti en JSON structuré (date, section findings, section impression). Approbation de l'IRB avec dérogation au consentement. Le découpage est de 4 023 / 574 / 1 150 examens en entraînement, validation et test — et le papier précise qu'il est fait « at the case level », au niveau de l'examen. Aucune donnée démographique n'est rapportée : pas d'âge, pas de PSA, pas de stade, pas d'indication. Ni critères d'inclusion, ni nombre de patients distincts, ni scanners utilisés.

Les données de segmentation. Le sous-ensemble PSMA du challenge AutoPET : 597 examens chez 378 patients masculins du LMU University Hospital de Munich, acquis entre 2014 et 2022, avec des masques de lésions annotés manuellement en 3D sur les images TEP. Découpage au niveau du patient cette fois : 419 / 59 / 119. Les deux cohortes subissent la même normalisation spatiale — rééchantillonnage à 2,73 × 2,73 × 2,8 mm, matrice fixe de 256 × 256 × 400 voxels, champ de vue arrêté en haut des cuisses, TEP converti en SUV (standardized uptake value, l'unité qui normalise la captation par la dose injectée et le poids du patient).

L'architecture. Le montage suit le schéma LLaVA, devenu le standard des modèles vision-langage. Un encodeur vision 3D (un vision transformer à deux canaux, TEP et CT) est d'abord pré-entraîné par apprentissage contrastif à la manière de CLIP : on apprend au modèle à rapprocher un volume de son compte rendu et à l'éloigner de tous les autres. Un module de projection MLP-Mixer comprime ensuite la séquence visuelle — bien trop longue en 3D pour un modèle de langage — en 512 jetons de dimension 2 048. Ces jetons sont injectés dans un modèle de langage ajusté par LoRA (low-rank adaptation : on gèle les poids d'origine et on n'entraîne que de petites matrices additionnelles, ici de rang 128). Enfin une branche de segmentation 3D de type nnUNet reçoit, via un jeton spécial [SEG] et un mécanisme d'attention croisée emprunté à LISA, l'état interne du modèle de langage — c'est le pont censé relier le texte aux voxels. Une supervision anatomique auxiliaire, dérivée de TotalSegmentator sur dix groupes d'organes (reins, vessie, foie, rate, cerveau, poumons, cœur, prostate, estomac, glandes salivaires), est ajoutée pour apprendre au modèle à ne pas confondre captation physiologique et lésion.

Un point mérite d'être relevé tout de suite : le modèle de langage employé n'est jamais nommé. Ni son éditeur, ni sa taille, ni sa version. La figure d'architecture indique « LLM Backbone » et le texte n'en dit pas davantage.

La construction des questions. C'est le point méthodologique décisif. Le jeu de VQA n'a pas été écrit par des médecins : il a été généré par l'API Gemini-2.5-Pro à partir des comptes rendus dé-identifiés, selon une recette reprise de CT-CHAT. Neuf items par examen — trois de description, trois à choix multiples, trois à réponse libre — sur des thèmes imposés : présence de maladie, distribution, récidive dans le lit prostatique, adénopathies pelviennes et extra-pelviennes, métastases. Une seconde passe demande au même modèle de vérifier que chaque réponse est bien étayée par le rapport, avec identification du passage justificatif ; les items non conformes sont rejetés ou régénérés. Il reste 35 838 questions d'entraînement, 5 166 de validation et 10 274 de test. Aucune relecture humaine n'est rapportée, à aucune étape.

L'entraînement se déroule en quatre étapes : pré-entraînement contrastif de l'encodeur vision ; alignement de la seule couche de projection, vision et langage gelés ; ajustement de la branche vision-langage sur rapport et VQA ; puis réglage multitâche final où texte et segmentation sont optimisés conjointement, avec perte autorégressive d'un côté, entropie croisée plus Dice de l'autre. Le matériel est détaillé (huit GPU NVIDIA B200, PyTorch 2.7) mais aucun hyperparamètre ne l'est : ni taux d'apprentissage, ni taille de lot, ni nombre d'époques, ni pondération entre les tâches. Seul l'optimiseur est donné, AdamW.

Les résultats

Récupération image-texte. L'encodeur pré-entraîné est d'abord évalué seul, sur sa capacité à retrouver le bon compte rendu à partir d'un volume. Sur les 1 150 examens de test, le bon rapport figure dans les 100 premiers résultats dans 35,6 % des cas [IC 95 % : 32,6–38,3], contre 14,2 % pour un CT-CLIP entraîné sur scanner seul et 7,5 % pour un tirage au hasard. L'écart est net et mesuré proprement : le pré-entraînement spécifique TEP/CT apporte quelque chose de réel.

Génération de comptes rendus. Le modèle proposé obtient un ROUGE de 23,4, un BLEU de 36,2, un METEOR de 19,6, un CIDEr de 3,13 et un BERTScore de 86,1. Les comparateurs sont PET2REP (ROUGE 16,7, BLEU 27,4, METEOR 17,0, CIDEr 0,53, BERTScore 84,2) et MedVL-SAM2, une base multimodale qui ne voit que le CT (ROUGE 12,5, BLEU 9,1, CIDEr 0,015). Tous les intervalles de confiance bootstrap sont disjoints. Il faut cependant savoir ce que ces métriques mesurent : BLEU, ROUGE, METEOR et CIDEr comptent des recouvrements de séquences de mots entre le texte produit et le texte de référence. Elles ne disent rien de l'exactitude diagnostique. Un compte rendu qui écrit « pas de lésion osseuse » là où la référence écrit « lésion osseuse » perd deux mots sur cent en BLEU, et un patient en clinique. Aucune métrique d'exactitude factuelle clinique — RadGraph F1, GREEN, RaTEScore, aujourd'hui disponibles pour ce type d'évaluation — n'est rapportée. Le BERTScore n'en est pas une : il mesure une proximité sémantique, pas une vérité.

VQA. Sur les questions à choix multiples, le modèle atteint 83,60 % de bonnes réponses [82,39–84,87] contre 70,89 % [69,29–72,39] pour MedVL-SAM2. Sur les réponses libres, le CIDEr passe de 17,5 à 91,6. Traduction : une question à choix multiples sur six reste fausse, sur un jeu de questions dont la difficulté a été fixée par un autre modèle de langage.

Segmentation. Le Dice — la mesure de recouvrement entre volume prédit et volume annoté — atteint 0,5875 [0,5426–0,6314] pour la variante guidée par le langage, 0,5858 pour la variante sémantique, contre 0,5498 [0,4962–0,6012] pour nnUNet et 0,4653 pour SegAnyPET. Les auteurs ajoutent trois F1 au niveau de la lésion, avec trois critères d'appariement : simple chevauchement (0,736 contre 0,653 pour nnUNet), recouvrement du voxel de SUV maximal (0,727 contre 0,637), et Dice lésionnel supérieur à 0,5 (0,593 contre 0,492).

En termes cliniques. Un F1 lésionnel de 0,736 au critère le plus permissif signifie qu'environ un quart des lésions comptées sont soit manquées, soit inventées. Un Dice de 0,59 signifie que le volume délimité ne recouvre le volume réel qu'à 59 % : pour une simple détection c'est exploitable, pour une dosimétrie de radiothérapie interne vectorisée au lutécium-177, où le volume tumoral conditionne la dose, cela ne l'est pas. Et sur le Dice précisément, l'intervalle de confiance du modèle proposé recouvre largement celui de nnUNet — le gain de 0,038 point n'est pas établi. Aucun test statistique apparié n'est rapporté nulle part dans le papier : la section statistique se limite à des intervalles bootstrap, dont le nombre de rééchantillonnages n'est pas précisé.

Ce qui est bien

Le pré-entraînement contrastif TEP/CT est justifié par une mesure, pas par une intuition. Les auteurs auraient pu se contenter d'affirmer qu'un encodeur spécifique vaut mieux qu'un encodeur CT réutilisé. Ils le démontrent sur une tâche intermédiaire, la récupération image-texte, avec un comparateur pertinent (CT-CLIP) et une borne basse explicite (le hasard). CT-CLIP se révèle à peine au-dessus du hasard en récupération texte vers image, ce qui est en soi un résultat utile pour la communauté : réutiliser un encodeur scanner sur de la médecine nucléaire ne marche pas.

Les métriques de segmentation sont choisies avec honnêteté. Le Dice global est une mauvaise mesure en TEP PSMA, parce qu'il est dominé par les rares grosses lésions et ignore les petits foyers qui font pourtant basculer la stadification. Rapporter trois F1 au niveau de la lésion, dont un critère fondé sur le voxel de SUV maximal, est le bon réflexe. Et les trois critères sont donnés ensemble, y compris le plus sévère, sur lequel l'écart avec nnUNet est le plus large.

La supervision anatomique cible un vrai mode d'échec. L'ajout de dix groupes d'organes issus de TotalSegmentator n'est pas un ornement : la captation physiologique rénale, vésicale et salivaire est la première source de faux positifs en lecture PSMA. Donner au modèle une carte anatomique pour apprendre à les écarter répond à un problème identifié par les cliniciens, pas à un besoin d'architecture. Les auteurs listent par ailleurs leurs limites principales sans les enrober, et déclarent leur financement (NIH R01EB034692 et R01AG078250) et l'absence de conflit d'intérêts.

Ce qui est moins bien

L'évaluation du VQA est circulaire. C'est la limite centrale. Gemini-2.5-Pro écrit les questions à partir des comptes rendus, puis Gemini-2.5-Pro vérifie que ses propres réponses sont étayées par ces mêmes comptes rendus. Les 10 274 questions du jeu de test constituent la vérité terrain, et aucune n'a été relue par un médecin. Ce que mesure le score de 83,6 %, c'est donc l'accord entre un modèle entraîné et un autre modèle jugeant ses propres productions. Il manque en outre le contrôle qui trancherait : aucune référence image-aveugle. Une question à choix multiples dérivée d'un compte rendu est souvent devinable sans l'image, par simple cohérence interne ou par distribution des réponses — c'est un cas manuel de shortcut learning, où le modèle apprend la corrélation parasite plutôt que la tâche. Tant qu'un modèle de langage seul, privé de toute image, n'a pas été passé sur le même jeu, on ne sait pas quelle part des 83,6 % vient de la lecture de la TEP.

Il n'y a aucune validation externe, et le découpage laisse la porte ouverte à une fuite de données. Les trois tâches langage sont entraînées et testées sur la même cohorte, un seul centre, un seul traceur, une seule période. Aucun autre hôpital, aucun autre scanner, aucun essai sur le 68Ga-PSMA-11, pourtant très employé ailleurs dans le monde. Plus préoccupant : le papier indique explicitement un découpage au niveau de l'examen, pas du patient. Or un homme suivi pour cancer prostatique passe typiquement plusieurs PSMA PET/CT — bilan initial, contrôle post-traitement, recherche de récidive. Si le même patient se retrouve des deux côtés de la barrière, c'est du data leakage au sens strict, et les performances rapportées sont optimistes d'une quantité inconnue. Le papier ne donne pas le nombre de patients distincts derrière les 5 747 examens, ce qui empêche même d'estimer l'ampleur du risque. Quant à AutoPET, il est utilisé en entraînement et en test : ce n'est pas une validation externe, c'est une seconde source interne au pipeline. Aucun test croisé — modèle entraîné en Floride, évalué à Munich — n'est tenté.

Aucun humain n'a lu une sortie du modèle, et la promesse d'ancrage n'est pas testée. Pas d'étude de lecteurs, pas d'analyse d'erreurs, pas de comptage des hallucinations : les auteurs renvoient explicitement ce travail au futur. Pour un système dont la sortie principale est un compte rendu destiné à un médecin, c'est l'évaluation qui manque, et elle n'est remplacée par aucune métrique factuelle. Surtout, l'argument qui justifie l'architecture unifiée — le voxel-level grounding annoncé dans le résumé — n'existe pas au sens fort, et les auteurs le reconnaissent : les jeux de données rapport et segmentation ne sont pas appariés au niveau du cas, si bien qu'aucune contrainte n'oblige une lésion segmentée à être mentionnée dans le texte, ni une lésion décrite dans le texte à correspondre à un masque. La thèse du papier est donc affirmée dans le résumé et invalidée dans la discussion.

S'ajoutent des manques de reproductibilité qui ne sont pas des détails : le modèle de langage n'est pas nommé, aucun hyperparamètre d'entraînement n'est donné, et il n'y a aucune étude d'ablation sur une architecture pourtant composée de cinq briques distinctes — impossible de savoir ce qu'apporte le MLP-Mixer, la supervision TotalSegmentator, l'attention croisée ou le rang LoRA. Le code et les poids ne sont pas publiés, malgré une section intitulée « Code availability » qui ne contient que des numéros de version de bibliothèques. Les données internes ne sont accessibles que sur demande au correspondant.

Ce que ça change

Pour la communauté de recherche, le papier a une valeur de cartographie. Il montre qu'un montage LLaVA standard transposé en 3D TEP/CT tient debout et bat des modèles mono-tâches sur leurs propres métriques, et il identifie le verrou avec précision : ce qui manque, ce ne sont pas les architectures, ce sont des jeux de données où le compte rendu et les masques de lésions décrivent les mêmes examens. Tant que ces deux sources restent disjointes, l'ancrage texte-voxel restera une promesse d'illustration. Le second enseignement est négatif et tout aussi utile : la génération de benchmarks VQA par modèle de langage, devenue une pratique courante parce qu'elle est peu coûteuse, produit des scores qu'on ne sait pas interpréter tant qu'on n'y adjoint pas une référence image-aveugle et un échantillon relu par des cliniciens.

Pour les cliniciens, rien ne change aujourd'hui. Pas d'étude de lecteurs, pas de validation externe, pas de code, pas de poids, pas de marquage réglementaire, un seul traceur. Ce qui mérite attention à trois ou cinq ans, c'est la direction : un assistant de lecture auquel on peut poser une question et qui répond en montrant les voxels sur lesquels il s'appuie serait, contrairement à un score de détection opaque, vérifiable au lit du malade. Encore faut-il que l'ancrage soit réellement entraîné — et que quelqu'un ait mesuré combien de fois il se trompe.

Pour les patients et le grand public, la leçon est de vocabulaire. Un titre qui annoncerait que « l'IA lit désormais les TEP de la prostate mieux que les modèles existants » serait littéralement exact et pratiquement trompeur : le modèle bat d'autres modèles sur des métriques de recouvrement de mots et sur des questions écrites par une autre IA, dans un seul hôpital américain. Aucun médecin n'a encore vérifié qu'un seul de ses comptes rendus était juste.

Pour aller plus loin

Le préprint : A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion Segmentation, arXiv:2609.15603, déposé le 14 septembre 2026, licence CC BY 4.0, 24 pages. Auteurs : Yang Xing, Jiong Wu, Savas Ozdemir, Yang Zhou, Boxiao Yu, Ying Zhang, Zheren Zhu, Chenyu You, Wei Shao, Yang Lu, Kang Wang, Tinsu Pan, Yang Yang et Kuang Gong (correspondant), pour l'University of Florida à Gainesville et Jacksonville, l'University of California San Francisco, Stony Brook University et le UT MD Anderson Cancer Center. Financement : NIH R01EB034692 et R01AG078250 ; aucun conflit d'intérêts déclaré. Ni le code ni les poids ne sont publiés ; les données internes sont disponibles sur demande motivée au correspondant. Le jeu de segmentation est public : AutoPET.

Sur les mêmes questions, voir nos décryptages sur la segmentation UNETR du cancer de la prostate en TEP-TDM et la prédiction de survie, sur l'évaluation clinique des comptes rendus générés en pathologie, et sur la circularité des benchmarks dont les étiquettes sont écrites par un modèle de langage.