Percival, un modèle vision-langage pour le scanner : ce que change un apprentissage contrastif sur 436 787 examens de la biobanque de Penn Medicine

Une équipe de l'Université de Pennsylvanie a entraîné Percival, un modèle qui apprend à associer des scanners 3D à leurs comptes rendus radiologiques, sur 436 787 examens issus de la biobanque de Penn Medicine. Les représentations apprises prédisent mieux les diagnostics et le pronostic que deux modèles de comparaison entraînés sans texte, mais le gain est inégal : Percival n'est le meilleur des quatre comparateurs que sur 279 des 702 diagnostics testés au scanner thoracique. À lire comme un modèle de recherche prometteur, validé presque uniquement dans un seul système hospitalier.

Le contexte

Un scanner (tomodensitométrie, ou CT) est un volume en trois dimensions d'une quinzaine de millions de points (voxels) une fois normalisé. Les modèles d'IA qui l'analysent sont en général entraînés pour une tâche étroite : détecter un nodule pulmonaire, segmenter le foie, mesurer le calcium coronaire. Chaque tâche demande des annotations d'experts, coûteuses à produire.

Une alternative récente consiste à bâtir un foundation model : un grand modèle entraîné une fois, sans tâche précise, dont les représentations internes servent ensuite de point de départ pour de nombreuses applications. Deux familles existaient pour le scanner. Les modèles « vision seule », comme CT-FM, apprennent à partir des images seules. Les modèles de segmentation multi-organes, comme TotalSegmentator, sont entraînés à délimiter des dizaines de structures anatomiques. Percival explore une troisième voie : utiliser comme supervision gratuite le compte rendu que le radiologue a déjà rédigé pour chaque examen. C'est l'idée du modèle CLIP, transposée à l'imagerie médicale 3D.

La méthode

Percival est un modèle vision-langage (VLM) à deux branches. La branche image est un vision transformer (ViT), une architecture qui découpe l'image en petits blocs et apprend comment ils se relient entre eux. Ici, les blocs sont des cubes de 16 x 16 x 8 voxels (un voxel est le pixel d'un volume 3D), sur des scanners normalisés à 352 x 352 pixels dans le plan et 128 coupes. Trois tailles existent : Tiny (6 millions de paramètres), Small (22 millions) et Base (86 millions). La branche texte est CXR-BERT, un modèle de langage préentraîné sur des textes de radiologie.

L'entraînement est contrastif : pour chaque lot d'examens, le modèle doit rapprocher dans un espace mathématique commun chaque scanner et son propre compte rendu, et éloigner les paires qui ne correspondent pas. Il n'a jamais reçu l'instruction « cherche un cancer du pancréas » ; il doit seulement apprendre ce qui distingue un examen d'un autre, en s'appuyant sur ce que les radiologues ont écrit.

Les données viennent de la Penn Medicine BioBank (PMBB), qui regroupe plusieurs hôpitaux de ce système de soins : 436 787 volumes de 51 966 participants pour l'entraînement, 123 603 volumes de 20 599 participants pour la validation, soit 72 565 participants au total. La séparation semble faite au niveau du participant, ce qui limite la fuite de données entre les deux ensembles. Les examens couvrent plusieurs régions anatomiques, phases d'injection et types de scanners.

Ensuite, le modèle est figé et évalué par sonde linéaire : on entraîne seulement un classifieur très simple par-dessus ses représentations. Si ce classifieur marche bien, c'est que l'information utile était déjà dans les représentations. Les « étiquettes » sont des phecodes, des regroupements de codes diagnostiques du dossier médical électronique : 702 pour le scanner thoracique, 624 pour le scanner abdomen-pelvis.

Les résultats

Métriques ML. Sur le scanner thoracique, l'AUC (probabilité que le modèle classe un cas positif au-dessus d'un cas négatif pris au hasard) moyenne est de 0,84 pour les maladies circulatoires, 0,83 pour les respiratoires et 0,84 pour les néoplasiques, avec des écarts larges d'un diagnostic à l'autre (de 0,65 à 0,98 pour le circulatoire). Quelques exemples : athérosclérose coronarienne 0,85 (contre 0,79 pour TotalSegmentator), cancer du pancréas 0,91 (contre 0,84), insuffisance cardiaque à fraction d'éjection préservée 0,91.

Le comptage par diagnostic est plus instructif que les moyennes. Sur les 702 phecodes thoraciques, Percival fait mieux qu'un simple modèle démographique (âge, sexe) sur 555, mieux que CT-FM sur 512 et mieux que TotalSegmentator sur 315, soit environ 45 %. Il est le meilleur des quatre approches sur 279 diagnostics. Sur l'abdomen-pelvis, les chiffres sont proches : 511 sur 624, 442 et 272, et 230 diagnostics où il arrive premier.

Pour le pronostic (modèles de Cox, qui estiment le risque d'un événement dans le temps), l'indice de concordance (C-index, 0,5 = hasard, 1 = classement parfait des patients selon leur délai d'événement) moyen est de 0,68 au scanner thoracique contre 0,65 pour TotalSegmentator, 0,61 pour CT-FM et 0,61 pour le modèle démographique. Pour l'abdomen-pelvis : 0,70, 0,66, 0,63 et 0,62.

Autres analyses : 1 022 associations significatives après correction de Bonferroni entre représentations et diagnostics (PheWAS, une analyse à l'échelle de tous les diagnostics), et 113 associations avec 39 examens biologiques répliquées dans une seconde cohorte. En revanche, la prédiction directe de valeurs de laboratoire reste faible : R² moyen de 0,04 sur 64 mesures (le R² est la part de variance expliquée), avec des maxima pour l'albumine (0,40) et l'hémoglobine (0,30). Sur une validation externe, le jeu public CT-RATE (1 564 scanners thoraciques, 18 étiquettes), les auteurs rapportent des performances « comparables » à celles d'un modèle entraîné dans ce domaine.

Traduction clinique. Une AUC de 0,84 ne dit rien, seule, du nombre de faux positifs : cela dépend de la fréquence du diagnostic et du seuil choisi. Exemple purement illustratif : pour une maladie présente chez 1 % des patients, un seuil donnant 90 % de sensibilité et 90 % de spécificité signalerait, sur 1 000 patients, 9 des 10 malades, en manquerait 1, et ferait 99 fausses alertes. Les résultats rapportés ici ne fournissent pas ce type de chiffre, ce qui est normal pour un modèle de représentation, mais limite l'interprétation clinique.

Précision de lecture : ces chiffres proviennent de la version préprint (medRxiv, version 5). La version publiée dans npj Digital Medicine le 29 septembre 2026 n'a pas pu être lue en texte intégral pour cette analyse ; des écarts sont possibles.

Ce qui est bien

Une échelle rare en imagerie 3D. Plus de 436 000 scanners appariés à leur compte rendu, dans plusieurs hôpitaux, plusieurs régions anatomiques et protocoles, là où beaucoup de modèles de scanner s'entraînent sur quelques milliers d'examens d'un seul type.

Une évaluation massive et honnête sur le nombre de victoires. Les auteurs testent 702 et 624 diagnostics plutôt que de choisir trois maladies favorables, et le papier permet de voir que le modèle ne gagne pas partout. Les PheWAS sont corrigés pour les comparaisons multiples, et la réplication des associations biologiques dans une seconde cohorte (113 sur 153) est un contrôle utile.

Une ouverture concrète. Le code, les poids des trois tailles, l'entraînement et les classifieurs aval sont publiés sur GitHub et Hugging Face ; une version 2.0 est sortie en mai 2026. Le dépôt prévoit aussi l'évaluation sur CT-RATE, ce qui facilite la reproduction sur des données publiques.

Ce qui est moins bien

Biais de population et validation externe mince. Les données viennent d'un seul système de santé américain, et la seule validation externe rapportée est thoracique (1 564 scanners), alors que les résultats couvrent aussi le scanner abdomen-pelvis et plus de 1 300 diagnostics. Les auteurs relèvent eux-mêmes l'absence de cohortes publiques avec données biologiques et diagnostics longitudinaux. La répartition démographique détaillée et les critères d'exclusion ne figurent pas dans les extraits que nous avons pu consulter.

Shortcut learning et fuite par le langage. Le modèle est entraîné à s'aligner sur le texte des radiologues. Les auteurs reconnaissent qu'on ne peut pas séparer ce qui vient de l'image de ce qui vient du vocabulaire utilisé dans les comptes rendus. Les comptes rendus décrivent surtout des examens normaux, et un compte rendu unique résume parfois plusieurs volumes d'une même visite. S'y ajoutent deux risques : le biais d'événement index (les examens sont prescrits parce qu'un problème est suspecté, donc les diagnostics proches de l'examen sont en partie déjà connus), et des étiquettes issues de codes de dossier et non de diagnostics adjudiqués.

Comparateurs et métriques qui limitent la portée. Les comparateurs sont d'autres paradigmes (vision seule, segmentation), pas d'autres modèles vision-langage pour le scanner ; et le gain pronostique moyen (C-index 0,68 contre 0,65 pour TotalSegmentator) est modeste. Le suivi n'est pas précisé (censure au dernier contact du dossier), aucun rapport de risque n'apparaît, et peu d'intervalles de confiance sont donnés. Dernier point : la licence du code est CC BY-NC 4.0, non commerciale, ce qui interdit un usage en production sans accord séparé. Côté financement : NIH et fondations de Penn Medicine ; un auteur déclare des activités de conseil auprès de laboratoires pharmaceutiques.

Ce que ça change

Pour la communauté de recherche, Percival fournit un point de départ public et documenté pour les modèles de scanner alignés sur le texte, avec un protocole d'évaluation à grande échelle et des classifieurs déjà publiés. Les prochaines études devront tester la transférabilité sur d'autres hôpitaux et confronter Percival à d'autres modèles vision-langage.

Pour les cliniciens, rien ne change aujourd'hui : il s'agit d'un outil de recherche, sans validation prospective ni statut réglementaire. À terme, l'idée d'extraire d'un scanner réalisé pour une autre raison un signal de risque (une lecture dite « opportuniste ») est plausible, mais il faudra démontrer un bénéfice pour le patient, et pas seulement une AUC.

Pour les patients et le public, le message est prudent : un scanner contient plus d'information que ce qu'un compte rendu en retient, et des modèles commencent à l'exploiter. Que cette information améliore la prise en charge reste à démontrer, hôpital par hôpital.

Pour aller plus loin

Le papier (version publiée) : Generalizable CT vision-language modeling for population health and disease risk, Cameron A. Beeche, Joonghyun Kim, Walter R. Witschey et al. (University of Pennsylvania), npj Digital Medicine, 29 septembre 2026, DOI 10.1038/s41746-026-03257-2. Préprint : medRxiv, version 5. Code et poids : github.com/cams2b/percival (CC BY-NC 4.0).

Sur l'alignement contrastif entre deux modalités, voir notre décryptage sur l'ECG et l'IRM cardiaque dans la maladie de Chagas. Sur la fiabilité des encodeurs d'imagerie, voir notre décryptage sur CRS-Bench.