CRS-Bench : noter les encodeurs medicaux sur quatre axes au lieu de l'AUROC renverse 21 comparaisons sur 105, mais predit moins bien le passage a un autre hopital

Xingtao Lin, Hangqi Ren, Caiwan Sun et You Chen, de Vanderbilt University Medical Center, ont compare quinze familles d'encodeurs d'images pre-entraines sur trois specialites — dermatologie, ophtalmologie, radiologie thoracique — dans 17 575 executions appariees, en notant chacune sur quatre axes plutot que sur la seule AUROC. Leur score composite, la Clinical Reliability Score (CRS), renverse 21 des 105 comparaisons deux a deux que produirait l'AUROC seule, avec un deplacement moyen de 1,87 rang. Mais lorsqu'il s'agit de predire la performance sur un hopital exterieur, ce score composite fait moins bien (rho = 0,529) que l'AUROC brute qu'il entend completer (rho = 0,864) — et ce sont les auteurs eux-memes qui le rapportent.

Le contexte

Un encodeur d'images est la moitie invisible de presque tout systeme d'IA en imagerie medicale : le reseau qui transforme une photo de lesion cutanee, un fond d'oeil ou une radiographie thoracique en un vecteur de quelques centaines de nombres. Le classifieur qui suit — celui qui dit mélanome ou pas mélanome — est souvent trivial en comparaison. Le choix de l'encodeur, lui, est devenu une decision de modelisation a part entiere, parce que l'offre a explose en trois familles. Les generalistes entraines sur des images du web (ResNet-50, ViT-B/16, CLIP, SigLIP, DINOv2, MAE). Les medicaux larges entraines sur des figures d'articles biomedicaux ou des corpus image-texte medicaux (BiomedCLIP, LLaVA-Med, MedSigLIP, MedGemma). Les specialistes entraines exclusivement sur de la peau (PanDerm), de la retine (RETFound) ou du thorax (RAD-DINO, BioViL, CheXzero).

Comment tranche-t-on aujourd'hui ? Dans l'immense majorite des articles, sur une seule ligne de tableau : l'AUROC sur un jeu de test propre. L'AUROC (aire sous la courbe ROC) mesure la probabilite que le modele attribue un score plus eleve a un cas positif qu'a un cas negatif tire au hasard — 1,0 est parfait, 0,5 est le hasard pur. C'est une bonne mesure de tri, et une mesure aveugle a trois choses qui comptent en clinique. La confiance annoncee est-elle honnete ? Combien d'annotations d'expert faut-il pour atteindre ce niveau ? Que devient la performance quand l'image est floue, compressee, ou vient d'un autre hopital ? Le papier part de ce constat et essaie de le transformer en protocole mesurable.

La methode

Les donnees. Quatre jeux publics. CheXpert (191 229 radiographies thoraciques, 14 etiquettes, multi-label) pour la radiologie ; ISIC 2019 (25 331 images dermoscopiques, 8 classes) pour la dermatologie ; APTOS 2019 (3 662 photographies du fond d'oeil, 5 grades ordinaux de retinopathie diabetique) pour l'ophtalmologie. MIMIC-CXR sert de cible de decalage institutionnel : les sondes entrainees sur CheXpert y sont appliquees sans reentrainement, les deux bases partageant les 14 memes etiquettes mais differant par l'etablissement, la population, le protocole et l'etiquetage.

Le protocole. Tous les encodeurs sont geles. On extrait les caracteristiques en une passe, on les standardise avec les statistiques du jeu d'entrainement, puis on entraine dessus une regression logistique regularisee — c'est ce qu'on appelle un linear probing, et l'idee est de mesurer la qualite de la representation, pas celle de l'optimiseur. Deux sondes de controle (un perceptron a deux couches, un k plus proches voisins avec k = 5) verifient que les conclusions ne dependent pas du classifieur. Cinq graines aleatoires partagees, memes decoupages, memes sous-echantillons d'etiquettes, memes graines de perturbation, meme budget d'hyperparametres pour tout le monde. Total : 17 575 executions et 3 515 lignes de metriques agregees par graine, sur 43 des 45 cellules encodeur-jeu de donnees possibles (BioViL et CheXzero n'ont pas de cellule APTOS, leur interface publiee etant specifique au thorax ; les valeurs manquantes ne sont jamais imputees).

Les quatre axes. La discrimination est la macro-AUROC. La calibration est mesuree par l'ECE (expected calibration error, 15 casiers) : l'ecart moyen entre la confiance annoncee par le modele et sa justesse reelle — un ECE de 0,15 signifie qu'en moyenne, quand le modele dit 90 %, il a raison environ 75 % du temps. L'efficacite en supervision est la moyenne du rapport entre l'AUROC obtenue avec 1 %, 5 %, 10 % et 25 % des etiquettes et l'AUROC a etiquetage complet ; c'est donc une mesure de preservation, pas de niveau absolu. La robustesse combine la chute moyenne et la pire chute d'AUROC sous cinq perturbations (flou gaussien, compression JPEG, reduction de contraste, bruit ricien, recadrage du champ de vue) a trois severites, plus, pour CheXpert seulement, la chute reelle observee en passant a MIMIC-CXR.

Le score. La CRS agrege ces quatre axes normalises par des ancrages fixes, avec trois composantes : une dominance de Pareto (combien de pairs du panel l'encodeur domine sur tous les axes a la fois), une proximite au profil ideal, et une performance sur le pire axe, ponderees respectivement 0,60, 0,25 et 0,15. Les auteurs precisent que ces poids sont des parametres de conception explicites, pas des utilites cliniques apprises. Point important : les ancrages etant fixes, l'arrivee d'un nouvel encodeur ne modifie pas les scores deja publies.

Les resultats

La frontiere n'est pas la meme selon la metrique. En AUROC agregee, MedGemma et MedSigLIP mènent (0,909 et 0,908). En CRS agregee, ce sont PanDerm (0,703) et MedSigLIP (0,701) — separes par 0,002, autant dire rien. Sur 10 000 replicats bootstrap apparies par graine, PanDerm et MedSigLIP occupent le rang 1 avec des probabilites de 0,664 et 0,336, et l'intervalle a 95 % de leur difference, [-0,097 ; 0,017], contient zero. Les auteurs refusent donc de designer un vainqueur et parlent d'un palier de tete stable : PanDerm, MedSigLIP, MedGemma, tous trois avec une probabilite de 1,000 d'etre dans le trio de tete, contre exactement zero pour les douze autres.

Le desaccord chiffre entre AUROC et CRS. Sur les quinze encodeurs, tau de Kendall = 0,600, rho de Spearman = 0,811, 21 des 105 choix par paires s'inversent, deplacement absolu moyen de 1,87 rang, recouvrement du top-3 de 0,667. Les mouvements individuels sont parlants : CheXzero passe du 11e au 5e rang, LLaVA-Med du 5e au 11e, PanDerm du 4e au 1er, DINOv2 du 6e au 9e.

La calibration se repare, la discrimination non. Sur six tests principaux, une recalibration a posteriori (temperature, vecteur, isotonique ou Dirichlet, ajustee sur un jeu de calibration reserve) reduit l'ECE de 54 a 77 % — reduction moyenne absolue de 0,067, IC 95 % [0,024 ; 0,110] — sans changer l'AUROC (delta moyen d'environ +0,001). Exemples : DINOv2 sur APTOS passe de 0,150 a 0,034 ; MedSigLIP sur APTOS de 0,121 a 0,028. Traduction pratique : un encodeur qui trie bien mais annonce mal ses probabilites n'est pas un mauvais encodeur, c'est un encodeur qu'on n'a pas encore recalibre, et l'operation coute quelques centaines de cas etiquetes.

La degradation d'image casse la confiance avant de casser le tri. Sous perturbation, l'ECE de LLaVA-Med sur APTOS augmente en moyenne de 0,128, avec un pic a 0,418 ; sur ISIC, MedGemma et MedSigLIP voient leur ECE monter de 0,113 et 0,094 tout en restant de bons discriminateurs. Sur l'ensemble des 43 cellules, perte de discrimination et perte de calibration ne sont que moderement associees (r = 0,63). Autrement dit, une image un peu floue peut laisser le classement des patients quasi intact tout en rendant les probabilites affichees franchement fausses — exactement le mode d'echec le plus dangereux pour un outil d'aide a la decision qui affiche un pourcentage.

Le decalage institutionnel. En passant de CheXpert a MIMIC-CXR sans reentrainement, les encodeurs pre-entraines medicalement conservent une macro-AUROC de 0,717 contre 0,540 pour les generalistes (test de Welch, p = 0,0029). Le chiffre de 0,540 merite d'etre lu litteralement : sur une tache de tri binaire, c'est presque le hasard. Et l'origine medicale ne suffit pas — LLaVA-Med tombe a 0,504.

Deux resultats secondaires utiles. A 1 % d'etiquettes, MedGemma atteint deja 0,884 d'AUROC sur APTOS, et MedSigLIP, MedGemma et PanDerm atteignent 0,819, 0,815 et 0,806 sur ISIC ; sur CheXpert, six encodeurs medicaux egalent ViT-B/16 des 1 % d'etiquettes tandis que MAE et ResNet-50 ne le rattrapent jamais. Et les couches intermediaires battent la couche finale dans 5 sondages de profondeur sur 8 : RAD-DINO gagne 1,3 a 1,6 point d'AUROC autour de 50 % de profondeur, DINOv2 prefere 75 %. Le dernier bloc d'un transformeur n'est donc pas automatiquement la meilleure representation clinique.

Ce qui est bien

L'appariement est serieux, et c'est rare. Memes decoupages, memes sous-echantillons d'etiquettes, memes graines de perturbation derivees d'un hachage SHA-256 de l'identifiant d'image — de sorte que la meme image degradee arrive a chaque encodeur. Meme capacite de sonde, meme budget d'hyperparametres, meme plafond de temps de calcul. La plupart des comparaisons d'encodeurs publiees n'apparient rien de tout cela, et leurs ecarts de 0,01 d'AUROC sont indistinguables du bruit de protocole.

Les auteurs demolissent une de leurs propres metriques candidates. Ils montrent que la mesure d'efficacite en supervision la plus courante, l'aire sous la courbe d'apprentissage (AULC), est essentiellement une reecriture de l'AUROC a etiquetage complet : rho = 0,986 entre encodeurs, 0,977 sur les 43 cellules. Leur mesure de retention relative fait tomber ces correlations a 0,339 et -0,342. C'est de l'auto-critique quantifiee, et cela justifie le choix de formule au lieu de le postuler.

L'invariance de reference est demontree, pas affirmee. Sur 30 essais d'insertion de trois nouveaux encodeurs dans un panel de douze, une renormalisation par cohorte deplace les scores deja publies de 0,053 en moyenne et jusqu'a 0,167 ; la regle a ancrages fixes donne exactement zero deplacement. C'est la difference entre un classement qu'on peut citer dans six mois et un classement qui bouge a chaque nouvelle sortie de modele.

Ce qui est moins bien

La validite externe du score composite est faible — et inferieure a celle de l'AUROC. En retirant MIMIC-CXR du calcul de la CRS puis en essayant de predire l'AUROC obtenue sur MIMIC, la CRS donne rho = 0,529, contre 0,864 pour la seule AUROC CheXpert. En validation croisee par jeu de donnees exclu, rho vaut 0,550 / 0,709 / 0,271 pour ISIC / APTOS / CheXpert, et le vainqueur du jeu exclu n'est retrouve dans aucun pli. Les auteurs sont explicites : la CRS est un resume comparatif de banc d'essai, pas un predicteur d'AUROC sur une tache inconnue. C'est honnete, mais cela relativise fortement l'usage qu'on serait tente d'en faire — choisir un encodeur pour un projet qui n'est aucun des trois testes.

Le classement gele ne survit pas a l'adaptation, alors que personne ne deploie un encodeur gele. Avec un fine-tuning parcimonieux LoRA (rang 8, alpha 16, huit epoques, trois graines), la discrimination progresse partout (+0,026 / +0,030 / +0,010 sur ISIC / APTOS / CheXpert) mais l'ordre change : tau de Kendall de 0,829 / 0,667 / 0,448, et le leader change dans les trois domaines (MedGemma cede a MedSigLIP sur ISIC et APTOS, MedSigLIP cede a RAD-DINO sur CheXpert). Face a la CRS gelee, la comparaison a quatre axes apres adaptation donne tau = 0,562 et un decalage moyen de 2,0 rangs, avec BiomedCLIP qui tombe du 4e au 13e rang. Le trio de tete tient, le milieu du classement se reorganise entierement. On touche ici au comparateur biaise : le protocole mesure un regime (encodeur gele) qui n'est pas celui de la pratique.

Les stress synthetiques ne modelisent ni la population ni la pathologie, et un seul decalage reel est observe. Les auteurs l'ecrivent : les perturbations modelisent l'acquisition et la qualite d'image, pas les changements d'anatomie, de pathologie ou de population. Le seul decalage institutionnel authentique du banc d'essai est CheXpert vers MIMIC-CXR, soit deux hopitaux universitaires americains — ce qui laisse intact le biais de population, particulierement critique sur ISIC 2019, dont la sous-representation des peaux foncees est documentee depuis des annees. Aucune analyse par sous-groupe, aucun choix de point de fonctionnement, aucune interaction humain-machine ne figure au protocole, ce que les auteurs reconnaissent. On ajoutera deux reserves qu'ils ne formulent pas : le bruit ricien est un modele de bruit propre aux images d'IRM en magnitude, et son application a de la dermoscopie, du fond d'oeil et de la radiographie numerique est physiquement discutable ; et l'article ne comporte ni lien vers un depot de code, ni declaration de financement, ni declaration de conflits d'interets, alors qu'il classe des modeles publies par Google (MedSigLIP, MedGemma) et Microsoft (BiomedCLIP, RAD-DINO, BioViL).

Ce que ca change

Pour la communaute de recherche. Le resultat le plus reutilisable n'est pas le classement, c'est la demonstration chiffree que le desaccord entre AUROC et profil multi-axe est structure et non marginal : 21 inversions sur 105, un tau de 0,600. Publier un profil a quatre axes plutot qu'un scalaire devient defendable. Et l'idee d'ancrages fixes — un classement qui ne se renormalise pas a chaque nouveau modele — merite d'etre reprise par les autres bancs d'essai medicaux, ou l'ajout d'un concurrent modifie aujourd'hui les scores de tous les predecesseurs.

Pour les cliniciens et les equipes qui deploient. Deux consequences immediates et peu couteuses. D'abord, si un outil affiche des probabilites, sa calibration doit etre verifiee et, si besoin, reparee sur une cohorte locale : 54 a 77 % de reduction d'ECE sans perte de tri, c'est le meilleur rapport effort-benefice du papier. Ensuite, la degradation de qualite d'image doit etre surveillee pour elle-meme, parce qu'elle peut laisser le classement intact tout en rendant les pourcentages affiches faux — un mode d'echec silencieux qu'aucun tableau de bord base sur l'AUROC ne detectera.

Pour les patients et le public. Rien ne change aujourd'hui : aucun des quinze modeles n'est evalue ici en condition clinique, aucun n'a de statut reglementaire discute dans l'article, et les auteurs excluent explicitement la validation prospective de leur protocole. Ce que le papier apporte au debat public est plus modeste et plus durable : la phrase modele X bat modele Y n'a pas de sens sans preciser sur quel axe, et le pourcentage de confiance affiche par un outil medical est une quantite qui se mesure, se trompe, et se corrige.

Pour aller plus loin

Le preprint : CRS-Bench: A Reference-Relative Reliability Benchmark for Medical Image Encoders, arXiv:2608.22059, depose le 22 aout 2026, licence CC BY 4.0, soumis a WACV 2027. Les jeux de donnees sont tous publics : ISIC 2019, APTOS 2019, CheXpert et MIMIC-CXR. Aucun depot de code n'est indique dans l'article a ce jour.