SAGE, un détecteur de dérive de distribution pour le cancer de la peau : la précision progresse, la couverture s'effondre chez les patients à peau foncée

Une équipe de l'Oregon Health & Science University (OHSU) a construit SAGE, un détecteur qui combine trois signaux d'incertitude pour repérer, avant tout diagnostic, les photos de lésions cutanées trop différentes de celles sur lesquelles un modèle a été entraîné. Testé sur cinq jeux de données couvrant sept pays, SAGE distingue quasi parfaitement les images totalement hors sujet et repère correctement 92 % des dérives mêlant changement de matériel et nouvelles pathologies, et filtrer les images selon son score améliore la précision d'un modèle de diagnostic de malignité en aval. Mais ce filtrage, calibré pour retenir 90 % des cas d'entraînement, ne conserve que 16,4 % des photos de patients à peau foncée — le groupe que l'outil devait précisément mieux protéger.

Le contexte

Les modèles de deep learning pour le diagnostic du cancer de la peau affichent des performances impressionnantes sur des jeux de données de référence comme HAM10000 — des dizaines de milliers de photos dermoscopiques, une technique d'imagerie qui utilise un dermatoscope (une loupe éclairée posée sur la peau) pour mieux visualiser la structure d'une lésion. Le problème, documenté depuis plusieurs années, est que cette performance s'effondre dès que le modèle rencontre des images différentes de celles de son entraînement : une autre caméra, un smartphone au lieu d'un dermatoscope, une population de patients aux teintes de peau plus variées, ou simplement une pathologie absente du jeu d'entraînement initial. Ce phénomène porte un nom en apprentissage automatique : le changement de distribution (distribution shift), ou out-of-distribution (OOD) pour désigner une donnée qui s'écarte de ce que le modèle a appris.

Jusqu'ici, la plupart des outils de détection de ce changement se limitaient à un seul signal — la confiance du modèle sur sa propre prédiction, ou la distance d'une image à son jeu d'entraînement. L'équipe d'OHSU part d'un constat simple : un seul signal capture mal des types de dérive très différents (un nouveau type d'appareil photo n'a rien à voir avec une nouvelle maladie), et propose de les combiner. L'autre angle mort qu'elle documente est démographique : la plupart des jeux de données dermatologiques publics surreprésentent les peaux claires (types de Fitzpatrick I à IV), ce qui expose les patients à peau plus foncée à un double risque — sous-représentation à l'entraînement et, potentiellement, sous-détection des cas problématiques.

La méthode

SAGE (Supervised Autoencoders for Generalization Estimates) repose sur un ResNet-50, une architecture de réseau de neurones convolutif classique en vision par ordinateur, préentraînée sur ImageNet puis réutilisée ici comme encodeur : elle compresse chaque image en un vecteur de 256 nombres qui résume son contenu visuel. Ce vecteur alimente trois modules. Un décodeur tente de reconstruire l'image d'origine à partir du vecteur compressé — plus la reconstruction est mauvaise, plus l'image est probablement inhabituelle. Un classifieur prédit la catégorie diagnostique et fournit un score de confiance. Et une recherche des 20 plus proches voisins dans l'espace compressé mesure si l'image ressemble à des exemples déjà vus à l'entraînement. Les trois signaux — erreur de reconstruction, confiance du classifieur, distance aux voisins — sont convertis en probabilités puis combinés par une moyenne géométrique en un score unique entre 0 et 1 : plus il est élevé, plus l'image s'écarte de la distribution d'entraînement.

Le modèle a été entraîné sur HAM10000 (10 015 images dermoscopiques, Australie et Autriche), puis testé sur quatre bases indépendantes représentant des dérives croissantes : HIBA (Argentine, 1 616 images, mélange dermoscopie et photos de smartphone), UFES (Brésil, 2 255 images, uniquement des photos de smartphone en clinique), DDI (Stanford, États-Unis, 656 images, avec 36 diagnostics absents de HAM10000, dont des cancers rares), et MILK10K (jeu du challenge ISIC 2025, 10 480 images, cinq pays). Un jeu totalement étranger au domaine médical, Caltech-101 (photos d'objets du quotidien), sert de témoin extrême. En aval, les auteurs ont mesuré l'effet d'un filtrage par score SAGE sur un modèle distinct de prédiction de malignité — un Inception v3 préentraîné, qui classe chaque lésion en bénigne ou maligne (carcinome basocellulaire, carcinome épidermoïde ou mélanome).

Les résultats

En détection de dérive, mesurée par l'AUROC (aire sous la courbe qui indique la capacité du score à distinguer une image normale d'une image hors distribution), SAGE atteint 1,00 face à Caltech-101 (des objets n'ont évidemment rien à voir avec une lésion cutanée), 0,92 sur les dérives mixtes combinant changement d'appareil et nouvelles maladies, 0,88 sur le seul changement d'appareil (dermoscope vers smartphone), et 0,81 sur des images pourtant proches de la distribution d'entraînement. Le score médian grimpe logiquement avec l'éloignement : 0,63 sur les données de test HAM10000, 0,74 pour HIBA, 0,79 pour UFES, 0,80 pour MILK10K, jusqu'à 0,96 pour DDI — le jeu le plus éloigné, avec les diagnostics les plus rares.

Traduction clinique : sur les cas de malignité totalement absents de l'entraînement (lymphome T cutané, sarcome de Kaposi, carcinome métastatique), 81 % des faux négatifs du modèle de diagnostic — c'est-à-dire des cancers que le modèle aurait classés à tort comme bénins — sont correctement signalés comme suspects par SAGE et donc écartés d'une décision automatique. Sur 100 cas de ce type qu'un modèle de diagnostic manquerait en le laissant travailler seul, environ 81 seraient rattrapés par le filtre. Mais le filtrage a un coût direct sur la précision globale du modèle de malignité en aval : chez les patients à peau foncée, l'AUROC passe de 0,68 sans filtrage à 0,78 après filtrage — une vraie amélioration — mais seulement 16,4 % des images de ce groupe passent le filtre calibré pour retenir 90 % des cas d'entraînement. Chez les patients à peau claire, l'AUROC passe de 0,75 à 0,77, sans que le taux de couverture correspondant soit rapporté dans l'article.

Le papier documente aussi ce qui fait grimper le score SAGE indépendamment de toute pathologie : présence d'une règle de mesure (+7,2 %), flash de l'appareil photo (+5,8 %), arrière-plan non cutané (+7,4 à +10,5 % selon densité), pilosité (+5,1 %), et la combinaison pilosité + arrière-plan (+11,5 %). L'effet de la règle est plus marqué sur peau foncée (+9,8 %) que sur peau claire (+6,1 %). Après filtrage des images de mauvaise qualité, l'écart de biais entre teintes de peau (mesuré par le delta de Cliff, un indicateur d'écart entre deux distributions) se réduit de −0,434 à −0,206, sans disparaître.

Ce qui est bien

Trois signaux plutôt qu'un, validés sur une gradation contrôlée de dérives. Beaucoup de papiers sur la détection OOD testent un seul type de changement. Ici, les auteurs distinguent explicitement dérive de modalité (dermoscope vs smartphone), dérive de classe (nouvelles maladies) et leur combinaison, et montrent que SAGE reste compétitif dans les quatre configurations — pas seulement sur le cas le plus facile (objets non médicaux).

Une annotation manuelle qui va chercher les causes, pas seulement les symptômes. 4 527 images ont été annotées à la main sur douze critères (pilosité, contraste, flash, règle, arrière-plan, flou) par un observateur en aveugle du diagnostic, de la malignité et du type de peau. C'est ce travail qui permet d'identifier des artefacts photographiques précis comme cause du score élevé, plutôt que de se contenter d'un chiffre agrégé.

Code, poids et données publiés sous licence ouverte. L'ensemble du code et des modèles SAGE entraînés est disponible sur GitHub (github.com/pdxgx/sage) sous licence CC BY 4.0, et toutes les images utilisées sont publiques. C'est une réplication indépendante possible dès aujourd'hui, ce qui reste rare dans ce champ.

Ce qui est moins bien

Un biais de population que le filtrage réduit sans le résoudre — et qui s'aggrave paradoxalement en couverture. Le score SAGE lui-même est structurellement plus élevé sur les peaux foncées à cause d'artefacts corrélés (règle, arrière-plan) plus fréquents dans les jeux de données correspondants. Conséquence directe : au seuil retenu pour préserver 90 % des cas d'entraînement, 83,6 % des images de patients à peau foncée sont écartées du diagnostic automatisé. Le gain d'AUROC (0,68 à 0,78) est réel, mais il concerne une fraction résiduelle très réduite du groupe — l'exemple même de la métrique trompeuse : présenter une amélioration de performance sans donner le même poids au taux de couverture qui l'accompagne masque le fait que l'outil, en pratique, exclut de la décision automatisée la majorité des patients qu'il devait mieux protéger.

Du shortcut learning documenté mais non corrigé à la source. Le modèle réagit à des éléments qui n'ont rien à voir avec la pathologie — une règle, un flash, un fond de pièce — plutôt qu'exclusivement à la lésion elle-même. Les auteurs le nomment et le quantifient précisément, ce qui est à leur crédit, mais la solution proposée (filtrer après coup) traite le symptôme : elle retire les images à risque plutôt que d'empêcher le modèle d'apprendre ces corrélations parasites en amont.

Une seule architecture de diagnostic testée, sur un jeu d'entraînement resté modeste. Le modèle de malignité en aval est un unique Inception v3 publié en 2023 — un comparateur qui n'est plus la référence en 2026. Rien n'indique que les mêmes gains et les mêmes coûts de couverture se reproduiraient avec une architecture plus récente ou un jeu d'entraînement plus large que les 7 207 images utilisées ici. Les auteurs signalent eux-mêmes un risque de fuite de données (data leakage) entre entraînement et test — des lésions différentes du même patient pouvant se retrouver des deux côtés — sans avoir pu l'exclure complètement.

Ce que ça change

Pour la communauté de recherche, SAGE fixe une méthode reproductible pour tester un détecteur de dérive sur une gradation contrôlée de sévérités, et sa force principale — capturer 81 % des faux négatifs sur des cancers rares jamais vus à l'entraînement — mérite d'être reproduite avec d'autres modèles de diagnostic en aval. Le prochain travail nécessaire est déjà indiqué par les auteurs : corriger le biais démographique à l'entraînement plutôt que de le compenser par un filtrage qui exclut disproportionnellement les patients à peau foncée.

Pour les cliniciens, rien ne change dans l'usage immédiat : SAGE est un outil de recherche, pas un dispositif validé pour la pratique. Il illustre cependant un principe transférable à toute IA diagnostique en dermatologie : un score de confiance élevé peut refléter la qualité de la photo (règle, flash, arrière-plan) plutôt que la clarté du diagnostic, et un filtrage de qualité d'image mal calibré peut priver certains patients d'un avis automatisé sans que cela soit visible dans les métriques globales.

Pour les patients et le grand public, l'étude montre concrètement pourquoi une IA de diagnostic cutané entraînée majoritairement sur des peaux claires reste moins fiable, ou moins disponible, pour les autres teintes de peau — un écart qui ne se résout pas seulement en ajoutant un filtre de sécurité en sortie, mais en diversifiant les données à la source dès l'entraînement.

Pour aller plus loin

Le papier : Multi-criterion uncertainty estimation improves skin cancer distribution shift detection and malignancy prediction, W. Max Schreyer, Ravi Samatham, Elizabeth Berry, Reid F. Thompson et al. (Oregon Health & Science University ; VA Portland Healthcare System ; Washington University in St. Louis), npj Digital Medicine, 24 septembre 2026, DOI 10.1038/s41746-026-03293-y. Code et modèles : github.com/pdxgx/sage.

Sur les biais de sous-groupes en imagerie dermatologique, voir aussi notre décryptage sur la prédiction sélective par MC-Dropout sur HAM10000. Sur le sous-typage automatisé des cancers cutanés, voir notre décryptage sur le sous-typage du carcinome basocellulaire sans biopsie.