Sous-typer un carcinome basocellulaire sans biopsie : ce que vaut réellement un AUC de 0,784 en dermatoscopie
Une équipe de l'université Aristote de Thessalonique a entraîné un transformeur de vision pré-entraîné à séparer les carcinomes basocellulaires agressifs des formes moins graves à partir d'une seule image dermatoscopique, sur 1 271 images collectées dans un seul service grec entre 2018 et 2022. Le modèle atteint 0,784 d'AUC contre 0,755 pour un ResNet-50, et 70,0 % de sensibilité à 70 % de spécificité, là où une étude publiée rapportait 56,4 % pour des dermatologues entraînés. Mais le comparateur humain vient d'un autre jeu d'images, le point de fonctionnement a été fixé pour rendre la comparaison possible, aucune validation externe n'a été conduite, et le papier ne dit nulle part combien de patients se cachent derrière ses 1 271 images.
Le contexte
Le carcinome basocellulaire est, de très loin, le cancer le plus fréquent chez l'être humain : les auteurs rappellent qu'il représente près de 80 % des diagnostics de cancer cutané. Il métastase presque jamais, mais il détruit localement, et surtout il n'est pas une entité homogène. L'anatomopathologie en distingue plusieurs sous-types histologiques, et cette distinction commande le traitement. Les formes dites agressives — infiltrante, morphéiforme, micronodulaire, métatypique — s'étendent de manière irrégulière sous la peau, avec des prolongements que l'œil ne voit pas ; elles relèvent de la chirurgie micrographique de Mohs, une exérèse par couches avec contrôle histologique peropératoire des marges, longue et coûteuse. Les formes superficielles, à l'inverse, peuvent souvent être traitées par cryothérapie, imiquimod, photothérapie dynamique ou simple exérèse.
Le problème pratique est que ce tri exige aujourd'hui une biopsie diagnostique préalable : un geste invasif, douloureux, qui coûte de l'argent et du temps, et qui retarde le traitement. D'où la question posée par ce préprint : la dermatoscopie — l'examen de la lésion à travers une loupe éclairée qui neutralise la réflexion de surface de la peau — contient-elle assez d'information pour prédire le sous-type sans passer par le laboratoire ?
La question n'est pas nouvelle côté clinique. La littérature dermatoscopique a décrit des critères associés aux sous-types agressifs, et une étude citée par les auteurs a mesuré ce que des experts humains en tirent : trente lecteurs, avant et après une formation dédiée, classant 235 carcinomes basocellulaires. Leur sensibilité pour repérer les formes agressives passait de 42,3 % à 56,4 % après formation, à spécificité constante autour de 71 %. Autrement dit, même formé, un dermatologue expert manque à l'œil plus de quatre tumeurs agressives sur dix. C'est le seuil bas que ce papier se propose de dépasser — et, selon les auteurs, aucun travail antérieur n'avait combiné dermatoscopie et apprentissage profond sur cette tâche précise de sous-typage.
La méthode
Une tâche binaire, pas un sous-typage. Malgré le titre, le modèle ne prédit pas le sous-type histologique. Les auteurs répartissent leurs lésions en trois familles — superficielle (275 images), non superficielle non agressive (726, essentiellement nodulaire) et agressive (270) — puis fusionnent les deux premières en une classe « risque faible » de 1 001 images. Le modèle répond donc à une seule question : agressif ou non ? C'est défendable cliniquement, puisque c'est cette frontière qui déclenche la chirurgie de Mohs, mais cela change le sens du mot « sous-typage ».
Le modèle. Les auteurs partent de BEiT-Large, un transformeur de vision (vision transformer, ViT) : une architecture qui découpe l'image en petits carrés — ici 16 × 16 pixels sur une entrée de 512 × 512, soit une grille de 32 × 32 jetons — et les traite comme les mots d'une phrase, chaque carré pouvant « regarder » tous les autres. Environ 300 millions de paramètres, 24 couches, 16 têtes d'attention. Les poids de départ proviennent d'un pré-entraînement par modélisation d'image masquée (on cache des morceaux de l'image, le modèle apprend à les reconstituer) sur des images naturelles — le corpus exact n'est jamais nommé dans le papier, ce qui est une omission gênante pour la reproductibilité.
Deux étapes d'adaptation. D'abord une adaptation de domaine : le modèle est réentraîné en entier, pendant 100 époques, sur 53 826 images de l'archive publique ISIC réparties en neuf classes de lésions cutanées (mélanome, nævus, kératose, carcinome épidermoïde…). Ensuite un second réentraînement complet sur les 1 271 images de Thessalonique : 10 époques, taux d'apprentissage de 10⁻⁵ avec décroissance en cosinus, lots de 16, suréchantillonnage de la classe minoritaire pour équilibrer chaque lot, augmentations classiques (retournements, rotations, décalages, variations de luminosité et de contraste). Les comparateurs sont un ResNet-18 et un ResNet-50 entraînés « avec le même dispositif et le même budget de calcul ».
Les données. Un jeu privé, constitué au premier service de dermatologie de l'université Aristote entre janvier 2018 et décembre 2022, sur des patients caucasiens, avec un dermatoscope Dermlite Foto au grossissement ×10. Le sous-type histologique confirmé par biopsie sert d'étalon de référence ; les sous-types mixtes et les exérèses incomplètes sont exclus. Le phototype de Fitzpatrick n'est pas rapporté, l'origine des patients n'est décrite que par le mot « caucasien », et — point sur lequel nous revenons plus bas — le nombre de patients n'est jamais indiqué.
L'évaluation. Validation croisée stratifiée à cinq plis, répétée trois fois, soit quinze découpages ; 20 % du jeu d'entraînement de chaque pli sert de validation, et le point de contrôle est choisi sur l'AUC de validation. Pas de centre externe. Pas d'évaluation prospective. Toutes les données sont rétrospectives.
Les résultats
En métriques d'apprentissage automatique. L'AUC (aire sous la courbe ROC : la probabilité qu'une tumeur agressive tirée au hasard reçoive un score plus élevé qu'une tumeur non agressive tirée au hasard) s'établit à 0,784 ± 0,026 pour BEiT, contre 0,755 ± 0,018 pour le ResNet-50 et 0,735 ± 0,023 pour le ResNet-18. Les ± sont des écarts-types sur les quinze découpages, pas des intervalles de confiance. À un point de fonctionnement fixé arbitrairement à 70 % de spécificité, la sensibilité atteint 70,0 % ± 6,6 pour BEiT, 67,4 % ± 4,3 pour le ResNet-50 et 61,6 % ± 5,8 pour le ResNet-18. Ce sont les seules métriques publiées : ni exactitude, ni F1, ni valeur prédictive positive, ni matrice de confusion, ni résultats par sous-type, ni courbes ROC, ni test statistique.
En traduction clinique. C'est là que le chiffre devient parlant. Dans la composition du jeu de données, 21,2 % des lésions sont agressives. Prenons 1 000 carcinomes basocellulaires avec cette même proportion : 212 agressifs, 788 non agressifs. Au point de fonctionnement retenu, le modèle en signale environ 384 comme suspects. Parmi eux, 148 sont réellement agressifs et 236 ne le sont pas : ces 236 patients seraient orientés vers une chirurgie de Mohs dont ils n'ont pas besoin. Et 64 tumeurs agressives passeraient sous le seuil, donc vers un traitement conservateur inadapté, avec le risque de récidive que cela implique. Une décision sur trois parmi les lésions signalées est correcte ; environ une tumeur agressive sur trois est manquée.
Contre l'humain. Aux mêmes 1 000 lésions, les dermatologues formés de l'étude citée (56,4 % de sensibilité à 70,7 % de spécificité) attraperaient environ 120 tumeurs agressives contre 148 pour le modèle, pour un nombre de faux positifs comparable. L'écart de quatorze points de sensibilité représente donc, dans cette arithmétique, environ 28 tumeurs agressives correctement orientées de plus pour 1 000 lésions. Ce n'est pas rien. Mais, comme on va le voir, ce n'est pas non plus une comparaison.
Ce qui est bien
La question clinique est la bonne, et elle est bien posée. Beaucoup de travaux de dermatologie computationnelle s'acharnent sur la détection — bénin contre malin — alors que cette étape est déjà largement traitée et que le goulot d'étranglement s'est déplacé. Ici, le choix de la frontière « agressif contre non agressif » correspond exactement à une décision thérapeutique réelle et binaire : Mohs ou pas Mohs. Le gain potentiel n'est pas un score, c'est une biopsie évitée et un délai raccourci. Peu de papiers d'imagerie cutanée identifient aussi précisément le moment du parcours de soins où leur modèle s'insérerait.
Le comparateur algorithmique est honnête et les auteurs ne trichent pas sur leur propre performance. Les ResNet-18 et ResNet-50 sont entraînés avec le même dispositif et le même budget de calcul, ce qui rend l'écart de 0,03 d'AUC interprétable. Surtout, les auteurs n'habillent pas 0,784 en réussite : l'abstract parle d'une « investigation préliminaire », la conclusion d'une « exploration initiale de preuve de concept », et les limites — centre unique, population caucasienne, comparaison humaine non contrôlée — sont énoncées en clair plutôt que noyées. Dans un domaine où l'on lit régulièrement des AUC de 0,95 présentées comme prêtes pour la clinique, cette retenue mérite d'être notée.
La contrainte de données est traitée par une méthode adaptée. Avec 270 cas positifs, entraîner un modèle de 300 millions de paramètres devrait être voué à l'échec. L'adaptation de domaine intermédiaire sur les 53 826 images publiques d'ISIC est la bonne réponse méthodologique : on rapproche d'abord le modèle du monde des lésions cutanées, puis on l'affine sur la tâche rare. Le choix d'un transformeur pré-entraîné par modélisation masquée plutôt que d'un CNN entraîné de zéro va dans le même sens, et le fait que l'écart avec les ResNet soit modeste plutôt que spectaculaire est cohérent avec la taille du jeu de données.
Ce qui est moins bien
Le data leakage n'est pas exclu, et il ne peut pas l'être. Le papier ne dit jamais si la validation croisée sépare les plis par patient ou seulement par image. Les mots « patient-level », « lesion-level », « groupe » ou « GroupKFold » n'apparaissent nulle part, la variable de stratification n'est pas nommée, et surtout le nombre de patients n'est pas rapporté — on ne connaît que 1 271 images. Or en dermatoscopie, il est courant qu'une même lésion soit photographiée plusieurs fois, et qu'un même patient porte plusieurs carcinomes basocellulaires, souvent du même sous-type. Si deux images d'une même tumeur tombent de part et d'autre d'un pli, le modèle ne généralise pas, il reconnaît. Ce mode d'échec est celui qui gonfle le plus systématiquement les AUC publiées en imagerie médicale, et rien dans le texte ne permet de le lever.
Les métadonnées manquantes trahissent un assemblage hétérogène. Le tableau démographique contient une anomalie que les auteurs ne commentent pas : dans le groupe agressif, 158 lésions sur 270 (58,5 %) n'ont ni sexe ni localisation anatomique renseignés, contre 32 % dans le groupe superficiel et 25,8 % dans le groupe non superficiel. Le même nombre exact manque pour les deux variables, ce qui suggère un bloc de 158 cas agressifs provenant d'une source de données distincte du reste. Si cette source diffère aussi par l'appareil, le réglage ou la période — et le papier se contredit sur ce point, annonçant un dermatoscope unique en section II puis des « appareils dermatoscopiques différents » en section III —, le modèle peut apprendre une signature d'origine plutôt qu'une morphologie tumorale. La distribution des sites anatomiques pointe dans la même direction : 37,1 % des superficiels sont sur le tronc contre 9,3 % des agressifs, 51,4 % des non superficiels sur la tête et le cou contre 25,1 % des superficiels. Un modèle qui devinerait la région du corps depuis l'image obtiendrait déjà un score honorable sans jamais regarder la tumeur. Aucun audit — classifieur de domaine, carte de saillance, décomposition des erreurs par source — n'est conduit. Nous avions décrit ce mécanisme à propos de la fusion de jeux de données en mammographie, et l'effet des métadonnées manquantes sur les biais cachés à propos de l'audit des sous-groupes en imagerie médicale.
La comparaison à l'humain n'en est pas une, et le papier le dit à moitié. Les 56,4 % de sensibilité des dermatologues proviennent d'une étude distincte, menée sur 235 autres carcinomes basocellulaires, avec trente lecteurs et un protocole différent. Le point de fonctionnement de 70 % de spécificité n'a pas été choisi pour une raison clinique : il a été choisi, les auteurs l'écrivent explicitement dans la légende du tableau, pour permettre la comparaison avec cette étude. On sélectionne donc le seuil qui aligne l'axe des abscisses, puis on annonce l'écart sur l'axe des ordonnées. Les auteurs reconnaissent que « les compositions différentes des jeux de données interdisent des conclusions définitives » — mais la phrase de l'abstract, elle, affirme une performance « supérieure à celle rapportée pour des lecteurs humains ». Ajoutons deux détails : l'introduction donne 71,7 % de spécificité pour les lecteurs avant formation là où le tableau donne 71,1 %, et le co-auteur clinicien signe par ailleurs l'une des références dermatoscopiques que le papier mobilise, sans que ce chevauchement soit déclaré nulle part.
Rien n'est vérifiable, et l'éthique n'est pas documentée. Aucun dépôt de code, aucun poids publié, aucune déclaration de disponibilité des données : le jeu de Thessalonique est privé et rien n'indique qu'il sera diffusé. Il n'existe aucune déclaration de conflits d'intérêts, et surtout aucune mention d'approbation par un comité d'éthique ni de consentement, alors qu'il s'agit d'images cliniques rétrospectives associées à l'âge, au sexe et à la localisation anatomique. Le seul financement déclaré est le compte spécial de recherche de l'université Aristote (référence 90169/2024). Enfin, ce préprint n'a pas été relu par les pairs, et l'absence totale d'ablation — notamment sur l'étape d'adaptation ISIC, dont on ne sait donc pas si elle apporte quoi que ce soit — laisse ouverte la question de savoir d'où vient réellement l'écart de 0,03.
Ce que ça change
Pour la communauté de recherche. Le résultat utile n'est pas 0,784, c'est la cartographie d'un plafond. Un transformeur de 300 millions de paramètres, correctement adapté au domaine, plafonne autour de 0,78 d'AUC sur 1 271 images d'un centre unique — trois centièmes au-dessus d'un ResNet-50, soit à peu près ce qu'on attend d'un changement d'architecture quand les données sont le facteur limitant. Le message, formulé par les auteurs eux-mêmes, est que le verrou est la taille et la diversité du corpus annoté, pas la capacité du modèle. La suite logique n'est donc pas un modèle plus gros mais un jeu multicentrique et multiethnique, avec séparation par patient déclarée, et un protocole de lecture humaine mené sur les mêmes images. Tant que ce dernier point n'est pas fait, l'affirmation « meilleur que les dermatologues » restera invérifiable.
Pour les cliniciens. Rien ne change aujourd'hui. Le taux de faux négatifs — environ une tumeur agressive sur trois manquée — est incompatible avec une décision d'épargner la biopsie, parce que l'erreur n'est pas symétrique : un carcinome infiltrant traité par cryothérapie récidive, parfois des années plus tard, et la reprise est plus mutilante. La seule lecture prudente du résultat serait l'inverse de celle que suggère le titre : non pas « remplacer la biopsie », mais éventuellement prioriser les lésions à biopsier ou à adresser d'emblée en chirurgie micrographique quand l'accès au bloc est contraint. Cette hiérarchisation demande une calibration des probabilités, que le papier ne fournit pas, et une validation sur la population locale, que le papier ne permet pas. La question de la généralisation entre centres en dermatoscopie a été examinée plus finement dans d'autres travaux de validation externe sur le cancer cutané.
Pour les patients et le public. L'intuition à retenir est que la peau noire, brune ou métissée est absente de ce travail : la cohorte est décrite comme exclusivement caucasienne et le phototype n'est même pas rapporté. Un outil de sous-typage entraîné ainsi n'aurait aucune garantie de fonctionner ailleurs, et les carcinomes basocellulaires des phototypes foncés se présentent souvent de manière pigmentée, donc visuellement différente. Plus largement, il faut résister à la lecture que le titre encourage : « sans biopsie » décrit une ambition, pas un résultat. Aujourd'hui, la biopsie reste la seule manière de savoir quel type de carcinome basocellulaire on a, et un score de 0,78 ne s'en approche pas.
Pour aller plus loin
Le préprint : Deep Learning for Biopsy-Free Subtyping of Basal Cell Carcinoma from Dermatoscopic Images, arXiv:2609.07180 [cs.CV], DOI 10.48550/arXiv.2609.07180, déposé le 7 septembre 2026, sous licence CC BY 4.0. Auteurs : Alexandros Papadopoulos, Chrysa Episkopou, Ioannis Sarafis et Anastasios Delopoulos (école de génie électrique et informatique, université Aristote de Thessalonique) et Aimilios Lallas (premier service de dermatologie, université Aristote de Thessalonique). Financement : compte spécial de recherche de l'université Aristote de Thessalonique, référence 90169/2024. Aucune déclaration de conflits d'intérêts ni d'approbation éthique ne figure dans le manuscrit. L'architecture réutilisée est BEiT (Bao et al., arXiv:2106.08254), et le corpus d'adaptation de domaine provient de l'archive ISIC. Le comparateur humain est l'étude de Camela et collègues parue en 2024 dans le Journal of the American Academy of Dermatology, portant sur trente lecteurs et 235 carcinomes basocellulaires ; les critères dermatoscopiques mobilisés renvoient aux travaux de Lallas et collègues de 2014. Sur la place de la chirurgie micrographique dans la prise en charge des sous-types agressifs, les recommandations européennes de l'EADO et les référentiels NCCN sur les cancers cutanés non mélaniques constituent la base à consulter.