Sinus maxillaire au CBCT : quand le texte et l’étiquette viennent du même LLM, l’AUC passe de 1,00 à 0,84
Trois chercheurs de Queen Mary University of London et de King Abdulaziz University comparent, sur les mêmes 300 coupes de scanner dentaire, huit réseaux de vision, sept modèles de langage et cinq modèles vision-langage, pour une tâche binaire : ce sinus maxillaire est-il normal ou pathologique ? Les modèles de langage atteignent une AUC de 0,99 à 1,00 — jusqu’à ce qu’un radiologue relise les 297 cas, en reclasse 62 (21 %), et fasse retomber ces mêmes modèles à 0,84–0,85, tandis que les réseaux de vision, eux, ne bougent pas. Le papier est construit pour produire exactement cette démonstration : quand le texte d’entraînement et l’étiquette proviennent du même modèle de langage, la performance mesure la cohérence d’une machine avec elle-même, pas un contenu diagnostique.
Le contexte
Le CBCT (cone-beam computed tomography, tomographie volumique à faisceau conique) est le scanner de routine du cabinet dentaire : une acquisition 3D à dose réduite, utilisée pour planifier un implant, préparer un traitement endodontique ou une chirurgie maxillo-faciale. Son champ de vue capte presque toujours les sinus maxillaires, ces cavités aériennes situées au-dessus des molaires supérieures. On y découvre donc régulièrement des anomalies que personne ne cherchait : épaississement muqueux, pseudokyste de rétention, opacification partielle, niveau hydro-aérique. Ces trouvailles fortuites ne sont pas anodines — elles pèsent sur la décision de poser un implant postérieur ou de réaliser un comblement de sinus. Mais leur signalement dépend entièrement de l’opérateur, et prend du temps.
D’où l’idée d’automatiser. Jusqu’ici, la littérature sur le CBCT dentaire a surtout évalué des réseaux convolutionnels mono-modalité. Les auteurs — Seba Al-Hebshi, Hanadi Khalifa et Tuan D. Pham — annoncent avoir cherché dans PubMed de janvier 2015 à juillet 2026 et n’avoir trouvé aucune étude comparant sur un même jeu de données, sous validation croisée identique, les trois familles : image seule, texte seul, et vision-langage.
Mais l’intérêt réel de ce préprint est ailleurs, et il dépasse largement le sinus maxillaire. Une pratique s’installe rapidement dans la recherche IA-santé : faire produire par un grand modèle de langage les descriptions textuelles — et parfois les étiquettes — dont on a besoin pour entraîner d’autres modèles, faute d’annotations humaines en quantité suffisante. Ce papier construit un protocole pour mesurer ce que cette pratique coûte. La réponse est chiffrée, et elle est brutale.
La méthode
Les données. Le jeu de données est MMDental, publié dans Scientific Data en 2025, librement accessible sur Figshare sous licence CC-BY. Les auteurs en extraient 300 coupes sagittales médianes — une seule image 2D par cas, pas de volume 3D. La source est un hôpital unique en Chine (approbation éthique du comité de l’université de Lishui, n° 2022YR014). Le nombre de patients n’est jamais donné : les cas sont désignés par des identifiants d’image. La tâche est binaire : « anormal » regroupe épaississement muqueux, pseudokyste de rétention, opacification et niveau hydro-aérique ; « normal » désigne un sinus bien aéré aux parois intactes.
La fabrique des étiquettes — le cœur du dispositif. Chaque image est soumise trois fois indépendamment à ChatGPT, avec une consigne détaillée lui demandant d’agir en radiologue maxillo-facial et de décrire latéralité, localisation, sévérité et rapports dentaires. Les trois lectures sont fusionnées par vote majoritaire en une description représentative assortie d’une étiquette provisoire. Cette description et l’image sont ensuite transmises à un radiologue (l’une des auteures), qui produit son propre diagnostic, revérifié par un prothésiste dentaire de l’équipe. Trois cas sont écartés comme insuffisants : il reste 297 cas, 146 normaux et 151 anormaux.
Le protocole compare alors trois conditions sur les mêmes plis : Raw (n = 300, étiquettes ChatGPT), Pre (n = 297, étiquettes provisoires de ChatGPT) et Post (n = 297, étiquettes confirmées par le radiologue). Point décisif : entre Pre et Post, seule l’étiquette change. Le texte des « findings » reste rigoureusement identique. Tout écart de performance est donc imputable à la provenance de l’étiquette, et à rien d’autre — ni à l’architecture, ni au contenu de l’image, ni à une réécriture du texte.
Les modèles. Huit réseaux de vision pré-entraînés sur ImageNet puis affinés : ResNet-50, DenseNet-121, EfficientNet-B0, GoogLeNet, AlexNet, NASNet-Large, PNASNet-5-Large et ViT-B/16 (AdamW, taux d’apprentissage 10⁻⁴, jusqu’à 50 époques, lots de 16, graine 42). Sept modèles de langage entraînés sur le seul champ « findings », expurgé de la ligne de classification explicite : BiLSTM, TextCNN, BERT-base, RoBERTa-base, DistilBERT, BioBERT et Bio_ClinicalBERT. Cinq modèles vision-langage en sonde linéaire (linear probing : on gèle l’encodeur, on extrait un vecteur de représentation, et on n’entraîne qu’une régression logistique par-dessus) : CLIP ViT-B/16, BiomedCLIP, Qwen2.5-VL-7B, MedGemma-4B et LLaVA-Med v1.5, avec des sondes image seule, texte seul et image+texte quand l’architecture le permet.
L’évaluation. Validation croisée stratifiée à 10 plis, avec la même assignation de plis pour tous les bras et pour les deux conditions d’étiquetage. Moyennes par pli ± écart-type, intervalles de confiance à 95 % par la loi de Student, matrices de confusion agrégées. Grad-CAM pour l’interprétabilité des réseaux convolutionnels.
Les résultats
Vision : honnête et stable. Sur les huit architectures, l’AUC — l’aire sous la courbe ROC, c’est-à-dire la probabilité que le modèle attribue un score plus élevé à un sinus pathologique tiré au hasard qu’à un sinus sain — s’étale de 0,799 à 0,880. PNASNet-5-Large arrive en tête (0,880, IC 95 % 0,850–0,910), suivi de DenseNet-121 et EfficientNet-B0 (0,863 chacun). EfficientNet-B0 offre le profil le plus équilibré : exactitude 0,800, sensibilité 0,787, spécificité 0,813. ViT-B/16 décroche nettement (exactitude 0,700, AUC 0,799) avec une asymétrie révélatrice : spécificité 0,860 mais sensibilité 0,540, soit 69 sinus pathologiques classés normaux. C’est la signature attendue d’une architecture avide de données entraînée sur quelques centaines d’images.
Langage : le plafond suspect. Les sept modèles de texte atteignent 0,977 à 0,993 d’exactitude et 0,992 à 1,000 d’AUC. Bio_ClinicalBERT obtient une AUC parfaite de 1,000 ; BERT-base, DistilBERT et BioBERT font 0,993 d’exactitude, soit deux erreurs sur 300. Un texte radiologique bien rédigé peut effectivement être plus facile à classer qu’une image — mais un score parfait sur une tâche clinique devrait toujours déclencher une vérification.
Le test de provenance. C’est là que le papier gagne son intérêt. Le radiologue a reclassé 62 cas sur 297, soit 21 %, presque à parts égales : 32 sous-estimations (ChatGPT lit « normal » là où le radiologue voit une anomalie, le plus souvent un épaississement muqueux discret) et 30 surestimations. Quand on rejoue l’entraînement avec ces étiquettes corrigées, texte inchangé :
- Les modèles de langage s’effondrent. BERT-base passe de 0,999 à 0,837. RoBERTa-base de 1,000 à 0,853. Tous chutent, sans exception.
- Les sondes textuelles des VLM aussi. CLIP ViT-B/16 en texte seul : 0,999 → 0,841. MedGemma-4B en image+texte : 1,000 → 0,892.
- Les modèles de vision, eux, ne bronchent pas. Six des huit progressent légèrement (+0,006 à +0,030) : DenseNet-121 monte de 0,867 à 0,891, PNASNet-5-Large de 0,857 à 0,887. EfficientNet-B0 est inchangé (−0,003), ViT-B/16 recule un peu (−0,027).
- Les sondes image seule des VLM bougent à peine. MedGemma-4B : 0,875 → 0,835. Qwen2.5-VL : 0,741 → 0,723.
La lecture est sans ambiguïté. Le texte produit par ChatGPT n’encodait pas un contenu diagnostique : il encodait l’étiquette que ChatGPT s’était lui-même attribuée. Les modèles de langage n’apprenaient pas à lire un sinus, ils apprenaient à retrouver la conclusion d’un autre modèle à partir de sa propre formulation. C’est une fuite d’étiquette par circularité — une variante du data leakage classique, où l’information sur la cible ne fuit pas par les patients mais par le processus d’annotation lui-même. Corriger 21 % des étiquettes suffit à faire perdre 0,15 point d’AUC. Les images, elles, portaient un signal réel : leur performance ne dépend pas de qui a écrit l’étiquette, et s’améliore même quand celle-ci devient plus juste.
La rédaction générative. Un bras exploratoire demande à Qwen2.5-VL-7B, MedGemma-4B et LLaVA-Med v1.5 de produire un compte rendu structuré. Qwen produit les notes les plus longues (161 mots en moyenne, contre 78 et 88) et 66 % d’entre elles s’arrêtent sans ponctuation finale, signe qu’elles ont buté sur la limite de génération. Surtout, parmi les cas anormaux dont l’entrée ne précisait pas de côté, Qwen invente une latéralité dans 17 cas sur 150 (11 %), MedGemma dans 4 sur 150 (3 %), LLaVA-Med jamais. MedGemma reproduit par ailleurs un gabarit clinique non rempli, champs à trous compris, dans 200 notes sur 300 (67 %).
Traduction clinique. Sur 1 000 sinus lus par le meilleur modèle d’image (EfficientNet-B0, sensibilité 0,787 / spécificité 0,813, sur une prévalence d’anomalie de 51 %), on obtiendrait environ 109 sinus pathologiques manqués et 92 sinus sains signalés à tort. À l’échelle d’un cabinet, cela reste un outil de pré-lecture, pas un outil de décision. Et sur la rédaction automatique de comptes rendus, une latéralité inventée une fois sur neuf est disqualifiante : un côté erroné dans un compte rendu de sinus, c’est potentiellement un comblement du mauvais côté.
Ce qui est bien
1. Le protocole isole exactement la variable qui compte. Mêmes plis, même graine (42), même texte, seule l’étiquette change entre Pre et Post. C’est une expérience contrôlée au sens strict, et elle produit un résultat qu’on ne peut pas attribuer à autre chose. La littérature IA-santé est pleine d’effets confondus ; celui-ci ne l’est pas.
2. Le papier documente le mécanisme par lequel il aurait pu se tromper. Les auteurs ont retiré la ligne « Classification: normal/abnormal » du texte d’entrée — précaution correcte — et ont quand même obtenu 1,000 d’AUC. Ils ont alors cherché pourquoi, au lieu de publier le chiffre. Sans le bras Post, ce préprint serait un papier de plus annonçant une AUC parfaite en radiologie dentaire. C’est le geste inverse de ce que la course aux benchmarks encourage.
3. La transparence matérielle est réelle. Code public sur GitHub (dépôt sinus-cbct-benchmark, commit 32d5595 du 8 août 2026), jeu de données public sous CC-BY, textes générés par ChatGPT et textes du radiologue mis à disposition, préprint en CC BY 4.0, aucun financement, aucun conflit d’intérêts déclaré. Le Grad-CAM est utilisé honnêtement : les auteurs montrent qu’AlexNet, sur un cas correctement classé, concentre son activation sur la denture plutôt que sur la cavité sinusienne — un apprentissage par raccourci caractérisé, qu’ils commentent en notant qu’« une prédiction correcte et une raison correcte de la produire ne sont pas la même chose ».
Ce qui est moins bien
1. L’étalon-or reste contaminé par ce que le papier dénonce. Le radiologue n’a pas relu les images à l’aveugle : il a reçu simultanément l’image et la description de ChatGPT. Un biais d’ancrage est donc structurellement possible — et les auteurs le reconnaissent (« la référence a été dérivée en partie de lectures par LLM avant confirmation radiologique, ce qui peut introduire un biais systématique »). Il n’y a qu’un seul lecteur, pas de second radiologue indépendant, donc aucun kappa, aucune mesure d’accord inter-observateur. Le taux de reclassification de 21 % est donc probablement un plancher : à l’aveugle, il serait vraisemblablement plus élevé.
2. Le socle expérimental est mince, et non stratifiable. Trois cents coupes sagittales médianes 2D issues d’un hôpital unique en Chine, sans validation externe, sans validation prospective, sans jeu de test tenu à l’écart — tout repose sur la validation croisée. Comment la coupe médiane a été choisie (automatiquement ? manuellement ?) n’est pas décrit, et l’unité d’analyse est l’image, pas le patient : le nombre de patients n’étant jamais donné, on ne peut pas exclure que des coupes du même patient se retrouvent dans des plis différents. Les auteurs n’ont pas fusionné les métadonnées de MMDental, si bien qu’aucune analyse en sous-groupes n’est possible : ni par sexe (le jeu parent annonce 51,06 % d’hommes), ni par âge, ni par sévérité. L’origine ethnique n’est pas enregistrée dans la source. Enfin la tâche binaire écrase un continuum clinique : un épaississement muqueux de 2 mm et une opacification complète tombent dans la même case.
3. L’appareil statistique est en retrait par rapport à l’ambition du propos. Aucun test de significativité — pas de DeLong, pas de test apparié, aucune valeur p — alors que la thèse du papier repose entièrement sur des écarts entre conditions. Aucune analyse de calibration (ni score de Brier, ni erreur de calibration attendue, ni diagramme de fiabilité), alors même que ChatGPT émettait un indice de confiance qui n’est jamais exploité. La version de ChatGPT utilisée n’est jamais précisée — ni le modèle, ni la date, ni la température, ni l’usage API ou interface : le résultat central de l’étude n’est donc pas exactement reproductible. Le bras génératif est qualitatif et non scoré, les auteurs le disent. Et l’abrégé annonce des sondes image seule à « 0,63–0,69 » d’AUC alors que les résultats en rapportent jusqu’à 0,874 : l’abrégé ne décrit que les modèles contrastifs et généralise à tort.
Ce que ça change
Pour la communauté de recherche. C’est le point d’application le plus direct. L’annotation par LLM se répand parce qu’elle est bon marché et qu’elle passe à l’échelle ; ce papier fournit le protocole minimal pour vérifier qu’elle n’a pas fabriqué un résultat vide. Le test tient en une ligne : réentraîner sur des étiquettes corrigées par un humain, texte d’entrée inchangé, plis identiques, et comparer. Si la performance s’effondre, elle mesurait la cohérence du LLM avec lui-même. C’est peu coûteux, et cela devrait devenir une exigence de relecture pour tout papier dont les étiquettes ou les descriptions sont d’origine synthétique. Le corollaire est également utile : ici, ce sont les images qui portaient le signal, et leur performance s’est légèrement améliorée avec de meilleures étiquettes. Une modalité robuste au bruit d’étiquetage est un indice — pas une preuve — qu’elle apprend quelque chose de réel.
Pour les cliniciens. Rien de déployable à court terme. Une AUC de 0,88 sur une coupe 2D d’un centre unique ne justifie aucun changement de pratique, et la maturité réglementaire est nulle — ce n’est ni un dispositif marqué CE, ni un SaMD approuvé par la FDA, ni même un prototype validé en clinique. Le message opérationnel est plutôt défensif : devant tout outil de rédaction automatique de comptes rendus, la latéralité est le premier point à vérifier, parce que c’est celui que les modèles inventent le plus volontiers quand l’information manque — 11 % des cas pour le modèle le plus verbeux.
Pour les patients et le grand public. Le résultat se résume simplement : quand une IA est notée sur une copie qu’elle a elle-même rédigée, elle a presque toujours 20 sur 20. Cela ne dit rien de sa compétence. Beaucoup de chiffres impressionnants publiés en IA médicale reposent sur des annotations automatiques dont personne n’a vérifié qu’elles correspondaient à la réalité clinique. Ici, la vérification a été faite : un radiologue a corrigé une lecture sur cinq, et le score parfait a disparu.
Pour aller plus loin
- Le préprint : Al-Hebshi S., Khalifa H., Pham T. D., Vision and Language Models for Classifying Maxillary Sinus Disease on Cone-Beam Computed Tomography: A Transparent Multimodal Benchmark, medRxiv, posté le 12 août 2026, DOI 10.64898/2026.08.11.26360189 — sous licence CC BY 4.0.
- Le code : github.com/sebaalhebshi/sinus-cbct-benchmark (commit 32d5595, 8 août 2026). La licence du dépôt n’est pas précisée dans le préprint.
- Le jeu de données : Wang C., Zhang Y., Wu C. et al., MMDental — A multimodal dataset of tooth CBCT images with expert medical records, Scientific Data, 2025;12:1172, disponible sur Figshare sous licence CC-BY (DOI 10.6084/m9.figshare.28505276).
- Sur les modèles évalués : Qwen2.5-VL (arXiv:2502.13923), MedGemma (arXiv:2507.05201), LLaVA-Med (NeurIPS 2023), BiomedCLIP (NEJM AI, 2025;2:AIoa2400640).
- Sur la prévalence des trouvailles sinusiennes fortuites au CBCT : Rege I. et al., BMC Oral Health, 2012;12:30, et Dogan S. et al., Scientific Reports, 2024;14:15529.
Tatakoto ne fournit pas de conseil clinique individuel. Cet article décrit et critique une publication scientifique ; il ne recommande aucun outil ni aucune conduite diagnostique.