Tuberculose sur radiographie thoracique : les modèles vision-langage médicaux s'effondrent dès qu'on remplace les témoins sains par des malades
Trois chercheurs de l'Indian Institute of Technology Indore ont soumis quatre modèles vision-langage — trois médicaux (BioMedCLIP, CheXficient, MedSigLIP) et un généraliste (OpenCLIP) — à un audit de dépistage de la tuberculose sur 12 200 radiographies thoraciques issues de quatre jeux de données publics, en faisant varier une seule chose à la fois : la cohorte, la formulation du texte, la nature des témoins, la prévalence supposée, le seuil de décision. Les classements tiennent mal : remplacer des témoins sains par des patients atteints d'autres maladies fait chuter l'AUROC de 0,075 à 0,306 point, et contre la pneumonie ou la tumeur pulmonaire les trois modèles médicaux passent sous 0,5, le niveau du hasard ; un réseau supervisé à 0,999 en validation interne tombe à 0,629 sur deux cohortes externes. Le papier ne propose aucun nouveau modèle, et c'est sa force : il montre qu'un score de benchmark n'est pas une propriété d'un modèle, mais d'une spécification d'évaluation complète.
Le contexte
La tuberculose reste l'une des premières causes de mortalité infectieuse au monde, et la radiographie thoracique est l'outil de dépistage de masse le moins cher dont on dispose. Depuis 2021, l'Organisation mondiale de la santé admet la détection assistée par ordinateur (CAD) comme alternative à la lecture humaine pour le dépistage et le triage des personnes de 15 ans et plus. Plusieurs logiciels commerciaux sont déjà déployés dans des pays à forte endémie, où les radiologues manquent.
Ces logiciels sont des classifieurs supervisés : entraînés sur des milliers d'images étiquetées « tuberculose » ou « pas tuberculose ». Les modèles vision-langage (VLM) promettent autre chose. Un encodeur d'images et un encodeur de texte sont entraînés ensemble, sur des paires image-légende, pour projeter une radiographie et une phrase dans le même espace mathématique. On peut alors classer une image en zero-shot, c'est-à-dire sans aucun ré-entraînement : on écrit « radiographie montrant une tuberculose » et « radiographie sans tuberculose », et on regarde de quelle phrase l'image est la plus proche. Pour un programme de dépistage sans données locales étiquetées, l'argument est séduisant.
Reste à savoir ce que mesure un benchmark. Une AUROC élevée ne dit ni quels patients servaient de témoins, ni quelle phrase définissait le classifieur, ni si un seuil fixé ailleurs fonctionnera ici. Les auteurs décrivent toute évaluation par sept composantes — modèle, texte, cohorte, définition des négatifs, prévalence, seuil, métrique — et en changer une, c'est évaluer un autre système.
La méthode
Les données. Quatre jeux publics. Montgomery (États-Unis, 58 tuberculoses, 80 normaux) et Shenzhen (Chine, 336 tuberculoses, 326 normaux), les deux collections historiques de la National Library of Medicine. TBX11K, qui a l'intérêt rare de distinguer trois catégories : tuberculose, sain, et malade non tuberculeux ; la validation compte 200 tuberculoses, 800 sains, 800 malades. Enfin le jeu de test de VinDr-CXR (3 000 images de deux hôpitaux vietnamiens, étiquetées par consensus de cinq radiologues), qui nomme les diagnostics concurrents : 164 tuberculoses, 2 051 radiographies sans anomalie, 210 pneumonies et 73 tumeurs pulmonaires sans tuberculose associée.
Les modèles, tous gelés. OpenCLIP, entraîné sur deux milliards d'images du web, sert de témoin généraliste. BioMedCLIP (Microsoft) a appris sur 15 millions de paires figure-légende de la littérature biomédicale. CheXficient (Stanford AIMI) est spécialisé en radiographie thoracique — et VinDr-CXR figure explicitement dans ses données d'entraînement, ce que les auteurs signalent partout. MedSigLIP (Google) couvre plusieurs spécialités médicales.
Les prompts. Cinq familles de formulations publiées mot pour mot : une famille « clinique » de quatre phrases par classe, désignée à l'avance comme principale, et quatre variantes à une phrase (style compte rendu, présence/absence, etc.). Au total, 244 000 scores.
Les analyses, fixées avant de regarder les résultats. Discrimination par l'AUROC — la probabilité qu'une image tuberculeuse reçoive un score plus élevé qu'une image non tuberculeuse ; 0,5 correspond au hasard. Fiabilité des scores par le score de Brier (erreur quadratique moyenne entre score et réalité) et l'erreur de calibration (écart entre probabilité annoncée et fréquence observée). Puis deux tests à visée opérationnelle : repondérer les classes pour simuler différentes prévalences, et transporter un seuil choisi pour atteindre 95 % de sensibilité sur TBX11K vers les autres cohortes, sans le retoucher. Enfin, un ResNet-50 supervisé classique, entraîné sur TBX11K avec cinq graines aléatoires, sert de référence ; les auteurs recherchent aussi les images quasi dupliquées entre jeux de données par empreinte perceptuelle.
Les résultats
Aucun modèle ne gagne partout. Avec le prompt clinique, MedSigLIP devance CheXficient sur Montgomery (0,976 contre 0,969) et TBX11K (0,800 contre 0,795), sans que l'écart soit statistiquement résolu ; CheXficient l'emporte nettement sur Shenzhen (0,950 contre 0,907). Sur VinDr-CXR, CheXficient atteint 0,878, MedSigLIP 0,829, BioMedCLIP 0,713, OpenCLIP 0,528 — mais CheXficient a vu ce jeu à l'entraînement. Sur TBX11K, les AUROC sont quasi identiques alors que le score de Brier de CheXficient est presque deux fois meilleur (0,099 contre 0,171).
Le texte fait partie du modèle. Changer de famille de prompts modifie significativement l'AUROC dans 21 des 48 comparaisons, après correction pour tests multiples. CheXficient passe de 0,835 avec la formulation « compte rendu » à 0,622 avec « présence/absence » sur les mêmes images de TBX11K.
Le résultat central : les témoins. À 200 tuberculoses identiques, remplacer 800 témoins sains par 800 témoins malades fait chuter l'AUROC de tous les modèles : MedSigLIP de 0,953 à 0,647, BioMedCLIP de 0,872 à 0,611, CheXficient de 0,865 à 0,725. Sur VinDr-CXR, c'est plus net encore. Contre les radiographies sans anomalie, CheXficient atteint 0,945 ; contre la pneumonie, 0,466 ; contre la tumeur pulmonaire, 0,372. MedSigLIP et BioMedCLIP tombent entre 0,31 et 0,38. Autrement dit, face à une autre maladie, ces modèles attribuent plus souvent un score « tuberculose » élevé à l'image de pneumonie qu'à l'image de tuberculose.
Les seuils ne voyagent pas. Un seuil réglé pour 95 % de sensibilité sur TBX11K ne garde cette sensibilité que dans 4 transports sur 16. Et quand il la garde, c'est parfois en déclarant presque tout le monde positif : OpenCLIP conserve sa sensibilité sur Shenzhen avec une spécificité de 0,043. CheXficient sur VinDr-CXR atteint 97,6 % de sensibilité et 35,4 % de spécificité ; contre les pneumonies, il n'en rejette correctement qu'une sur 210, et aucune des 73 tumeurs.
Traduction clinique (calcul Tatakoto à partir de ces chiffres, pas une estimation des auteurs) : sur 1 000 radiographies avec la prévalence observée dans VinDr-CXR (5,5 %), ce réglage détecterait environ 54 des 55 tuberculoses, mais enverrait aussi environ 610 personnes non tuberculeuses vers un examen de confirmation. Pour comparaison, le profil cible de l'OMS pour un test de triage demande au minimum 90 % de sensibilité et 70 % de spécificité.
Le supervisé ne sauve pas la mise. Le ResNet-50 atteint 0,997 en validation interne (0,999 pour l'ensemble des cinq graines), puis 0,629 sur Shenzhen comme sur Montgomery. Le criblage par empreinte perceptuelle repère 249 paires suspectes impliquant 313 images ; les retirer et réentraîner améliore Shenzhen de 0,633 à 0,733 et Montgomery de 0,627 à 0,678, sans combler l'écart d'environ 0,27 et 0,32 point.
Ce qui est bien
Des comparaisons appariées qui isolent un seul facteur. Le test des témoins sains contre malades garde exactement les mêmes 200 tuberculoses et la même prévalence (20 %) ; seule la nature des négatifs change. C'est ce qui permet d'attribuer la chute d'AUROC au spectre des témoins plutôt qu'à un changement de population positive. Les quatre différences sont significatives après correction de Holm (p ≈ 0,0004).
Une transparence rare sur ce qui pourrait fausser l'audit. Les prompts sont publiés verbatim, les révisions exactes des poids sont données pour deux des quatre modèles, l'exposition de CheXficient à VinDr-CXR est signalée à chaque tableau, et les auteurs précisent que leur prétraitement de MedSigLIP diffère de celui du développeur (redimensionnement PIL et non TensorFlow), donc que leurs chiffres ne reproduisent pas le model card.
Séparer trois affirmations que la littérature confond. « Ce modèle classe bien », « ses scores sont fiables » et « son seuil garde sa sensibilité ailleurs » sont trois propositions distinctes, et l'audit montre qu'elles peuvent diverger pour un même modèle. Exemple : à prévalence fixée à 50 %, MedSigLIP a un meilleur score de Brier que CheXficient sur les trois cohortes ; à 10 %, l'ordre s'inverse — sans qu'un seul score n'ait changé.
Ce qui est moins bien
Des étiquettes qui ne sont pas une vérité microbiologique. Aucun des quatre jeux ne fournit une confirmation bactériologique harmonisée ; VinDr-CXR repose sur des impressions radiologiques. Une partie des « échecs » face à la pneumonie peut refléter des images réellement ambiguës ou des étiquetages discutables plutôt qu'une erreur du modèle. Les auteurs le reconnaissent : les AUROC sous 0,5 décrivent un classement, pas un taux de mauvais diagnostic en clinique. C'est la limite classique du biais de spectre appliqué à la référence elle-même.
L'unité est l'image, pas le patient. Les manifestes ne relient pas les images d'un même patient, et le criblage de doublons exclut VinDr-CXR et ne peut pas certifier qu'aucune image d'évaluation n'a servi au pré-entraînement de ces modèles, dont les corpus sont en partie non publics. Le risque de data leakage est donc borné, pas écarté, et les intervalles de confiance sont probablement trop étroits. L'écart supervisé 0,999 → 0,629, en particulier, garde une part d'interprétation ouverte : les auteurs montrent que retirer les quasi-doublons suspects aide un peu, sans pouvoir dire lesquels étaient de vrais doublons.
Un audit qui s'arrête avant la question clinique. Pas d'étude de lecteurs, pas d'analyse d'équité par sexe ou âge, pas d'évaluation d'un système recalibré localement — ce que ferait pourtant tout programme de dépistage sérieux. Les comparateurs sont des VLM génériques et un ResNet-50, pas les logiciels CAD commerciaux effectivement déployés pour la tuberculose : l'audit ne dit rien de leur comportement face aux mêmes témoins malades. Enfin, aucune mention de financement, de conflits d'intérêts ni de code publié n'apparaît dans la version examinée, ce qui empêche de rejouer l'analyse telle quelle.
Ce que ça change
Pour la communauté de recherche, le papier fournit une grille directement réutilisable : toute publication de VLM médical en zero-shot devrait donner ses prompts exacts, sa définition des négatifs, et rapporter la performance contre des témoins malades nommés, pas seulement contre des sains. C'est la version outillée d'un problème connu, la stratification cachée — une AUROC globale de 0,878 sur VinDr-CXR peut coexister avec un classement pire que le hasard contre la pneumonie, parce que 2 051 images normales dominent le dénominateur. Le même mécanisme apparaissait dans notre décryptage sur la transportabilité des modèles de radiographie pédiatrique et dans celui sur l'audit des étiquettes de MIMIC-CXR.
Pour les cliniciens et les programmes de dépistage, le message est pratique. Dans une population réelle, les personnes dépistées ne sont pas « tuberculeuses ou saines » : beaucoup ont une pneumonie, une séquelle, un cancer. Un modèle présenté avec une AUROC flatteuse sur Montgomery ou Shenzhen, qui ne comparent la tuberculose qu'à des poumons normaux, n'apporte aucune preuve sur ce scénario. Et un seuil ne doit jamais être importé tel quel : il doit être recalé et validé localement, avec sensibilité et spécificité rapportées ensemble.
Pour les patients et le public, un outil qui confond pneumonie et tuberculose surcharge les laboratoires de tests de confirmation et retarde d'autres diagnostics. La promesse du zero-shot — un modèle utilisable partout sans données locales — n'est pas démontrée ici pour la tuberculose.
Pour aller plus loin
Le papier : Beyond Benchmark Scores: Auditing Medical Vision-Language Models for Chest X-Ray Tuberculosis Screening, Mushir Akhtar, M. Tanveer, Mohd. Arshad (Department of Mathematics, Indian Institute of Technology Indore), arXiv:2609.21763 (cs.CV), déposé le 18 septembre 2026, DOI 10.48550/arXiv.2609.21763. Preprint non relu par les pairs.
Les jeux de données : Montgomery et Shenzhen (National Library of Medicine), TBX11K, VinDr-CXR v1.0.0 (PhysioNet). Sur le cadre de l'OMS : les lignes directrices consolidées sur le dépistage de la tuberculose (2021). Sur un autre cas de corrélation parasite liée à l'origine des données : le shortcut learning en mammographie.