Radiographie thoracique pédiatrique : l'AUROC survit au passage de frontière, le seuil de décision non
Un chercheur de l'American International University-Bangladesh a gelé un ensemble DenseNet121 à trois graines entraîné sur les 5 824 radiographies thoraciques pédiatriques de Guangzhou — AUROC interne 0,976, sensibilité 95,1 % — puis l'a appliqué sans aucune retouche à 3 257 clichés du Bangladesh et à 1 077 clichés du Vietnam jamais touchés. L'AUROC descend à 0,798 et 0,742, une dégradation sévère mais qui laisse le classement exploitable ; au seuil de décision figé sur les données source, la sensibilité s'effondre à 6,2 % puis à 0 %, sur 2 377 et 170 pneumonies respectivement. Recalibrer avec 163 étiquettes locales ramène la sensibilité à 88,3 % sans toucher au classement, mais fait alerter 78,5 % des radiographies : le papier montre surtout que « ça se rattrape » et « c'est déployable » ne sont pas la même phrase.
Le contexte
La classification de pneumonie pédiatrique sur radiographie thoracique est l'un des terrains les plus saturés de l'IA médicale, et l'un des plus mal évalués. La quasi-totalité des travaux publiés depuis 2018 s'entraîne et se teste sur la même ressource : le jeu de Guangzhou diffusé par Kermany et al. dans Cell, environ 5 800 clichés d'enfants d'un seul centre chinois. Les revues systématiques de radiologie pédiatrique le répètent depuis quatre ans — le test externe reste rare et la généralisabilité clinique incertaine.
Le problème que ce préprint attaque n'est pourtant pas l'absence de validation externe. C'est sa réduction à un chiffre unique. Quand un papier annonce une « validation externe », il rapporte presque toujours une AUROC, et rien d'autre. Or trois questions distinctes se cachent derrière une performance. L'AUROC (aire sous la courbe ROC) mesure la capacité à ordonner : si l'on tire au hasard un enfant malade et un enfant sain, quelle probabilité que le modèle donne le score le plus élevé au malade ? Elle ignore complètement l'échelle des scores. La calibration mesure si une probabilité annoncée à 0,8 correspond bien à 80 % de cas réellement positifs. Le point de fonctionnement, enfin, est le seuil concret au-dessus duquel le logiciel déclenche une alerte : c'est lui, et lui seul, qui produit les sensibilités et spécificités affichées.
Ces trois choses se déplacent indépendamment. Un décalage monotone des scores dans la population cible — tous les scores tirés vers le bas, mais dans le même ordre — laisse l'AUROC intacte et rend le seuil source complètement inopérant. Inversement, une recalibration peut réparer les probabilités sans améliorer d'un iota le classement. C'est ce que ce travail se propose de démontrer expérimentalement, avec un protocole verrouillé à l'avance.
La méthode
Trois cohortes, trois rôles. Guangzhou/Kermany (Chine) sert au développement : entraînement, réglage, calibration de température, choix du seuil, test interne. BDCXR-3257 (Bangladesh, 3 257 images, 880 normales et 2 377 pneumonies, soit 73 % de prévalence) est le test externe primaire. VinDr-PCXR/PediCXR (Vietnam) fournit une seconde cohorte externe, harmonisée avant toute inférence à 1 077 examens (907 normaux, 170 « famille pneumonie »), et jamais utilisée pour quoi que ce soit d'autre que l'inférence finale.
La hiérarchie d'analyse est verrouillée. C'est le point de conception le plus important. BDCXR est d'abord évalué en cohorte complète avec le système source gelé, et ce résultat est conservé tel quel. C'est seulement ensuite que BDCXR est coupé en un vivier d'adaptation de 651 images et un ensemble de retenue disjoint de 2 606 images. Le VinDr, lui, ne sert jamais à l'entraînement, à la calibration, au choix de modèle ni au choix de seuil. Autrement dit, l'auteur s'interdit explicitement de repeindre en « validation externe » un résultat obtenu après avoir regardé les données cibles.
Le contrôle de fuite à la source. Chaque image de Guangzhou est décodée et hachée : 32 doublons exacts sont retirés, laissant 5 824 clichés uniques. Les identifiants numériques étant réutilisés entre les noms de fichiers bactériens et viraux, le regroupement dérivé des noms de fichiers est fait à l'intérieur de chaque espace de nom pathologique. Découpage final : 4 165 entraînement, 1 041 réglage, 618 test interne, avec chevauchement nul de hachage et de groupe. L'auteur précise honnêtement que ces groupes sont des proxys de contrôle de fuite, pas des identifiants patients vérifiés.
Le modèle. Un encodeur DenseNet121 pré-entraîné sur ImageNet, partagé entre deux vues de la même radiographie : l'image entière, et une image conditionnée aux poumons obtenue par le segmenteur anatomique PSPNet de TorchXRayVision. Une porte apprise, canal par canal, combine les deux représentations. La régularisation MixStyle — qui mélange, pendant l'entraînement, les statistiques de style entre exemples pour décourager le modèle de s'accrocher à l'apparence d'un scanner particulier — n'est active que sur la source. Prétraitement : mise à l'échelle robuste de l'intensité, letterboxing à rapport d'aspect préservé, 320 × 320, réplication sur trois canaux, normalisation ImageNet ; les DICOM VinDr sont rescalés et l'inversion MONOCHROME1 traitée en amont. Trois graines (42, 52, 62) sont moyennées au niveau des logits, puis une mise à l'échelle de température — un seul paramètre qui aplatit ou durcit les probabilités — est ajustée sur les seuls logits de réglage source (T = 0,8313).
Le seuil. C'est le choix le plus discutable de l'étude, et il faut le retenir : le point de fonctionnement primaire est le point ROC de plus haute spécificité atteignant au moins 90 % de sensibilité sur les données de réglage source. Il vaut 0,9999728. Sept neuf après la virgule. Un second seuil, dit libéral, est dérivé a posteriori mais toujours à partir des seules données source : 0,314311.
Les tests de robustesse. Trois variantes appariées à la graine 42, sur le même découpage source, testent si l'effondrement dépend de l'architecture proposée : un DenseNet121 conventionnel sur image entière, la double vue sans porte ni MixStyle, et le modèle complet. Chacune reçoit sa propre température et son propre seuil source. Des tests de stress cherchent un signal de raccourci (shortcut) en réévaluant BDCXR sur quatre vues : image complète, poumons, arrière-plan seul, bordure seule. Des classifieurs de domaine séparés mesurent la séparabilité source/cible. Statistiques : intervalles de Wilson pour les proportions, 2 000 rééchantillonnages bootstrap stratifiés au niveau image pour VinDr, 2 000 bootstraps appariés pour la comparaison de réglage fin. Rapport conforme aux principes CLAIM 2024 et TRIPOD+AI.
Les résultats
En interne, tout va bien. AUROC 0,976, AUPRC 0,982, sensibilité 95,1 % (368/387 ; IC 95 % 92,5–96,8), spécificité 90,9 % (210/231 ; 86,5–94,0), exactitude équilibrée 93,0 %. C'est le genre de résultat qui fait un titre.
Au Bangladesh, le classement tient, la décision non. AUROC 0,798, AUPRC 0,912. Mais seulement 147 des 2 377 pneumonies franchissent le seuil source : sensibilité 6,2 % (IC 5,3–7,2), spécificité 99,9 % (879/880), exactitude équilibrée 53,0 %. Traduction clinique : sur 100 radiographies passées par le système, 4,5 déclenchent une alerte et 68,5 pneumonies sont manquées. La calibration s'effondre aussi (ECE 0,258, Brier 0,268).
Au Vietnam, le seuil ne déclenche jamais. AUROC 0,742 (IC bootstrap 0,701–0,782), AUPRC 0,396. Aucun des 170 examens de la famille pneumonie ne franchit le seuil : sensibilité 0 % (IC de Wilson 0–2,2), spécificité 100 %, exactitude équilibrée 50,0 %. La pente de calibration est de 0,196. Deux définitions plus étroites du critère de jugement donnent des AUROC de 0,729 et 0,734, et la même sensibilité nulle.
Ce n'est pas la faute de l'architecture proposée. Le DenseNet121 conventionnel sur image entière passe de 0,961 à 0,749 sur BDCXR, avec une sensibilité de 94,8 % à 16,2 %. La double vue sans porte : 0,977 → 0,766, sensibilité 96,1 % → 4,7 %. Le modèle complet : 0,966 → 0,789, 95,9 % → 4,4 %. Le phénomène est le même partout ; le modèle « amélioré » gagne un peu d'AUROC externe et perd davantage de sensibilité au seuil.
La recalibration répare les probabilités, pas la décision. Sur l'ensemble de retenue de 2 606 images, le modèle source verrouillé donne AUROC 0,799, sensibilité 6,4 %, ECE 0,256. Une recalibration de Platt — une simple transformation logistique du score, donc monotone, donc sans effet sur l'AUROC — ajustée sur 163 étiquettes locales (5 % de la cohorte) donne : sensibilité 88,3 %, ECE 0,044, mais spécificité 47,9 %, VPP 0,821, taux d'alerte 78,5 %, et 14,1 fausses alertes pour 100 examens. Avec 326 étiquettes : sensibilité 91,9 %, spécificité 38,6 %, taux d'alerte 83,7 %, 16,6 fausses alertes pour 100. Avec 651 étiquettes, aucune amélioration supplémentaire (90,7 % / 42,5 %). Le budget d'étiquettes sature immédiatement, et ce qu'il achète est une politique qui signale quatre radiographies sur cinq.
Et cette réparation est instable. Sur 200 tirages répétés de 163 étiquettes, la sensibilité moyenne est de 91,5 % (percentiles 2,5–97,5 : 86,8–95,5 %) mais la spécificité moyenne de 37,1 % avec une amplitude de 21,0 à 49,3 %. La direction de la récupération est reproductible ; le point de fonctionnement obtenu dépend fortement de quelles 163 images on a étiquetées.
Le réglage fin n'apporte rien de plus. La comparaison pré-spécifiée à 326 étiquettes — réglage fin du dernier bloc contre recalibration de Platt appariée — donne 0,7907 contre 0,7893, soit +0,00136 (IC 95 % −0,00117 à +0,00382 ; p = 0,293). Les ensembles à trois graines montent à 0,805 avec 326 étiquettes et 0,815 avec 651 : des gains de classement réels mais marginaux.
Le signal existe hors des poumons. Sur BDCXR, l'AUROC pour la pneumonie reste au-dessus du hasard sur l'image complète (0,794), sur les poumons (0,760), sur l'arrière-plan seul (0,719) et sur la bordure seule (0,667). La classification source-contre-cible est quasi parfaite quelle que soit la vue.
Le seuil pathologique n'explique qu'une partie du désastre. Le seuil libéral (0,314311) porte la sensibilité interne à 100 %, mais ne donne que 69,0 % au Bangladesh et 15,9 % au Vietnam. Le seuil à sept neuf a amplifié l'échec ; il ne l'a pas créé.
Ce qui est bien
La hiérarchie d'analyse est verrouillée et l'auteur s'y tient jusqu'à s'auto-incriminer. BDCXR est évalué en cohorte complète et ce résultat est conservé avant que la moindre étiquette locale ne soit regardée ; VinDr n'est touché à aucun moment. C'est exactement la discipline que TRIPOD+AI demande et que presque personne n'applique, parce qu'elle interdit de présenter comme externe un résultat obtenu après adaptation. L'auteur va plus loin : il signale qu'une version antérieure de son propre pipeline comparait les noms d'établissement en texte brut et fuyait, et que les plis publiés ont été recoupés. Il précise également que les groupes de contrôle de fuite à Guangzhou sont dérivés de noms de fichiers et ne sont pas des identifiants patients vérifiés. Ce niveau d'auto-déclaration est rare.
Le bras de robustesse architecturale désamorce l'objection la plus évidente. Un lecteur pressé conclurait que la double vue à porte apprise est une mauvaise idée. L'auteur teste précisément cela : un DenseNet121 nu, entraîné sur le même découpage avec sa propre calibration et son propre seuil, s'effondre aussi (0,961 → 0,749, sensibilité 94,8 % → 16,2 %). Le résultat de transport n'est donc pas un artefact d'une implémentation particulière. C'est une contribution négative sur sa propre architecture, publiée comme telle : l'auteur écrit explicitement que le papier ne présente pas un nouveau backbone de vision et que la contribution est la décomposition reproductible de l'échec.
La « récupération » est chiffrée en charge de travail, pas seulement en métriques. C'est ce qui distingue ce papier de la littérature d'adaptation de domaine. Presque tous les travaux qui montrent qu'une recalibration légère restaure la sensibilité s'arrêtent à la sensibilité. Ici on lit, sur la même ligne de tableau : sensibilité 88,3 %, spécificité 47,9 %, taux d'alerte 78,5 %, 14,1 fausses alertes pour 100 examens. Et l'analyse de 200 rééchantillonnages montre que la spécificité obtenue varie de 21 % à 49 % selon le tirage. Autrement dit, l'auteur mesure non seulement le coût opérationnel de la réparation, mais aussi son imprévisibilité.
Ce qui est moins bien
Le seuil primaire à 0,9999728 fabrique une partie du résultat que l'abrégé met en avant. Un point de fonctionnement à sept neuf n'est pas un choix clinique, c'est le symptôme d'un sigmoïde saturé sur un jeu source facile — le modèle sort des probabilités collées à 1 pour presque toutes les pneumonies de Guangzhou, et la règle « plus haute spécificité à sensibilité ≥ 90 % » va donc chercher un point absurde. Les chiffres qui font le titre — 6,2 % et 0 % — sont pour partie le produit de cette mécanique. L'auteur le reconnaît, teste un seuil libéral, et conclut à juste titre que celui-ci « a amplifié mais n'a pas créé » l'échec. Mais l'abrégé mène toujours avec 6,2 % et 0 %, alors que le chiffre honnêtement transportable est plutôt 69,0 % au Bangladesh et 15,9 % au Vietnam. C'est un cas manuel de métrique trompeuse, ici au détriment du modèle plutôt qu'à son avantage — ce qui reste une distorsion.
Il n'y a aucun comparateur humain, et l'étalon de référence est faible aux trois étages. Personne n'est comparé à un radiologue, à un pédiatre, ni même à une règle clinique simple : on ne sait donc pas si une sensibilité de 69 % au Bangladesh est bonne, mauvaise ou hors sujet. Les étiquettes de Guangzhou proviennent d'une ressource dont les limites sont documentées depuis 2018. Le critère de jugement vietnamien a dû être harmonisé par l'auteur lui-même avant inférence (Pneumonia, Broncho-pneumonia et Pleuro-pneumonia comptées positives, « No finding » propre compté négatif) — un choix défendable, gelé avant analyse, et vérifié par deux définitions plus étroites, mais qui reste une décision de l'expérimentateur sur la variable qu'il mesure. Enfin, BDCXR n'a aucun identifiant patient vérifié : le bootstrap au niveau image ne peut pas tenir compte d'éventuelles radiographies multiples d'un même enfant, ce qui sous-estime probablement l'incertitude — l'auteur l'écrit noir sur blanc.
Le titre dit « trois pays » alors que l'étude ne peut rien attribuer au pays. Les trois ressources diffèrent simultanément en géographie, distribution d'âge, prévalence (73 % contre 15,8 % !), équipement, compression, spectre de maladie, protocole d'annotation et étalon de référence. L'auteur le dit explicitement dans les limites et refuse toute conclusion causale sur la géographie — mais le titre et l'abrégé continuent de vendre « across three countries ». Trois faiblesses de reproductibilité s'ajoutent. L'analyse de raccourci est suggestive et non causale : que l'arrière-plan soit prédictif à 0,719 montre qu'il existe un signal corrélé à l'étiquette hors anatomie, pas que le modèle l'a utilisé, et l'auteur le concède. Le code est annoncé comme « archive de reproductibilité fournie avec la soumission » — pas de dépôt public, pas de DOI de code, pas de poids publiés, et le préprint est sous licence CC BY-NC-ND 4.0, donc ni commercialisable ni modifiable. Et il s'agit d'un travail d'auteur unique, sans financement, sans validation prospective, sans réadjudication radiologique locale et sans courbe de décision : ce que le papier documente rigoureusement, c'est un échec de transport, pas un chemin vers un déploiement.
Ce que ça change
Pour la communauté de recherche. Le résultat transférable n'est aucun des chiffres, c'est le protocole en cinq composantes : discrimination, calibration, comportement au point de fonctionnement figé, signal de raccourci, récupérabilité à budget d'étiquettes limité. Ces cinq axes coûtent quelques heures de calcul supplémentaires sur des données qu'on possède déjà, et ils séparent des situations que l'AUROC seule confond totalement. La démonstration la plus nette du papier tient en une ligne : AUROC 0,742 et sensibilité 0 % sur la même cohorte, avec le même modèle, au même instant. Toute revue systématique qui compte les « validations externes réussies » sur la base d'une AUROC compte mal. Nous avions déjà vu ce dédoublement à l'œuvre sur la transportabilité des modèles de delirium en réanimation entre eICU et MIMIC, et le mécanisme est identique.
Pour les cliniciens et les acheteurs de dispositifs. Le chiffre à retenir est 78,5 %. C'est le taux d'alerte après une recalibration présentée comme réussie — sensibilité restaurée à 88,3 %, calibration excellente à 0,044 d'ECE. Un logiciel qui signale quatre radiographies sur cinq dans un service qui en produit deux cents par jour n'est pas un outil de tri, c'est une source de bruit. La conséquence pratique est qu'une clause contractuelle exigeant « une AUROC ≥ 0,80 sur nos données » est insuffisante : il faut exiger le seuil, la sensibilité et la spécificité et le taux d'alerte à ce seuil, sur la population locale, et la procédure de réétalonnage quand ils dérivent. Le corollaire est qu'un modèle acheté avec son seuil d'usine est probablement inutilisable tel quel — mais que le recalibrer localement demande des étiquettes locales, donc du temps de radiologue, donc un budget que personne ne provisionne.
Pour les patients et le public. Sur les 1 077 examens vietnamiens, le modèle a détecté zéro pneumonie sur 170. Non parce qu'il ne « voit » rien — son classement reste nettement au-dessus du hasard — mais parce que le curseur réglé en Chine ne correspondait à rien au Vietnam. C'est le mode d'échec le plus insidieux de l'IA médicale : le système ne se trompe pas bruyamment, il se tait. Et le fait que l'arrière-plan et la bordure des radiographies du Bangladesh restent prédictifs de la pneumonie rappelle que ces modèles apprennent en partie l'hôpital, pas la maladie — le même apprentissage par raccourci que nous avions décrit sur la fusion de jeux de données en mammographie de dépistage. La leçon générale, pour un lecteur non spécialiste : quand un communiqué annonce qu'un modèle atteint 95 % de sensibilité, la question à poser n'est pas « sur combien de patients ? » mais « à quel seuil, et ce seuil a-t-il été fixé sur les mêmes données ? ».
Pour aller plus loin
Le préprint : Cross-dataset transportability of pediatric chest X-ray deep learning across three countries: discrimination, calibration, operating-point failure, and limited-label recovery, arXiv:2609.05140 [eess.IV], DOI 10.48550/arXiv.2609.05140, déposé le 4 septembre 2026, sous licence CC BY-NC-ND 4.0. Auteur unique : Nazim-E-Alam, département d'informatique, American International University-Bangladesh (AIUB), Dhaka. Aucun financement public, commercial ou associatif ; aucun conflit d'intérêts déclaré. L'auteur déclare avoir utilisé ChatGPT (OpenAI) pour la synthèse bibliographique, le débogage de code, la structuration du manuscrit et l'amélioration de la langue, et indique avoir vérifié les affirmations numériques contre les sorties d'analyse conservées ; aucune image scientifique n'a été générée ou altérée par IA. Les données sources restent chez leurs dépositaires respectifs : Guangzhou/Kermany (Cell, 2018), PediCXR (Scientific Data, 2023) et VinDr-PCXR sur PhysioNet, dont les DICOM sont d'accès restreint et non redistribués. Une archive de code de reproductibilité accompagne la soumission mais n'est pas déposée publiquement. Sur le contexte méthodologique, deux lectures fondatrices : Zech et al., PLOS Medicine 2018, sur l'encodage de l'identité du site par un modèle de pneumonie, et Van Calster et al., BMC Medicine 2019, « Calibration: the Achilles heel of predictive analytics ». Les grilles de rapport citées sont CLAIM 2024 et TRIPOD+AI.