Quarante pour cent d'une colonne de diagnostic remplie par défaut : audit compte par compte d'un dépistage cognitif chinois, et 24 façons d'entraîner un modèle dessus

Quatorze auteurs chinois ont ouvert la colonne « statut cognitif » d'un programme de dépistage communautaire déployé en Chine continentale — 112 023 lignes écrites par 2 597 comptes de saisie — et constaté que 181 comptes, chacun ayant enregistré au moins 100 diagnostics sans jamais cocher une seule atteinte, ont produit 45 315 de ces lignes, soit 40,5 % de la colonne. Ils ont ensuite entraîné 24 modèles sur les mêmes patients sous un étalon spécialiste : ni le réglage fin, ni l'optimisation de préférence, ni l'apprentissage par renforcement sur quelques centaines de cas n'a battu la régression logistique à 21 variables déjà en production (AUROC 0,926). Le seul bras qui la dépasse — un Qwen3-4B tournant sur un GPU grand public, à 0,940 — n'a vu aucune étiquette de médecin : il a été distillé à partir de 943 verdicts d'un modèle frontière interrogé sur les dossiers non étiquetés du programme.

Le contexte

Les bases de données de service — celles que remplit une infirmière, un travailleur social ou un médecin à chaque contact, dans le cours normal du soin — sont devenues la source d'étiquettes préférée des modèles cliniques. Elles sont énormes et gratuites. Le problème, formulé sans détour par les auteurs, est que le processus qui écrit ces étiquettes n'est presque jamais audité avant qu'on s'entraîne dessus. La littérature sur le bruit d'étiquetage (label noise) sait traiter le bruit aléatoire ou conditionnel à la classe ; elle est mal armée contre un bruit concentré dans quelques comptes de saisie, qu'aucune augmentation de la taille d'échantillon ne moyenne.

Le terrain est un programme de dépistage cognitif communautaire en routine en Chine continentale, dont les données sont détenues par la Beijing Medical Award Foundation. Le résident passe deux instruments : l'AD-8, huit questions posées à un proche (informant interview : c'est l'entourage, pas le patient, qui répond), et le HKBC (Hong Kong Brief Cognitive Test), test dérivé du CSI-D, neuf items cognitifs plus un rappel immédiat. Une régression logistique à 21 variables — les 8 items AD-8, les 9 items CSI-D, le rappel immédiat, l'âge, le sexe, le niveau d'éducation — signale les résidents à orienter, au seuil de probabilité 0,10.

Cette base contient deux actifs de nature opposée. Un actif grand et bon marché : 112 023 lignes de statut cognitif, dont 105 893 individus évalués — 103 688 notés normaux, 2 197 « atteinte cognitive non spécifiée », 1 trouble cognitif léger et 7 démences. Un actif petit et cher : les 672 individus dont le statut a été enregistré par un médecin titulaire (rang attending ou au-dessus). La question du papier est de savoir ce que chaque manière d'utiliser ces deux actifs achète, et à quel prix.

La méthode

L'audit. Pour chacun des 2 597 comptes opérateurs, les auteurs comptent deux choses seulement : le nombre de diagnostics saisis, et la proportion enregistrant une atteinte quelconque. La règle de détection signale les comptes ayant saisi au moins 100 diagnostics avec zéro atteinte. Point crucial de méthode : ils testent une explication concurrente. Si ces zéros venaient d'un traitement de masse (une importation automatique), ils devraient se regrouper dans les horodatages d'écriture. C'est bien ce qu'on observe — la seconde la plus dense de la table contient 26 694 lignes — mais l'effet touche toutes les catégories d'opérateurs, et les lignes des médecins titulaires sont plus concentrées que celles des comptes non titulaires. Conclusion : la colonne d'horodatage est un artefact de migration de base, pas une signature de remplissage automatique. Elle est disqualifiée ; l'axe opérateur, lui, tient. Aucune affirmation temporelle n'est faite nulle part dans l'étude.

Les 24 bras. Ils couvrent l'espace des choix de supervision qu'un programme réel doit faire. La régression à 21 variables réajustée sur les étiquettes de médecin sert de barre. Quatre modèles de langue locaux — Qwen2.5-1.5B et 3B, Qwen3-4B et 8B, chargés en 4 bits, entraînés en LoRA sur un seul GPU grand public de 8 Go — sont déclinés en zéro-shot, avec chaîne de pensée explicite, réglés finement sur les étiquettes de médecin, réglés sur les étiquettes de routine avec et sans « décontamination » (retrait des lignes issues des comptes à ≥ 200 diagnostics et zéro atteinte : 54 comptes, 27 616 lignes), ou réglés sur une tâche proxy — la bande de score du HKBC — qui occupe volontairement un espace d'étiquettes différent du verdict clinique. S'y ajoutent des variantes en DPO (optimisation directe de préférence) et GRPO (renforcement par avantage relatif de groupe), la recette pré-enregistrée en deux temps « proxy puis renforcement » à trois pénalités de faux négatif, un modèle frontière propriétaire (gpt-5.6-pro) interrogé en zéro-shot, et enfin la distillation de ce modèle frontière dans la régression et dans le 4B local.

La distillation, chiffrée. Le pool non étiqueté du programme est réduit à 42 823 lignes, qui se ramènent à 15 127 motifs de saisie distincts. Un échantillonnage stratifié sans étiquette (endossements AD-8 plus erreurs CSI-D, neuf bandes) avec probabilités d'inclusion stockées produit les 943 motifs effectivement étiquetés par le modèle frontière. L'élève 4B est entraîné dessus par entropie croisée pondérée (poids de Horvitz-Thompson, moyenne 1, maximum 44,8), en sept minutes. Coût total de supervision : 943 appels à environ 12 secondes, soit à peu près trois heures de « temps de professeur ». Aucune étiquette de médecin n'entre dans l'entraînement de ce bras.

L'évaluation. Un seul découpage en cinq plis, stratifié sur l'issue et groupé sur les grappes d'institution résolues via le registre de la plateforme, de sorte qu'aucune grappe ne chevauche deux plis — vérifié programmatiquement. Les auteurs signalent au passage qu'une version antérieure du projet comparait les noms d'établissement en texte brut et fuyait ; les plis publiés sont recoupés. Tous les bras sont notés hors pli. Une institution entière (l'hôpital Peking University Sixth) est mise de côté, laissant un panel de développement de 642 individus dans 38 institutions, dont 259 avec atteinte (40,3 %). Les contrastes appariés passent par un bootstrap de grappes à 2 000 tirages. Métriques : AUROC, erreur de calibration attendue (ECE), pente de calibration, saturation, et bénéfice net au seuil déployé de 0,10, rapporté par 100 individus contre la meilleure politique triviale.

Les résultats

L'audit. Les 181 comptes signalés ont écrit 45 315 lignes, 40,5 % de la colonne ; six comptes ont chacun saisi plus de 1 000 diagnostics sans une seule atteinte, le plus gros à 3 960. Le taux d'atteinte enregistrée décroît de façon monotone avec le volume du compte : 15,7 % pour les comptes à 1–9 lignes, 3,4 % à 10–49, 2,1 % à 100–499, 0,7 % à 500–999. Retirer les comptes signalés fait passer le taux d'atteinte observé du programme de 2,60 % à 4,37 % — la prévalence apparente du dépistage national double presque par la seule exclusion de quelques centaines de comptes de saisie.

Le classement des bras. Sous l'étalon spécialiste, la régression incumbent obtient une AUROC de 0,926 [0,873–0,956]. Aucun bras entraîné localement ne la bat. Le réglage fin sur étiquettes de médecin plafonne à 0,924 (4B comme 1,5B) ; le DPO tombe à 0,881, le GRPO à 0,789 — soit −0,043 et −0,135 par rapport à leur frère supervisé, à départ, plis et hyperparamètres identiques. La recette pré-enregistrée en deux temps est pire que sa base contaminée à une étape (−0,030 ; IC 95 % −0,077 à −0,004), et pire encore que l'ablation qui remplace le renforcement par une entropie croisée (−0,057). Le bras entraîné sur le corpus de routine contaminé (0,899) est indiscernable du même modèle non entraîné (0,890 ; Δ +0,009, −0,014 à +0,024) : la supervision contaminée n'a rien acheté. Le bras entraîné uniquement sur la tâche proxy s'effondre à 0,792, soit 0,098 en dessous de sa propre base zéro-shot.

La chaîne de pensée dégrade. Demander au modèle de raisonner explicitement avant de répondre réduit la discrimination à chaque taille : −0,072 à 1,5B, −0,080 à 3B, −0,041 à 4B, et −0,012 (non significatif) à 8B. La pénalité rétrécit avec l'échelle mais ne devient jamais un gain.

Le modèle frontière et son élève. gpt-5.6-pro en zéro-shot atteint 0,932, statistiquement indiscernable de la régression (+0,007, n.s.) : comme prédicteur, il n'apporte rien. Comme instrument d'étiquetage, c'est autre chose. Le 4B distillé atteint 0,940 [0,898–0,963], au-dessus de la régression (+0,014 ; 0,004 à 0,031) et au-dessus de son propre professeur (+0,008 ; 0,001 à 0,017). Le budget d'étiquettes sature très tôt : 0,937 dès 50 étiquettes de professeur, 0,940 à 200, 0,940 aux 943.

La calibration sépare mieux que la discrimination. Seuls trois bras sont correctement calibrés — la régression (ECE 0,039), le modèle frontière (0,041) et le 4B distillé (0,045) — et ce sont exactement les trois dont la valeur décisionnelle au seuil fixe tient la route. Le 4B réglé sur étiquettes de médecin, lui, affiche une ECE de 0,102, une pente de 0,40 et 68 % de sorties saturées. Les bras zéro-shot 1,5B, 3B et 8B signalent 100 % du panel au seuil déployé : ils s'effondrent sur la politique triviale « orienter tout le monde ». Le bras DPO sature 99 % de ses sorties. Traduction décisionnelle : pour 100 individus évalués, le bras distillé apporte un bénéfice net de +3,13 contre la meilleure politique triviale, le professeur +2,94 — mais les auteurs préviennent que, dans le papier compagnon où ces contrastes sont munis d'intervalles et corrigés pour la multiplicité, aucun contraste entre bras déployables n'exclut zéro.

Le site tenu à l'écart renverse tout. Sur les 58 individus de l'hôpital mis de côté, le classement se réordonne complètement : zéro-shot 3B 0,925, zéro-shot 4B 0,894, 8B 0,875, régression figée 0,869, modèle frontière 0,851, 4B distillé 0,843, zéro-shot 1,5B 0,808. Le gagnant du panel finit avant-dernier. Les auteurs le disent eux-mêmes : aucun bras n'y est séparable d'un autre, la vérification est publiée pour la transparence, pas pour la sélection.

Ce qui est bien

Le test de l'explication concurrente est ce qui distingue un audit d'une anecdote. Il aurait été facile de publier « 40 % de la colonne vient de comptes suspects » et de s'arrêter là. Les auteurs ont explicitement construit l'hypothèse rivale — un remplissage de masse identifiable dans les horodatages — l'ont testée, et l'ont réfutée en montrant que la concentration temporelle frappe aussi les médecins titulaires. La conséquence est opérationnelle et non cosmétique : si l'hypothèse temporelle avait survécu, le remède aurait été « retirer les lignes écrites en masse » ; le remède correct est « retirer les lignes des comptes signalés, et cesser de faire confiance à la colonne de date ». Ils vont jusqu'à s'interdire toute affirmation temporelle dans le reste du papier, et à signaler qu'une version antérieure de leur propre pipeline fuyait sur les noms d'établissement.

Les résultats pré-enregistrés sont publiés en négatif. La recette annoncée — proxy abondant d'abord, renforcement sur les cas spécialistes ensuite — n'a pas marché, et a même fait pire que la version contaminée en une étape. Les auteurs le rapportent ainsi, avec les trois contrastes chiffrés et les trois valeurs de pénalité, plutôt que de reformuler l'objectif après coup. Ils répliquent en plus la comparaison SFT/DPO/GRPO à 4B pour montrer que l'échec des objectifs de renforcement n'est pas un artefact de petit modèle, et précisent honnêtement que dans ce cadre à deux actions le GRPO se réduit à un gradient de politique classique et le DPO à une perte logistique — donc que rien ici ne dit quoi que ce soit du renforcement sur des tâches de raisonnement long.

La distillation est chiffrée jusqu'au bout. Budget d'appels (943), débit (médiane 12,1 s, zéro réponse non analysable sur la première tranche de 472), bruit du professeur mesuré par ré-étiquetage de 100 motifs (24 % de répétitions identiques, 72 % à ±0,05, amplitude absolue moyenne 0,053), courbe d'efficience du budget, et analyse de sensibilité au recouvrement train-test (16 des 944 motifs correspondent à un motif du panel, couvrant 18 individus sur 642 ; les exclure fait passer l'AUROC de 0,940 à 0,940). C'est le niveau de comptabilité qui manque à la quasi-totalité des papiers de distillation clinique.

Ce qui est moins bien

L'audit, qui est le cœur du papier, est entièrement descriptif. Le gradient monotone de 15,7 % à 0,7 % n'est accompagné d'aucun test, d'aucun intervalle, d'aucune p-valeur. La « réfutation » de l'hypothèse d'horodatage repose sur une comparaison qualitative — les lignes des médecins titulaires sont « plus concentrées » — sans quantification de cet écart. Les auteurs qualifient eux-mêmes leur audit de borne inférieure, puisqu'il détecte les comptes qui n'enregistrent jamais de positif et laisse passer tout comportement de remplissage par défaut plus subtil. La conclusion est probablement juste ; elle est présentée sans l'appareil qui permettrait au lecteur de le vérifier.

Le panel est enrichi à 40,3 % d'atteinte alors que le programme en enregistre 2,6 %, et il n'existe aucune table de caractéristiques des patients. Les auteurs signalent le premier point et refusent explicitement d'en tirer une performance en population — c'est à leur crédit. Mais toutes les AUROC groupées du papier vivent dans ce monde enrichi, et la métrique trompeuse guette : une AUROC de 0,940 sur une cohorte à 40 % de positifs ne dit rien de ce que le modèle ferait au seuil 0,10 sur la population réelle du dépistage. Plus gênant, l'âge, le sexe et le niveau d'éducation des 672 individus n'apparaissent nulle part en valeurs : ils ne figurent que comme variables d'entrée. Impossible, donc, d'évaluer le biais de population — quelle tranche d'âge, quelle proportion de femmes, quel niveau de scolarisation, dans un pays où l'éducation formelle des cohortes âgées varie énormément d'une province à l'autre. Le même angle mort touche l'évaluation : l'effectif efficace est estimé à environ 158 pour 642 individus, avec une corrélation intraclasse de 0,360 sur l'issue ; plusieurs résultats nuls sont donc indéterminés plutôt que des égalités établies, ce que les auteurs reconnaissent.

Le mot « pré-enregistré » revient quatre fois sans jamais être accompagné d'un identifiant. Ni registre, ni numéro OSF, ni DOI de protocole, ni date de dépôt. Dans un papier dont l'argument central est qu'il faut auditer la provenance des données avant de s'en servir, l'absence de provenance vérifiable de son propre protocole est une ironie coûteuse. S'y ajoutent trois faiblesses de même famille. Les données et le code sont annoncés comme « artefacts gelés régénérables par scripts publiés » mais restent disponibles sur demande auprès de l'auteur correspondant — rien n'est déposé publiquement. L'institution retenue comme site tenu à l'écart est exactement l'affiliation de l'auteur correspondant et de toutes les personnes remerciées pour la curation des données ; ce n'est pas une validation externe, et les auteurs ne la présentent d'ailleurs pas comme telle. Enfin, les bras 1,5B et 3B sont des Qwen2.5 tandis que les 4B et 8B sont des Qwen3, si bien que toute comparaison entre tailles confond l'échelle et la génération de modèle — y compris la conclusion la plus citable du papier, celle selon laquelle la pénalité de la chaîne de pensée rétrécit quand le modèle grandit.

Ce que ça change

Pour la communauté de recherche. Le résultat transférable n'est pas le score de 0,940, c'est la procédure de deux colonnes. Identifiant de l'opérateur, volume, positivité : ces trois champs existent déjà dans à peu près toutes les bases de service, et suffisent à découvrir que 40 % d'une colonne d'issue est un remplissage par défaut, avant qu'un seul modèle ne soit entraîné. Le second enseignement est plus dérangeant pour la mode actuelle : sur quelques centaines de cas spécialistes, une régression logistique à 21 variables bien calibrée n'est battue par aucun réglage fin, aucune optimisation de préférence, aucun renforcement. Le plafond est fixé par les instruments et par l'étalon, pas par la capacité du modèle. C'est le même verdict que dans notre décryptage sur la pancréatite aiguë sévère, où la forêt aléatoire tient tête au deep learning, et il continue de se vérifier.

Pour les cliniciens et les gestionnaires de programme. Le chiffre à retenir est 2,60 % contre 4,37 %. La prévalence apparente d'un dépistage national dépendait, pour moitié environ, du comportement de saisie de quelques centaines de comptes. Tout indicateur de pilotage construit sur cette colonne — couverture, taux d'orientation, rendement du dépistage — était faux dans la même proportion, indépendamment de toute question d'intelligence artificielle. Le second point pratique concerne la calibration : trois bras seulement produisaient des probabilités utilisables au seuil de 0,10 du programme, et plusieurs modèles par ailleurs performants en discrimination signalaient tout le monde. Une AUROC ne dit rien de ce qui se passe à un seuil donné, comme le montrait déjà notre lecture des scores de mortalité en réanimation et de leurs courbes de décision.

Pour les patients et le public. Sur 105 893 personnes évaluées par ce programme, la base a enregistré 1 trouble cognitif léger et 7 démences. Ce n'est pas une réalité épidémiologique : c'est la trace d'une colonne remplie par défaut. La conséquence n'est pas un mauvais diagnostic posé par une machine, mais quelque chose de plus banal et de plus répandu — des personnes réellement dépistées dont l'orientation n'a jamais été enregistrée, et une statistique de santé publique qui sous-estime le besoin. Le paradoxe final du papier mérite d'être dit tel quel : le meilleur modèle de l'étude n'a jamais vu une seule étiquette de médecin, et sa supériorité sur son propre professeur peut aussi bien s'expliquer par le fait qu'il moyenne le bruit du professeur que par le fait que l'étalon spécialiste lui-même est un enregistrement de routine bruité, à un seul lecteur, sans adjudication. Les deux mécanismes sont indiscernables ici, et les auteurs ne prétendent pas les séparer.

Pour aller plus loin

Le préprint : Default-filled outcome labels in a deployed cognitive-screening programme: an operator-level audit and the construction of twenty-four language-model arms, medRxiv, DOI 10.64898/2026.08.28.26361585, mis en ligne le 2 septembre 2026, sous licence CC BY 4.0. Auteurs : Jun Ji (Université de Qingdao, soumissionnaire), Zhigang Sun, Xiaofang Ying, Jinyu Hao, Zhiqiang Fu, Dongmei Shi, Xiaoming Kong, Yijie Xu, Xiaojuan Zhang, Xiaoli Du, Zhiyan Zhang, Xinhong Liu, Ping Lin, et Huali Wang (Peking University Sixth Hospital, autrice correspondante) — quatorze auteurs répartis sur des centres de santé mentale et des centres de santé communautaire de dix provinces chinoises. Approbation éthique : comité d'éthique du Medical College de l'Université de Qingdao, n° QDU-HEC-2025431, 22 mai 2025. Aucun financement spécifique, aucun conflit d'intérêts déclaré. Le jeu de données dé-identifié, le code d'analyse et les artefacts dérivés sont annoncés comme disponibles sur demande auprès de l'autrice correspondante ; les enregistrements source identifiables sont détenus par la Beijing Medical Award Foundation et ne peuvent être redistribués. Les auteurs déclarent avoir utilisé Claude (Anthropic) de manière extensive et sous leur direction pour écrire et réviser les scripts d'analyse et d'entraînement, construire l'outillage de vérification qui recoupe les chiffres du manuscrit avec les fichiers de résultats gelés, et rédiger le texte. Un papier compagnon, annoncé mais non encore identifié, réutilise les prédictions gelées de cette étude pour quantifier l'effet des choix de design d'évaluation par rapport au choix de modèle. Instruments cités : AD-8 (Galvin et al., Neurology 2005) et le Hong Kong Brief Cognitive Test, dérivé du CSI-D.