PrecepTron : un juge de 32 milliards de paramètres calibré sur un panel de médecins, et ce qu'il révèle sur les benchmarks cliniques
Une équipe de Harvard Medical School, du Beth Israel Deaconess Medical Center et de Stanford publie PrecepTron, un modèle de 32 milliards de paramètres affiné pour noter, à la place d'un jury de médecins, les réponses ouvertes des LLMs cliniques, accompagné de GRAND-ROUNDS, un jeu public de 9 217 notes attribuées par 11 médecins dans sept études déjà publiées. Le résultat qui compte n'est pas que PrecepTron atteigne l'accord inter-médecins sur trois tâches sur cinq, mais que les trois modèles propriétaires de pointe employés comme juges se contredisent entre eux jusqu'à 17 points sur les mêmes réponses avec la même grille. Et c'est en se servant de ce juge que les auteurs découvrent que GPT-5 décroche une bonne note sur 42 % des cas du New England Journal of Medicine avec moins de quarante mots d'énoncé.
Le contexte
Évaluer un modèle de langage en médecine a longtemps voulu dire lui faire passer des questionnaires à choix multiples — l'USMLE, des banques de QCM — où la réponse est unique et la notation automatique. Cette époque est close : les modèles saturent ces épreuves, et surtout elles ne ressemblent à rien de ce qu'un clinicien fait réellement. La littérature est donc passée aux réponses ouvertes : on demande au modèle un diagnostic différentiel, un plan de prise en charge, une note de consultation, et on fait noter sa production par des médecins selon une grille explicite.
Ce déplacement a rendu les benchmarks plus crédibles et l'évaluation beaucoup plus fragile. Plus crédible parce que le comparateur devient un humain sur une tâche réelle. Plus fragile parce que la note dépend désormais de qui note. Quels experts recrute-t-on — des généralistes ou des spécialistes, des médecins moyens ou de pointe, des universitaires ou des praticiens de ville ? Combien sont-ils ? S'accordent-ils entre eux ? Les études publiées dans JAMA, Nature Medicine ou Science reposent en général sur des jurys de deux à une dizaine de médecins, souvent d'une seule institution. Arjun Manrai, co-auteur senior de ce papier, a résumé le problème dans un commentaire paru dans Nature en 2026 sous le titre « Medical AI has a measurement problem ». La FDA, de son côté, a ouvert en 2026 une consultation sur la régulation des dispositifs médicaux fondés sur l'IA générative — autrement dit, ces notes vont bientôt peser sur des décisions réglementaires.
La réponse à la mode s'appelle LLM-as-a-judge : on confie la notation à un autre modèle de langage. C'est rapide, c'est reproductible à l'octet près, et c'est déjà utilisé pour trancher des questions sérieuses, comme celle de savoir si les modèles spécialisés en médecine valent mieux que les modèles généralistes. Deux obstacles. D'abord, un juge automatique peut être mal calibré et porter des biais propres — préférence pour les réponses longues, pour les textes écrits par une IA, pour ceux de sa propre famille de modèles. Ensuite, un juge propriétaire tourne chez son éditeur : envoyer des comptes rendus de patients à une API externe est inacceptable pour la plupart des hôpitaux. Ce papier attaque les deux fronts à la fois.
La méthode
Le jeu de données. GRAND-ROUNDS (Graded Responses and Annotated Notes for Diagnostic Reasoning on UNstructured Data Sets) agrège sept études publiées où des médecins avaient noté à la main des sorties de LLMs : 9 217 notes de médecins portant sur 5 250 couples réponse-grille, produits par 160 cliniciens et 9 modèles d'IA, évalués par 11 médecins. Six tâches, dont cinq servent aux expériences : diagnostic différentiel sur les Clinicopathologic Conferences du NEJM (noté par le score de Bond, échelle ordinale à cinq niveaux — 0, 2, 3, 4, 5 — où 5 signifie que le bon diagnostic figure dans le différentiel) ; les Landmark Diagnostic Cases de Goh et coll. 2024, notés sur une grille à 19 points qui crédite séparément les hypothèses, les arguments pour et contre, le diagnostic final et les examens proposés ; les Grey Matters Management Cases de Goh et coll. 2025, sur le raisonnement de prise en charge ; le NEJM Healer, qualité de la note de consultation selon la grille R-IDEA en 10 points ; et le BIDMC ER, précision diagnostique aux urgences du Beth Israel, issu de l'étude parue dans Science en 2026. La sixième tâche — plans d'examens des CPC — est publiée mais écartée des expériences parce que ses notes sont trop concentrées dans le haut de l'échelle.
Les juges comparés. Huit modèles en mode zéro-coup, c'est-à-dire avec la seule grille publiée dans le prompt : cinq ouverts (Qwen3.5-9B, Qwen3-32B, Gemma-3-12B, Llama-3.1-8B, Mistral-3-8B) et trois propriétaires (Claude Opus 4.6, Gemini 3.1 Pro, GPT-5), plus un ensemble des trois propriétaires dont la note est leur moyenne arrondie.
Le modèle. PrecepTron est un affinage supervisé de Qwen3-32B par LoRA (low-rank adaptation) : plutôt que de bouger les 32 milliards de poids, on n'entraîne que de petites matrices de rang faible greffées sur chaque couche d'attention et de projection, ce qui rend l'opération réalisable sur un seul GPU et limite mécaniquement la dérive du modèle. Rang 16, facteur d'échelle 32, dropout 0,05, AdamW, pic de taux d'apprentissage à 2 × 10⁻⁴, planification cosinus avec 3 % d'échauffement, lots effectifs de 4, séquences de 4 096 jetons, précision bfloat16, trois époques, sur un unique NVIDIA H100 de 80 Go. Un adaptateur distinct est entraîné par grille ; les CPC et le BIDMC ER partagent le leur puisqu'ils partagent le score de Bond. Les découpages sont faits par cas, jamais par réponse : 20 % des cas en entraînement pour les tâches d'au moins dix cas, seulement deux cas pour les deux tâches qui en comptent moins — soit 2 à 46 cas d'entraînement selon la tâche. Détail qui s'avérera décisif : les exemples d'entraînement sont rééchantillonnés par terciles de note (bas, moyen, haut) jusqu'à égaliser les effectifs, avec un plafond de cinq répétitions, pour empêcher le juge de s'installer dans la note la plus fréquente.
Les mesures. Critère principal, l'exactitude contre la note humaine de référence : « à un point près » sur l'échelle de Bond, « à 10 % près » de la note normalisée ailleurs. Critère secondaire, le kappa de Cohen pondéré quadratiquement — une mesure d'accord corrigée du hasard, qui pénalise d'autant plus les écarts qu'ils sont grands. Les deux sont systématiquement comparés à l'accord des médecins entre eux, calculé sur le sous-ensemble des réponses notées par au moins deux médecins. Intervalles de confiance à 95 % par bootstrap non paramétrique, 2 000 rééchantillonnages, graine fixée. Deux stratégies concurrentes sans mise à jour des poids sont testées sur les mêmes données : le few-shot à cinq exemples et l'optimiseur de prompt GEPA.
Les résultats
Les juges de pointe se contredisent. Sur les mêmes réponses, avec la même grille, les notes moyennes attribuées par les trois modèles propriétaires s'écartent de 17 points de pourcentage sur les Landmark Diagnostic Cases (Gemini 74 %, GPT-5 59 %, Claude 57 %) et de 9 points sur les CPC (GPT-5 80 %, Gemini 77 %, Claude 71 %, contre 88 % pour les médecins). Et ce désaccord n'est pas un décalage constant qu'on pourrait recalibrer : Claude est le plus sévère sur les CPC (71 % contre 88 % pour les médecins) et le plus indulgent sur le BIDMC ER (82 % contre 78 %). Aucun modèle de base n'atteint l'accord inter-médecins sur les cinq tâches. Les auteurs ont vérifié sur quatre des cinq tâches si un juge favorisait ses propres sorties : pas de préférence systématique détectée. La cinquième, le BIDMC ER, n'a pas pu être testée — son texte contient des données de patients, qui ne sortent pas de l'hôpital.
L'affinage léger comble l'écart. Entraîné sur 2 à 46 cas, PrecepTron-32B gagne de 4 à 15 points sur son modèle de base pour les cinq tâches : 82 % → 92 % sur les CPC, 46 % → 61 % sur les Landmark. Sur cette dernière tâche, la plus exigeante avec sa grille à 19 points, 93 réponses notées issues de deux cas suffisent à faire passer le kappa de 0,62 à 0,80. Le tableau complet, exactitude et kappa contre le repère humain : CPC, PrecepTron 92 % (κ = 0,71) contre 92 % (κ = 0,68) pour les médecins ; NEJM Healer, 81 % (κ = 0,80) contre 77 % (κ = 0,83) ; BIDMC ER, 91 % (κ = 0,60) contre 88 % (κ = 0,66) ; Landmark, 61 % (κ = 0,80) contre 67 % (κ = 0,92) ; Grey Matters, 80 % (κ = 0,78) contre 95 % (κ = 0,90). PrecepTron bat l'ensemble des trois modèles propriétaires sur deux tâches (CPC 92 % contre 83 %, Landmark 61 % contre 44 %) et l'égale sur les trois autres. Les deux stratégies par prompt échouent : le few-shot fait tomber le NEJM Healer de 76 % à 67 %, GEPA dégrade le raisonnement de prise en charge de 72 % à 63 %.
Reproduction de cinq études. Appliqué aux réponses des publications d'origine avec leurs grilles d'origine, cas d'entraînement exclus, PrecepTron retrouve les conclusions principales de cinq études : la précision diagnostique de GPT-4 chez Kanjee et coll. (JAMA, 2023), l'ordre relatif des notes R-IDEA entre chatbot, internes et seniors chez Cabral et coll. (JAMA Internal Medicine, 2024), la performance de GPT-4 comparable ou supérieure à celle des médecins équipés de ressources classiques chez Goh et coll. (2024 et 2025), et la progression de la précision diagnostique du triage à l'admission chez Brodeur et coll. (Science, 2026).
Le résultat le plus dérangeant. Avec un juge automatique, les auteurs peuvent faire ce qu'aucun jury humain ne financerait : donner à GPT-5 des préfixes de plus en plus longs de chaque cas, par paliers de dix jetons, et noter sa réponse à chaque palier. Sur les CPC, GPT-5 place le bon diagnostic dans son top-10 pour 42 % des cas avec 50 jetons ou moins — environ quarante mots — contre 14 % pour un top-3 et 12 % pour le diagnostic unique. Pour mémoire, la présentation de cas d'un CPC fait environ 1 600 jetons. Sur les cas de prise en charge, la saturation est plus rapide encore : quatre des cinq questions mises de côté atteignent 80 % du maximum de la grille en 50 jetons, trois d'entre elles en 10. Les quatre Landmark Diagnostic Cases y parviennent toutes en 50 jetons. Gemma-4-31B se comporte qualitativement pareil, en ayant besoin d'un peu plus de texte. La mémorisation ne l'explique pas : les 50 CPC retenus datent de 2025 ou après, postérieurs à la coupure d'entraînement des deux modèles, et les deux autres jeux n'avaient jamais été publiés en ligne. Un exemple du tableau 2 donne la mesure de la chose : sur « Un homme de 53 ans a été évalué en consultation de cardiologie pour une dysfonction ventriculaire gauche sévère avec un anévrisme api », 30 jetons, GPT-5 propose la maladie de Chagas en deuxième hypothèse — c'était le diagnostic.
Traduction concrète. Ce modèle ne touche aucun patient : il note des copies. L'unité de dégât n'est donc pas le faux négatif mais la conclusion publiée. Un écart de 17 points sur la note moyenne d'un jeu de cas, c'est exactement l'amplitude qui sépare un « le modèle fait mieux que les médecins » d'un « le modèle fait moins bien ». Si le choix du juge peut déplacer une moyenne de cette ampleur, alors une partie des titres de la littérature IA-santé de ces trois dernières années dépend d'un paramètre que presque aucune de ces études ne rapporte.
Ce qui est bien
Le résultat négatif sur les juges de pointe est le vrai apport, et il est irrécupérable par recalibrage. Montrer que trois modèles propriétaires notent les mêmes copies avec 17 points d'écart aurait suffi à faire un papier. Le détail qui compte est que ces écarts ne sont pas cohérents à l'intérieur d'un modèle : Claude sévère ici, indulgent là. Un biais constant se corrige par un décalage ; celui-ci ne se corrige pas, il faut mesurer par tâche. La démonstration est faite avec les moyens qu'il fallait — huit juges, cinq tâches, deux métriques dont une corrigée du hasard, intervalles bootstrap.
Les ablations vont chercher l'échec là où il se cache. Retirer le rééchantillonnage équilibré fait chuter le kappa de 0,72 à 0,51 sur le NEJM Healer à exactitude comparable : les auteurs publient la preuve que leur juge, sans cette précaution, s'effondre vers la note majoritaire en gardant l'air performant. Ils testent aussi le raccourci le plus tentant — un juge qui donnerait de meilleures notes à ce qui ressemble à du texte d'IA — en réentraînant sur les seules réponses humaines, et ne trouvent pas de raccourci. Chercher soi-même ses propres modes d'échec, puis les documenter dans le supplément, est rare.
La publication effective des données et du modèle, et la taille qui rend l'usage local possible. Les 9 217 notes de médecins, le code d'entraînement, les adaptateurs et — pour la première fois — le texte des Landmark Diagnostic Cases et des Grey Matters sont déposés sur Hugging Face et GitHub. Des annotations humaines issues de cinq études influentes deviennent un bien public réutilisable, ce qui est précisément ce qui permet à d'autres de contester le reste du papier. Et 32 milliards de paramètres tiennent sur un seul GPU de 80 Go : un centre hospitalier peut faire tourner le juge en interne. L'argument n'est pas théorique — c'est justement parce que le texte des urgences du BIDMC ne peut pas sortir de l'hôpital que les trois juges propriétaires n'ont pas pu y être testés sur la question de l'auto-préférence.
Ce qui est moins bien
La « reproduction » des cinq études est circulaire, et c'est un comparateur biaisé. Kanjee, Rodman, Crowe, Brodeur, Goh, Chen et Abdulnour sont co-auteurs de ce papier et des études qu'il reproduit. PrecepTron est entraîné sur 20 % des cas de ces mêmes corpus, avec les notes de ces mêmes jurys, puis « retrouve » les résultats sur les 80 % restants. C'est un contrôle de cohérence interne, pas une réplication indépendante : aucune étude d'une autre équipe, notée par un panel que les auteurs n'ont pas entraîné, n'est venue tester le dispositif. Les auteurs l'écrivent d'ailleurs sans détour dans leurs limites — reproduire une étude avec PrecepTron reproduit le standard d'évaluation de cette étude, pas le jugement clinique sous-jacent — mais la figure 4 dira « reproduit cinq études publiées », et c'est cette phrase qui circulera. Le même schéma de validation refermée sur elle-même avait été relevé ici à propos d'un benchmark dont les étiquettes venaient du modèle évalué.
Le critère principal est permissif, et une métrique contredit l'autre là où on ne regarde pas. « À un point près » sur une échelle de Bond qui ne compte que cinq niveaux tolère de confondre un 4 et un 5, c'est-à-dire un différentiel qui approche le diagnostic et un différentiel qui le contient. Surtout : sur le BIDMC ER, PrecepTron affiche 91 % d'exactitude mais son kappa recule de 0,68 (modèle de base) à 0,60, en dessous des 0,66 des médecins. Exactitude qui monte et accord corrigé du hasard qui descend, c'est la signature exacte d'un juge qui se replie sur la note fréquente d'une distribution déséquilibrée — le défaut que le rééchantillonnage était censé empêcher, et le motif pour lequel la sixième tâche a été retirée des expériences. Le papier expédie ce point en une incise (« a modestement décliné »). Ajoutons que la découverte des préfixes courts est établie avec ce juge, dont l'indulgence est précisément ce qui est en cause ; les auteurs signalent un cas limite où PrecepTron est probablement trop généreux, sans qu'une relecture humaine à l'échelle vienne trancher.
Ce qui est gelé dans les poids, c'est un panel, et sa composition n'est pas neutre. Les 11 médecins notateurs viennent en écrasante majorité de l'axe Boston-Stanford — Beth Israel Deaconess, Massachusetts General, Brigham and Women's, Harvard, Stanford. Le papier présente comme une fonctionnalité la possibilité de « changer de panel » pour rejouer une étude avec des spécialistes, ou de localiser un benchmark national ; mais ce qui est livré, c'est ce panel-là, universitaire et américain, dont les préférences latentes deviennent la référence contre laquelle d'autres modèles seront évalués. Un adaptateur par grille, entraîné sur 2 à 46 cas, et l'étape 2 du protocole le dit explicitement : une validation sur la tâche de quelqu'un d'autre ne se transfère pas. L'objet réutilisable est donc la recette, pas le juge. Enfin, ce préprint ne comporte ni déclaration de financement ni déclaration de conflits d'intérêts, la licence des données n'est pas précisée, et le texte des cas du BIDMC — la seule tâche portant sur de vrais passages aux urgences — n'est pas publié, ce qui rend cette partie invérifiable de l'extérieur.
Ce que ça change
Pour la communauté de recherche, le message opérationnel est double. D'abord, le juge devient un paramètre de méthode qu'il faut déclarer comme on déclare un réactif : modèle, version, prompts, données de calibration, accord juge-médecins mis en regard de l'accord médecins-médecins. Le protocole en cinq étapes donné en encadré est directement applicable et devrait devenir une exigence d'évaluation par les pairs. Ensuite, et c'est plus lourd : si un modèle décroche 42 % de bonnes réponses sur des cas du NEJM avec quarante mots, alors les grilles actuelles récompensent en grande partie la reconnaissance de forme — le rapprochement d'un âge, d'un sexe et d'un symptôme avec une présentation prototypique — et laissent non testé ce qui fait le raisonnement clinique : intégrer une information nouvelle, réviser une hypothèse, résister à la clôture prématurée. Les prochains benchmarks devront faire varier l'information dans le temps et créditer la révision, pas seulement la note finale.
Pour les cliniciens, rien ne change au lit du malade aujourd'hui. L'effet indirect mérite d'être anticipé : si les hôpitaux déploient des LLMs en clinique, il leur faudra une surveillance à l'échelle, et un juge local comme celui-ci est la forme que prendra vraisemblablement cette surveillance. Ce qui fait du juge un nouvel organe de sécurité — et un nouveau point de défaillance. Un juge mal calibré ne produit pas une erreur visible : il produit un tableau de bord rassurant. La grille de lecture à garder tient en une question, devant tout titre du genre « l'IA égale les médecins » : qui a noté, combien étaient-ils, et s'accordaient-ils entre eux ? La même prudence vaut pour les benchmarks cliniques évalués par des juges automatiques.
Pour les patients et le public, une distinction simple. Quand une dépêche annonce qu'un modèle a « résolu » des cas complexes, elle rapporte une note, et cette note a été donnée par quelqu'un — un petit jury de médecins, ou de plus en plus souvent une machine. Ce papier montre que ce quelqu'un change le résultat. Il montre aussi que les épreuves servant à couronner ces modèles se laissent en partie résoudre par une première impression sur une poignée de mots, ce qui est une manière de bien répondre sans avoir raisonné. Un modèle qui a l'air d'un excellent diagnosticien sur un benchmark n'a pas démontré qu'il saurait changer d'avis quand le patient, lui, ne rentre pas dans le prototype. Le même écart entre score de vignette et comportement réel a déjà été observé sur le triage conversationnel en conditions réelles.
Pour aller plus loin
Le papier : Scaling Clinical Judgment to Evaluate Medical AI, Thomas A. Buckley, Zahir Kanjee, Peter G. Brodeur, Byron Crowe, Anthony M. Pettinato, Aashna P. Shah, Adrian D. Haimovich, Liam G. McCoy, Daniel Restrepo, Ethan Goh, Jonathan H. Chen, Laura Zwaan, Katherine E. Goodman, Daniel J. Morgan, Raja-Elie E. Abdulnour, Adam Rodman et Arjun K. Manrai, préprint arXiv déposé le 11 septembre 2026, catégorie cs.AI, DOI 10.48550/arXiv.2609.12822. Non encore évalué par les pairs.
Affiliations : Department of Biomedical Informatics, Harvard Medical School ; Department of Medicine et Department of Emergency Medicine, Beth Israel Deaconess Medical Center ; Stanford Division of Hospital Medicine, Division of Computational Medicine et Clinical Excellence Research Center, Stanford University ; Division of Neurology, University of Alberta ; Institute for Medical Engineering and Science, MIT ; Department of Medicine, Massachusetts General Hospital ; Institute of Medical Education Research, Erasmus Medical Center, Rotterdam ; Department of Epidemiology and Public Health, University of Maryland School of Medicine et University of Maryland Institute for Health Computing ; VA Maryland Healthcare System ; Department of Pulmonary and Critical Care Medicine, Brigham and Women's Hospital. Adam Rodman et Arjun K. Manrai sont co-auteurs seniors.
Données et code : le code d'entraînement et d'évaluation, les prompts des juges et les lignes de base few-shot et GEPA sur github.com/2v/PrecepTron ; les adaptateurs PrecepTron-32B dans la collection Hugging Face ; le jeu GRAND-ROUNDS, qui inclut pour la première fois le texte des Landmark Diagnostic Cases et des Grey Matters Management Cases ; documentation sur preceptron.net. Le texte des cas des urgences du Beth Israel contient des données de santé identifiantes et n'est pas publié. La licence du jeu de données n'est pas précisée dans le préprint.
Financement et conflits d'intérêts : le préprint ne comporte aucune déclaration de financement ni de conflits d'intérêts. Sept des dix-sept auteurs sont co-auteurs des études que le papier entreprend de reproduire (Kanjee et coll. 2023, Cabral et coll. 2024, Goh et coll. 2024 et 2025, Brodeur et coll. 2026).
Aussi sur Tatakoto : un benchmark clinique allemand noté par un juge automatique, la fuite circulaire quand les étiquettes viennent du modèle évalué, et l'écart entre vignettes et triage réel.