L'écart preuve-dossier : ce que perdent dix-sept LLM quand il faut aller chercher l'information dans un vrai dossier de grossesse

Une équipe de l'université Fudan et de son hôpital d'obstétrique et de gynécologie a construit ObGynLongBench, un jeu d'évaluation de 1 500 points de décision extraits de 976 dossiers de grossesse réels, où chaque question est posée à une date précise avec effacement de tout ce qui vient après. Testés sur les mêmes cas, dix-sept modèles de langue répondent correctement dans 58,7 à 79,1 % des situations quand on leur sert les éléments pertinents, et dans 41,3 à 68,7 % seulement quand ils doivent aller les chercher eux-mêmes dans le dossier — un écart de 7,6 à 22,7 points que les auteurs appellent l'« Evidence-to-EHR Gap ». Le résultat est réel et la statistique est soignée, mais le benchmark n'a ni performance humaine de référence, ni condition témoin sans dossier, et ses étiquettes ont été fabriquées par les mêmes familles de modèles que celles qu'il évalue.

Le contexte

Depuis trois ans, la mesure de référence pour juger un modèle de langue en médecine est le questionnaire à choix multiples : USMLE, MedQA, PubMedQA et leurs déclinaisons spécialisées. Le format a un mérite — il est objectif et reproductible — et un défaut qui grandit à mesure que les scores montent : la question arrive avec sa vignette clinique déjà rédigée, triée, résumée. Les éléments qui comptent sont là, en trois cents mots, et rien d'autre n'encombre. Or ce n'est pas ce que fait un clinicien. Un clinicien ouvre un dossier.

Le dossier patient informatisé est long, redondant, mal ordonné, et surtout il contient une immense majorité d'informations qui ne servent à rien pour la décision du jour. Chez les auteurs, un seul point de décision obstétricale est précédé en moyenne de 479 résultats de biologie, 82 relevés de constantes, 25 notes cliniques, 6 comptes rendus d'échographie et 3 lignes de traitement. La durée médiane d'un dossier de grossesse suivi est de 184 jours. Mis bout à bout, cela représente en moyenne 30 800 jetons (unités de texte découpées par le modèle, à peu près des fragments de mots) avec un écart-type de 19 800 — bien plus qu'une vignette d'examen, bien moins que les fenêtres de contexte annoncées par les modèles récents.

La question posée par cette équipe est donc celle d'un chaînon manquant : un modèle qui répond juste quand on lui donne la preuve répond-il encore juste quand il doit aller la chercher ? Des travaux antérieurs ont exploré le dossier long (MedAlign, MIMIC-Instr, TIMER), mais en format ouvert, sans ancrage à une recommandation traçable ni frontière temporelle stricte. C'est ce double ancrage — une règle clinique identifiée, une date de coupure appliquée — qui fait l'originalité d'ObGynLongBench.

La méthode

Ce qui est mesuré. Chaque cas est une question à quatre options (A–D) portant sur une conduite à tenir, rattachée à une patiente, à une date dans la chronologie de sa grossesse, et à une règle issue d'un manuel ou d'une recommandation d'obstétrique. Tout ce qui est postérieur à cette date est supprimé du dossier fourni au modèle ; pour les cas hospitalisés, la coupure est fixée à l'admission et les diagnostics du jour sont effacés automatiquement. La métrique est unique : le taux de bonnes réponses. Aucune AUC, aucune sensibilité, aucune calibration — le format ne s'y prête pas, et c'est une limite en soi.

Le dispositif à trois portées. C'est le cœur du papier, et il est bien conçu. Les mêmes cas sont posés trois fois au même modèle, en ne changeant que ce qu'on lui donne à lire. En mode Evidence-only, seules les pièces justificatives pré-localisées sont fournies. En mode Visit-level, tous les enregistrements du même jour. En mode History-level, l'intégralité du dossier pré-décision. Comparer un modèle à lui-même d'une portée à l'autre isole proprement une chose de l'autre : ce que le modèle sait de la médecine, et ce qu'il est capable d'extraire d'un dossier. Les cas sont par ailleurs classés en trois niveaux : L1 (une preuve unique et visible), L2 (intégration de plusieurs sources dans la même visite), L3 (preuves distribuées dans le temps, typiquement à plus de sept jours de la décision).

Les données. 976 histoires de grossesse réelles, issues d'un hôpital tertiaire unique, en chinois, couvrant seize sous-spécialités obstétricales (troubles hypertensifs, diabète gestationnel, cholestase intrahépatique gravidique, dépistage du streptocoque B, grossesses multiples…). Les 1 500 cas ne sont pas indépendants : 976 correspondent au premier point de décision d'une patiente, 524 à un point ultérieur, 240 patientes en fournissant deux. La période de recueil, l'âge, la parité et l'origine des patientes ne sont pas rapportés.

Les modèles. Dix-sept, aucun entraîné par les auteurs : quatre commerciaux de gamme « rapide » (Claude-Haiku-4.5, GPT-5.4-mini, Gemini-3-Flash, DeepSeek-V4-Flash), huit ouverts à longue fenêtre (famille Qwen, Gemma, Phi) et cinq spécialisés santé (HealthGPT-Pro, Hulu-Med, Lingshu, MedGemma). Le mode de raisonnement étendu est désactivé sur les ouverts et les médicaux, actif par défaut sur les commerciaux. Six stratégies d'accès au dossier sont ensuite comparées : lecture directe, rendu en images, deux variantes de RAG (récupération de passages par similarité), résumé glissant, et agent en boucle d'outils.

La construction, elle, repose sur des LLM. L'extraction des règles depuis les recommandations est faite par GPT-5.3-Codex, l'attribution des niveaux L1/L2/L3 par Claude Opus 4.6, la rédaction des questions et des distracteurs par LLM, et la vérification de validité par des agents GPT-5.4-mini. Retenez ce point : il revient plus bas.

Les résultats

L'écart existe, et il est large. En Evidence-only, le meilleur modèle est Gemini-3-Flash à 79,1 %, suivi de Gemma-4-26B-A4B à 78,2 % et DeepSeek-V4-Flash à 78,8 %. En History-level, Gemini-3-Flash reste en tête mais tombe à 68,7 %. Claude-Haiku-4.5 passe de 75,5 à 59,8 (−15,7 points), GPT-5.4-mini de 77,4 à 64,9 (−12,5), Qwen3.5-35B-A3B de 76,9 à 60,1 (−16,8). Les dix-sept modèles perdent des points, sans exception, de −7,6 (Phi-4-mini) à −22,7 (MedGemma-1.5-4B). Les intervalles de confiance à 95 %, obtenus par rééchantillonnage groupé au niveau des patientes, font environ ±2,5 points : l'écart n'est pas du bruit.

La difficulté suit la dispersion de la preuve. Pour la quasi-totalité des modèles, L1 > L2 > L3. Gemini-3-Flash fait 66,0 / 71,5 / 65,0 ; Claude-Haiku-4.5 63,0 / 61,0 / 52,3 ; MedGemma-1.5-4B 45,8 / 43,5 / 29,7. Ce dernier chiffre mérite d'être regardé en face : avec quatre options, le hasard est à 25 %.

Les modèles médicaux ne sont pas meilleurs. L'écart entre le meilleur généraliste et le meilleur spécialisé santé passe de 4,2 points en Evidence-only à 7,4 points en History-level. Autrement dit, l'entraînement médical ajoute un peu de connaissance et rien de la capacité à lire un dossier.

L'erreur se propage à l'intérieur d'une même patiente. Sur les 1 500 cas, les modèles font systématiquement moins bien au deuxième point de décision qu'au premier — pour les dix-sept, de −1,86 à −10,88 points, moyenne −5,41, significatif à p < 0,1 pour douze d'entre eux. C'est le résultat de sécurité le plus intéressant du papier : une erreur précoce de lecture du dossier semble contaminer les décisions ultérieures pour la même patiente.

Parmi les stratégies d'accès, une seule aide vraiment. Rapportées à la lecture directe (59,6 %), le rendu en images perd 6,9 points, le RAG statique et le résumé glissant ne se distinguent pas du bruit, et seul l'agent en recherche active gagne — +4,6 points, à 64,2 %. Le bootstrap apparié confirme : Image −6,91 ± 1,59 et Agent +4,53 ± 1,60 sont les deux seuls écarts significatifs. À noter tout de même : l'agent consomme 35 786 jetons contre 30 951 pour la lecture directe, et le budget de calcul n'est pas égalisé entre stratégies.

Traduction clinique. Prenons 1 000 points de décision obstétricale de cette nature. Le meilleur modèle, servi en preuves, en manque 209. Le même modèle, devant le dossier complet, en manque 313 : une centaine de décisions basculent de juste à faux pour la seule raison que l'information devait être trouvée. Sur les cas L3 — ceux où la preuve est dispersée dans le temps, c'est-à-dire précisément le suivi de grossesse — MedGemma-1.5-4B en manque 703, soit à peine mieux que 750 pour un tirage au sort. Ces chiffres ne se transposent pas à une salle d'accouchement : ce sont des QCM, pas des consultations. Mais ils fixent un plafond, et ce plafond est bas.

Ce qui est bien

La frontière d'information pré-décision est prise au sérieux. C'est l'ingénierie la plus soignée du papier et la plus rarement faite correctement. Tout le postérieur est supprimé ; les diagnostics du jour d'admission aussi ; une liste explicite de cibles de nettoyage retire les notes et prescriptions antérieures qui énonceraient déjà la conduite retenue ; en revanche les biologies et constantes pré-coupure sont conservées par principe, pour ne pas rendre le cas insoluble. Sans cette discipline, on mesure la capacité d'un modèle à repérer la réponse déjà écrite dans le dossier — un cousin direct de la fuite circulaire qui ruine tant de benchmarks multimodaux.

La statistique est au-dessus de la moyenne du domaine. Les 1 500 cas ne sont pas indépendants puisque 240 patientes en fournissent plusieurs, et les auteurs le traitent : intervalles de confiance par bootstrap groupé au niveau de la patiente (10 000 rééchantillonnages, la patiente tirée emporte tous ses cas), bootstrap apparié pour comparer les stratégies d'accès sur les mêmes cas, tests unilatéraux avec valeurs p publiées modèle par modèle. Beaucoup de benchmarks d'IA médicale rapportent un pourcentage nu ; celui-ci rapporte son incertitude, et cette incertitude invalide explicitement plusieurs micro-écarts que le texte principal commente par ailleurs un peu vite.

Un audit clinicien indépendant, chiffré. Cent cas tirés au sort sur 1 500 ont été relus par trois internes d'obstétrique n'ayant pas participé à la construction, avec accès au dossier complet jusqu'à la coupure. Agrégat : 96 réponses de référence jugées correctes, 1 incorrecte, 3 incertaines ; qualité de la question jugée claire et pertinente dans 98 cas. L'accord inter-juges est rapporté par l'AC1 de Gwet (0,927 et 0,973) plutôt que par un kappa, choix correct quand les annotations se concentrent dans une seule catégorie. Enfin, le code d'évaluation est publié sous licence MIT, et l'intégralité des prompts figure en annexe.

Ce qui est moins bien

Il manque la condition témoin la plus élémentaire : la question sans le dossier. Les règles cliniques du benchmark viennent de recommandations publiques largement présentes dans les corpus d'entraînement. Aucun essai n'est fait avec l'énoncé et les quatre options seuls, sans aucune donnée de la patiente. On ne peut donc pas savoir quelle part des 79,1 % — et même des 68,7 % — s'obtient par simple restitution de recommandation et élimination de distracteurs. C'est une variante de la métrique trompeuse : le niveau de hasard (25 %) n'est jamais rappelé, aucune performance humaine n'est mesurée (les trois internes auditent les items, ils n'y répondent pas), et les chiffres se retrouvent sans échelle. Si une part substantielle du score est atteignable sans ouvrir le dossier, la thèse centrale du papier s'affaiblit d'autant.

Les étiquettes et les candidats viennent de la même industrie. GPT-5.4-mini est l'agent qui vérifie que chaque item est valide et répondable à partir des seules preuves pré-coupure ; il est aussi le deuxième meilleur modèle évalué (77,4 en Evidence, 64,9 en History, meilleur score L3 hors Gemini). Les items retenus sont, par construction, ceux qu'il juge solubles. DeepSeek-V4-Flash est simultanément juge des scores d'utilisation de preuve et modèle évalué — et, dans la matrice de robustesse fournie, c'est le juge le plus atypique des quatre (kappa pondéré 0,73–0,77 avec les autres, contre 0,83–0,85 entre eux). Les auteurs revendiquent d'avoir évité la circularité en choisissant un format fermé ; ils l'ont déplacée de l'évaluation vers la fabrication des étiquettes, ce qui n'est pas la même chose que l'avoir supprimée.

Une partie de l'écart mesuré est probablement un artefact technique, pas un déficit de raisonnement. Les deux chutes les plus spectaculaires — Hulu-Med-30A3 (−21,0) et MedGemma-1.5-4B (−22,7) — sont celles des deux modèles aux fenêtres de contexte les plus étroites (75 000 et 131 000 jetons), face à des entrées de 30 800 ± 19 800 jetons. Trois modèles font d'ailleurs mieux en Visit-level qu'en History-level, signature classique du débordement. Or aucun taux de troncature, de dépassement de fenêtre ou de réponse non analysable n'est publié. S'y ajoute une asymétrie assumée mais lourde : raisonnement étendu actif par défaut chez les commerciaux, désactivé chez les ouverts et les médicaux. Toute comparaison entre familles — y compris la conclusion « les modèles médicaux ne sont pas meilleurs » — en est biaisée. Il faut enfin noter le biais de population : un seul hôpital tertiaire chinois, en obstétrique, donc une file active orientée vers la grossesse à risque, sans aucune donnée démographique publiée, et un statut de diffusion des 1 500 cas qui n'est jamais explicité — seul le code est déclaré sous licence.

Ce que ça change

Pour la communauté de recherche, ce papier déplace utilement le curseur. Il montre qu'un score élevé sur un QCM avec vignette ne prédit pas la performance sur dossier réel, et il fournit un protocole — trois portées sur les mêmes cas — qui permet de séparer proprement la connaissance médicale de l'extraction d'information. C'est reproductible ailleurs, dans d'autres spécialités et d'autres langues, et ça devrait l'être. Le résultat sur l'agent en recherche active pointe par ailleurs une direction concrète : mieux vaut laisser un modèle interroger le dossier qu'espérer qu'il le lise bien d'un bloc. Le résultat sur la propagation d'erreur intra-patiente mérite à lui seul un travail dédié.

Pour les cliniciens, rien ne change aujourd'hui, et le papier ne prétend pas le contraire : sa section éthique dit explicitement qu'ObGynLongBench n'est pas un système d'aide à la décision. Le message opérationnel est ailleurs. Si un outil vous est présenté avec un score de benchmark, la question à poser est : évalué sur des vignettes rédigées, ou sur le dossier tel qu'il existe chez nous ? L'écart documenté ici, de dix à vingt points, est précisément celui qui sépare la démonstration du déploiement. C'est le même schéma que celui observé sur le triage conversationnel et sur la décision en mi-parcours : la performance chute dès que la situation cesse d'être pré-mâchée.

Pour les patientes et le public, la leçon est simple et durable. Un modèle qui « connaît » les recommandations n'est pas un modèle qui sait lire votre dossier. Les deux compétences sont distinctes, la seconde est de loin la moins avancée, et c'est elle qui compte dans un suivi de grossesse où l'information utile est dispersée sur six mois. Un chiffre de 68,7 % de bonnes réponses à un questionnaire ne dit rien de la sécurité d'un outil : il ne mesure ni la capacité à dire « je ne sais pas », ni la calibration de la confiance, deux propriétés que ce travail, comme la plupart des benchmarks en format fermé, ne mesure pas du tout.

Pour aller plus loin

Le préprint : ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making, arXiv:2609.07601, déposé le 7 septembre 2026, DOI 10.48550/arXiv.2609.07601, sous licence CC BY 4.0. Le code d'évaluation et les ressources sont annoncés sur GitHub, sous licence MIT ; le statut de diffusion des 1 500 cas eux-mêmes n'est pas précisé.

Financements déclarés : National Key R&D Program of China (2023YFF1204800), programme « AI for Science » de la commission municipale de Shanghai (2025-GZL-RGZN-BTBX-02028), National Natural Science Foundation of China (62406121), Shanghai Basic Research Program (25ZR1401034), avec des ressources de calcul de la plateforme CFFF de l'université Fudan. Aucune déclaration de conflits d'intérêts ne figure au manuscrit ; aucun auteur n'est affilié à un laboratoire produisant l'un des dix-sept modèles évalués.

Sur le même terrain, les benchmarks de dossier long antérieurs cités par les auteurs : MedAlign, MIMIC-Instr et TIMER, tous en format ouvert et sans ancrage à une recommandation traçable.