Échec d'extubation : ce qu'ajoutent vraiment les notes de kinésithérapie respiratoire lues par un LLM — 1,9 point d'AUROC, et rien du tout l'année suivante

Une équipe de l'University of Washington fait lire par Llama-3-8B les notes de kinésithérapie respiratoire des douze heures précédant une extubation, en extrait neuf variables cliniques interprétables — quantité et épaisseur des sécrétions, force de la toux, fuite autour du ballonnet — et les ajoute à un modèle tabulaire qui prédit l'échec d'extubation sur 3 243 séjours de réanimation. Le gain est de 1,9 point d'AUROC, de 0,733 à 0,752, avec des intervalles de confiance qui se recouvrent presque entièrement et aucun test de significativité sur l'écart. Sur le seul découpage temporel du papier — entraînement 2021-2022, test 2023 — le gain s'inverse, et c'est cette ligne-là, reléguée en annexe, qui mérite d'être lue en premier.

Le contexte

Extuber un patient de réanimation, c'est retirer la sonde d'intubation et lui rendre sa respiration autonome. La décision se prend tous les jours, et elle est mauvaise dans les deux sens. Trop tôt : le patient se dégrade, il faut réintuber, et la réintubation est associée à une mortalité et à une durée de séjour plus élevées. Trop tard : chaque journée supplémentaire de ventilation invasive ajoute du risque de pneumonie acquise sous ventilation, de sédation prolongée et de faiblesse neuromusculaire acquise en réanimation.

L'outillage classique du sevrage est connu : l'épreuve de ventilation spontanée, l'indice de Tobin, le test de fuite autour du ballonnet. Les modèles d'apprentissage automatique publiés depuis dix ans affichent des AUROC de 0,83 à 0,85 — mais sur des cohortes dont les critères d'inclusion diffèrent au point de rendre la comparaison vide de sens, ce que les auteurs prennent la peine de tabuler. Certains n'exigent aucune durée minimale de ventilation, d'autres vingt-quatre heures ; certains définissent l'échec à deux jours, d'autres à sept.

Le trou que vise ce papier est ailleurs. Une partie de l'information sur laquelle le clinicien s'appuie réellement au lit du malade n'existe dans aucun champ structuré du dossier : le volume des sécrétions, leur épaisseur, la vigueur de la toux, la présence d'une fuite. Cette information ne vit que dans le texte libre des notes de kinésithérapie respiratoire, rédigées plusieurs fois par jour par les respiratory therapists, profession propre au système de santé nord-américain. La question posée est donc précise : si l'on transforme ce texte en variables, le modèle s'améliore-t-il ?

La méthode

La cohorte. Dossier patient informatisé reconstitué sur les trois hôpitaux d'University of Washington Medicine, entre avril 2021 et septembre 2023. Au départ, 10 194 patients ventilés sur 10 810 séjours, et 34 834 notes de kinésithérapie respiratoire antérieures à la première extubation. Après exclusions — 843 pour taille ou poids manquants, 4 711 sans épisode de ventilation invasive d'au moins vingt-quatre heures, 1 922 porteurs d'une consigne de non-réintubation ou de non-réanimation dans les sept jours suivant l'extubation, 91 doublons de patients — il reste 3 243 séjours. L'échec d'extubation est défini comme le décès ou le retour à la ventilation invasive dans les sept jours : 647 cas, soit 19,95 % — 618 réintubations et 29 décès.

L'extraction. Le modèle employé est Meta-Llama-3-8B-Instruct, à poids ouverts, en température 0,01. Point important : il ne s'agit ni d'embeddings — ces représentations numériques opaques d'un texte — ni de reconnaissance d'entités nommées, mais de classification de la note entière par amorçage à quelques exemples. Un prompt distinct par concept, une réponse contrainte (oui/non, faible/moyen/élevé), et la valeur « non étiqueté » quand le concept n'est pas mentionné. Quinze variables sont définies à partir de la littérature et de l'avis de pneumologues, réparties en cinq familles : aspirations, sécrétions, toux, bruits respiratoires, fuite au ballonnet.

La qualité de cette extraction est mesurée avant tout usage, ce qui n'est pas la norme : 400 notes annotées à la main, 200 pour construire les prompts et 200 pour les évaluer, avec relecture et correction par deux pneumologues de réanimation en exercice. Les macro-F1 par variable vont de 0,53 pour la toux spontanée à 0,99 pour les sécrétions épaisses. Six variables sont écartées pour F1 inférieur à 0,8 ou pour colinéarité — la présence d'aspirations corrèle à 0,808 avec la présence de sécrétions. Neuf survivent.

Les fenêtres. Les notes retenues sont celles des douze heures précédant l'extubation : 2 869 notes, couvrant 2 509 des 3 243 séjours — un quart de la cohorte n'a donc aucune note exploitable. Les variables structurées sont moyennées sur les quatre heures précédentes : constantes vitales, biologie, paramètres de ventilation, médicaments, trente-deux diagnostics d'admission, âge supérieur à 60 ans, sexe masculin documenté.

Les modèles. Régression logistique et gradient boosting, plus deux modèles de survie (Cox et gradient boosting de survie) binarisés à sept jours. Découpage par tirage aléatoire stratifié sur l'origine ethnique déclarée et sur l'issue : 646 séjours de test, soit 20 %. Validation croisée à huit plis sur le seul train, uniquement pour le réglage des hyperparamètres. Seuil de décision fixé à la prévalence du train, 0,201.

Les résultats

Les chiffres bruts. Sur l'ensemble de test, la régression logistique sur variables structurées seules atteint une AUROC de 0,729 (IC 95 % 0,684-0,775) ; avec les médicaments, 0,733 (0,684-0,783) ; avec les notes, 0,749 (0,701-0,795) ; avec les deux, 0,752 (0,703-0,794). L'AUPRC — l'aire sous la courbe précision-rappel, plus informative que l'AUROC quand les positifs sont rares — passe de 0,388 à 0,399. Le gradient boosting est uniformément moins bon, entre 0,669 et 0,671, pour cause de surapprentissage manifeste (0,782 sur le train contre 0,712 pour la régression logistique). Les notes seules donnent 0,605 (0,548-0,658) ; la seule durée de ventilation donne 0,658.

Le comparateur en place. L'hôpital déploie déjà une checklist d'aide à la décision. Sur le test, elle obtient 0,55 de sensibilité, 0,55 de spécificité et 21 % de précision. Le modèle monte la précision à 34 %. Sur les 81 patients en échec effectivement évalués par la checklist, celle-ci en signale 40, le modèle 59, et 32 sont communs aux deux — les auteurs concluent, correctement, que les deux outils sont complémentaires plutôt que substituables.

La traduction clinique. Au seuil retenu par les auteurs, sur 1 000 extubations dont 200 échouent : le modèle sans les notes détecte environ 139 échecs au prix de 264 fausses alertes ; avec les notes, environ 147 échecs pour 268 fausses alertes. Huit patients repérés en plus, quatre alarmes de plus. À sensibilité appariée en revanche — 74,2 %, soit 5 % d'échecs manqués — le taux de faux positifs tombe de 40,0 % à 34,1 %, ce que les auteurs traduisent par « cinq fausses alertes de moins pour cent patients ». L'analyse de courbe de décision donne un bénéfice net d'environ 0,01, soit un vrai positif supplémentaire pour cent patients traités, entre les seuils 0,17 et 0,22.

Ce que voit le modèle. Les coefficients de la régression logistique, toutes variables normalisées, placent en tête la durée de ventilation initiale (0,0955), la pression de plateau (0,0679), la SpO2 (−0,0664) et l'urée (0,0601). La quantité de sécrétions arrive treizième (0,0392), devant l'âge et la FiO2. C'est la seule variable issue des notes à entrer dans les quinze premiers coefficients, avec l'épaisseur des sécrétions et la toux faible dans le modèle élargi.

Ce qui est bien

L'extraction est validée avant d'être utilisée, et six variables sur quinze sont jetées. C'est le geste méthodologique qui distingue ce papier de la masse des travaux qui branchent une sortie de LLM directement sur un classifieur. Ici, 400 notes annotées à la main, relues par deux réanimateurs, un F1 publié pour chacune des quinze variables, et une règle d'élimination appliquée y compris quand elle coûte — la présence d'aspirations, à F1 0,873, est écartée pour colinéarité avec les sécrétions. Le choix de variables classifiées plutôt que d'embeddings denses est assumé comme un échange explicite d'expressivité contre de l'interprétabilité, ce qui est la position honnête. Le même arbitrage se posait dans l'extraction d'un indice de fragilité depuis les notes cliniques.

Toutes les analyses qu'on saute d'habitude sont faites. Calibration rapportée — score de Brier d'environ 0,14, pente de courbe supérieure à 1 pour les deux variantes, et les auteurs constatent eux-mêmes que les notes ne l'améliorent pas. Analyse de courbe de décision, qui chiffre le bénéfice net plutôt que de le supposer. Tableau de performance par sous-groupe. Ablation par permutation des colonnes de notes, qui fait bien disparaître le gain. Et surtout deux analyses de sensibilité qui manquent presque partout ailleurs : sur le seuil d'inclusion (une heure contre vingt-quatre heures de ventilation minimale) et sur la fenêtre de définition de l'événement, de douze heures à quatorze jours.

Le comparateur est l'outil réellement déployé, et la comparaison est rapportée sans arrangement. Beaucoup de papiers se mesurent à un score obsolète ou à rien. Celui-ci se mesure à la checklist que l'hôpital utilise, publie le tableau de recouvrement patient par patient, et en tire la conclusion défavorable au modèle : 32 des 40 patients signalés par la checklist le sont aussi par le modèle, donc l'un ne remplace pas l'autre. Le code est publié, les prompts finaux avec.

Ce qui est moins bien

Le gain est dans le bruit, et l'annexe H le montre. C'est le point central. L'écart de 1,9 point sépare deux intervalles de confiance qui se recouvrent sur presque toute leur longueur : 0,684-0,783 contre 0,703-0,794. Aucun test de significativité n'est rapporté sur cette différence — ni test de DeLong, ni bootstrap apparié — alors que le tableau 4 aligne quatorze bras, ce qui multiplie mécaniquement les occasions qu'un écart apparaisse. Et le papier fournit lui-même le contre-exemple : sur le découpage temporel, entraînement 2021-2022 et test 2023, l'AUROC est de 0,751 avec les variables extraites et 0,756 sans. Le gain s'inverse. Sur un sous-échantillon aléatoire de même taille, il revient : 0,761 contre 0,754. Autrement dit, l'effet entier tient dans l'écart entre deux façons de couper le même jeu de données. C'est la métrique trompeuse dans sa forme la plus ordinaire : un chiffre exact, un intervalle honnête, et une conclusion que l'intervalle ne porte pas.

Aucune ligne de base textuelle classique, et aucun centre extérieur. Le gain est établi contre le tabulaire seul. Ni TF-IDF, ni sac de mots, ni embeddings denses de notes ne sont testés — or c'est exactement la question qu'on se pose en lisant le titre : ces variables valent-elles mieux qu'une méthode de 1995 ? Les auteurs évoquent les embeddings en discussion, pour dire qu'ils seraient moins interprétables, jamais pour les évaluer. Quant au comparateur clinique, une checklist à 0,55 de sensibilité et 0,55 de spécificité est à peine meilleure qu'un tirage au sort : la battre n'établit pas grand-chose. Et il n'y a aucune validation externe ni prospective — les auteurs le justifient honnêtement (« aucun jeu de données comparable n'est disponible publiquement », les bases publiques de réanimation ne contiennent pas de notes de kinésithérapie respiratoire), mais la justification ne change rien au fait : la transportabilité est entièrement non testée.

Biais de population, et un écart entre sous-groupes qu'on ne peut pas trancher. Un seul système de santé, trois hôpitaux d'une même ville américaine, des notes en anglais uniquement — les auteurs signalent eux-mêmes que le pipeline pourrait ne pas tenir dans une autre langue. Le tableau par sous-groupe donne une AUROC de 0,673 chez les patients blancs (n = 2 009, le groupe de loin le plus nombreux) contre 0,820 chez les patients asiatiques (n = 225). Le modèle marche le plus mal sur le groupe pour lequel il a le plus de données, ce qui n'est pas le sens habituel du biais et n'est pas expliqué. Les auteurs précisent qu'aucune différence n'est significative sur 1 000 rééchantillonnages et que le test est trop petit pour en détecter une : c'est l'aveu que la question d'équité reste ouverte, pas une preuve d'équité. Ajoutons l'exclusion des 1 922 séjours porteurs d'une consigne de non-réanimation — près d'un séjour sur cinq, et précisément ceux où la composante « décès » de l'issue se serait déclenchée — et l'absence reconnue de contrefactuels de traitement : les patients à haut risque ont été traités, et rien dans ce dispositif ne permet de démêler le risque de la réponse au risque.

Ce que ça change

Pour la communauté de recherche, deux enseignements, dont un qui dépasse le sujet. Le premier : le motif « LLM comme extracteur de variables structurées » vaut surtout pour l'interprétabilité, pas pour l'exactitude. Le signal propre aux notes existe — 0,605 d'AUROC à elles seules, et la quantité de sécrétions entre dans les quinze premiers coefficients — mais il est largement redondant avec le tabulaire. Le second, plus important : ce papier contient, en annexe, la démonstration que son propre résultat principal ne survit pas à un découpage temporel. Toute équipe qui annonce deux points d'AUROC sans découpage temporel ni centre extérieur annonce du bruit jusqu'à preuve du contraire, et cette annexe H est le modèle de l'analyse qu'il faudrait exiger en évaluation par les pairs.

Pour les cliniciens, rien ne change au lit du malade. Deux chiffres méritent toutefois d'être retenus par quiconque fait tourner une alerte de sevrage. D'abord la charge d'alerte : à sensibilité appariée, environ cinq fausses alertes de moins pour cent extubations — c'est modeste, mais c'est la bonne unité, parce que la charge d'alerte est ce qui tue les modèles déployés en réanimation bien avant l'AUROC. Ensuite l'effet des critères d'inclusion : le même modèle affiche 0,796 quand on inclut les intubations courtes et 0,752 quand on ne les inclut pas, le taux d'échec passant de 11,3 % à 20,0 %. Aucune AUROC d'extubation publiée n'est interprétable sans ses critères d'inclusion, et la stratification le montre crûment : le modèle à seuil d'une heure rappelle 85,5 % des échecs chez les patients ventilés plus de vingt-quatre heures, et 25,8 % chez les autres.

Pour les patients et le public, une idée simple. Le retrait du tube respiratoire est une décision de jugement, prise chaque jour, qui tourne mal environ une fois sur cinq dans cette cohorte. Une IA qui lit les notes du kinésithérapeute ne décide pas : au mieux, elle signale. Et l'état honnête de l'art, c'est qu'elle signale environ huit patients de plus pour mille par rapport aux seules données chiffrées du dossier, au prix de quatre fausses alertes supplémentaires, dans un système hospitalier, dans une langue, sans qu'aucun autre hôpital l'ait jamais essayée. Ce n'est pas rien, et ce n'est pas ce qu'un communiqué en ferait.

Pour aller plus loin

Le papier : Enhancing Extubation Failure Prediction with LLM-Derived Features from Respiratory Therapy Clinical Notes, Izzy Chaiken, Aditya Khowal, Neha A. Sathe, Mark M. Wurfel et Lucy Lu Wang, déposé sur arXiv en septembre 2026, catégories cs.CL, cs.LG et physics.soc-ph, DOI 10.48550/arXiv.2609.17532. Publié à la Conference on Health, Inference, and Learning (CHIL) 2026, PMLR volume 333. Préprint sous licence CC BY 4.0.

Affiliations : Information School, Paul G. Allen School of Computer Science and Engineering et Department of Medicine, University of Washington, Seattle. Les troisième et quatrième auteurs sont pneumologues de réanimation en exercice à UW Medicine et ont contribué au schéma de classification et à l'interprétation. Protocole approuvé par la Human Subjects Division de l'University of Washington sous la référence STUDY00018582.

Code et données : le code d'entraînement et d'évaluation ainsi que les prompts finaux sont sur github.com/larchlab/extubation-failure-camera-ready. La licence du code n'est pas précisée dans le papier. Les données ne sont pas publiées : elles contiennent des informations identifiantes et résident sur un serveur conforme à la réglementation américaine sur la confidentialité des données de santé. Aucun poids n'est publié, le modèle n'ayant pas été affiné — Llama-3-8B-Instruct est utilisé tel quel, par amorçage à quelques exemples.

Financement : University of Washington Institute of Medical Data Science Pilot Award, programme de crédits cloud de l'eScience Institute de l'University of Washington, dons de l'Allen Institute for AI, et bourse NSF CSGrad4US pour la première autrice. Le papier ne comporte aucune déclaration de conflits d'intérêts.

Aussi sur Tatakoto : la transportabilité d'un modèle de réanimation d'une base à l'autre, l'analyse de courbe de décision appliquée à la mortalité en réanimation, et une validation prospective de modèles gelés en réanimation.