Bactériémie à Gram négatif en réanimation : trois modèles gelés, validés en prospectif, font moins bien qu'un score de chevet à quatre items

Une équipe d'infectiologie et de réanimation de l'hôpital de formation et de recherche Şişli Hamidiye Etfal, à Istanbul, a repris trois modèles d'apprentissage automatique développés chez elle pour prédire la bactériémie à bacilles Gram négatif en réanimation, les a gelés — ni réentraînement, ni réglage de seuil, sorties masquées pendant le recrutement — et les a testés en prospectif sur 289 hémocultures consécutives. Les trois plafonnent à une aire sous la courbe ROC de 0,61, c'est-à-dire moins bien que le Pitt Bacteremia Score (0,63) et le quick Pitt (0,64), deux scores de chevet qui se calculent en trente secondes sans ordinateur. Le chiffre de 0,70 mis en avant dans le résumé provient d'un sous-groupe de seize événements, qualifié de prédéfini dans les méthodes et de post-hoc dans le résumé, et la courbe de calibration du meilleur modèle montre un huitième décile de risque trois fois moins souvent bactériémique que le septième.

Le contexte

En réanimation, une bactériémie — la présence de bactéries vivantes dans le sang — se confirme par hémoculture, et l'hémoculture prend de vingt-quatre à soixante-douze heures. Pendant ce délai, le réanimateur doit décider seul : antibiotiques ou pas, lesquels, à quel spectre. Chaque heure de traitement inadapté compte sur la mortalité, particulièrement pour les bacilles Gram négatif de la famille des Enterobacterales. D'où l'idée, ancienne, d'un outil qui prédirait le résultat de l'hémoculture avant l'hémoculture.

Deux familles d'outils coexistent déjà, et elles ne servent pas la même chose. Les scores de gravité — SOFA, SIRS, NEWS-2 — mesurent la défaillance d'organes et l'ampleur de la réponse inflammatoire ; ils ont été construits pour stratifier un sepsis, pas pour deviner une hémoculture. Les scores spécifiques de la bactériémie — le Pitt Bacteremia Score (PBS) et sa version abrégée, le quick Pitt (qPitt) — ont été construits pour prédire la mortalité une fois la bactériémie confirmée. Aucun des cinq n'a été conçu pour la tâche évaluée ici.

Face à eux, la littérature d'apprentissage automatique sur le sepsis et la bactériémie est abondante. Elle a un défaut structurel que les auteurs citent eux-mêmes : seuls 6 à 14 % des modèles développés sur des données de réanimation ont fait l'objet d'une validation externe, et les performances y chutent presque toujours. L'équipe d'Istanbul avait publié en amont trois modèles entraînés rétrospectivement sur les données de routine de ses propres réanimations. Ce papier-ci est l'étape suivante, celle que presque personne ne franchit : aller les tester en conditions réelles, sans y toucher.

La méthode

Un design prospectif, des modèles verrouillés. Étude observationnelle monocentrique, du 1er février au 31 juillet 2025, dans les réanimations adultes de Şişli Hamidiye Etfal. Sont incluses les hémocultures prélevées chez des patients d'au moins 18 ans après au moins 48 heures de réanimation et répondant à la définition Sepsis-3 de l'infection suspectée : une culture prélevée dans les 24 heures suivant le début d'une antibiothérapie, ou une antibiothérapie débutée dans les 72 heures suivant la culture. Ce filtre est important et nous y reviendrons : il restreint l'analyse aux épisodes où un clinicien soupçonnait effectivement quelque chose.

323 hémocultures consécutives ont été recueillies. Ont été exclues 17 fongémies, 15 bactériémies à Gram positif et 2 espèces Gram négatif non éligibles. Restent 289 prélèvements : 192 négatifs et 97 bactériémies à Gram négatif, soit une prévalence de 33,6 %. Les 101 isolats sont dominés par Klebsiella pneumoniae (56,4 %), Acinetobacter baumannii (15,8 %) et Pseudomonas aeruginosa (11,9 %) ; 74,3 % sont résistants aux carbapénèmes et 39,6 % à la colistine. La porte d'entrée est respiratoire dans 61,9 % des cas.

Les trois modèles. Un Random Forest — une forêt d'arbres de décision qui votent — et deux variantes à effets mixtes : le BiMM (binary mixed model) et le MERF (mixed-effects random forest). Les « effets mixtes » ajoutent au modèle un terme propre à chaque patient, ce qui permet de traiter correctement plusieurs mesures répétées chez la même personne au lieu de les considérer comme indépendantes — pertinent ici, puisque chaque patient contribue une trajectoire de 48 heures de constantes et de biologie.

Ce qui rend la validation crédible. Les modèles ont été appliqués tels quels : mêmes variables, même fenêtre d'observation, aucun réentraînement, aucun réglage d'hyperparamètres. Les seuils de décision, dérivés par l'indice de Youden sur l'ensemble d'entraînement de l'étude de développement, ont été repris sans recalibration. Les sorties des modèles n'étaient pas accessibles pendant le recrutement, et les analyses n'ont été faites qu'une fois la collecte close. C'est la définition d'une validation temporelle propre.

Les comparateurs. ΔSOFA ≥ 2, SIRS ≥ 2, NEWS-2 ≥ 5, PBS ≥ 6, qPitt ≥ 3, plus le diagnostic de sepsis selon Sepsis-3, tous à seuils prédéfinis. Les données proviennent des 48 heures précédant le prélèvement, relevées à 10 heures du matin pour limiter les fluctuations intrajournalières, en analyse par cas complets. Analyses sous R 4.4.1, rapportées selon les grilles TRIPOD et STARD. L'étude est enregistrée sur ClinicalTrials.gov sous le numéro NCT07126106 — le 17 août 2025, soit dix-sept jours après la fin du recueil.

Les résultats

Dans la cohorte complète, les modèles perdent. AUROC de 0,61 pour les trois modèles, contre 0,64 pour le qPitt, 0,63 pour le PBS et pour le NEWS-2, 0,62 pour le ΔSOFA. L'exactitude équilibrée — la moyenne de la sensibilité et de la spécificité, qui corrige le déséquilibre entre les classes — va de 60 à 61 % pour les modèles. Les spécificités sont basses, de 43 à 50 %, et les valeurs prédictives positives tournent autour de 41-42 %. Le BiMM atteint la meilleure sensibilité parmi les modèles (78 %), mais le PBS fait 93 %.

Dans le sous-groupe, tout le monde s'améliore, et les scores plus vite que les modèles. Restreinte aux hémocultures prélevées entre le 4e et le 10e jour de réanimation, l'analyse porte sur 89 prélèvements dont 16 bactériémies. Les AUROC des modèles montent à 0,69-0,70 et l'exactitude équilibrée à 68 %. Mais le PBS atteint 0,77 et le qPitt 0,76. Le PBS à un seuil de 6 attrape 100 % des bactériémies ; le BiMM et le MERF montent à 90 % de sensibilité ; le Random Forest choisit l'autre bout du compromis, avec 74 % de spécificité pour 63 % de sensibilité.

La calibration du MERF est cassée. Les auteurs ont classé les patients en déciles de risque prédit et compté les bactériémies réelles dans chacun. Le taux monte régulièrement sur les sept premiers déciles, puis chute de 58,8 % au septième décile à 17,2 % au huitième. Il remonte ensuite sans jamais retrouver le niveau du septième. Autrement dit, les patients que le modèle désigne comme les plus à risque sont moins souvent bactériémiques que ceux qu'il place au milieu du classement.

Sans antibiotiques préalables, les modèles ne prédisent rien. Une analyse stratifiée exploratoire scinde la cohorte selon l'exposition à un antibiotique actif sur les Gram négatif avant le prélèvement. Chez les 65 patients non exposés, les AUC des trois modèles vont de 0,49 à 0,53 — le hasard. Chez les 224 patients exposés, elles remontent toutes à 0,65. La cohorte de développement comptait environ 70 % de patients déjà sous antibiotiques.

Traduction clinique. Prenons le MERF dans la cohorte principale, sur 1 000 hémocultures à 33,6 % de prévalence. Le modèle signalerait environ 620 patients ; 255 auraient effectivement une bactériémie à Gram négatif, 365 non. Il en manquerait 81. Autrement dit, trois alertes sur cinq sont fausses, et une bactériémie sur quatre passe sous le radar. Dans le sous-groupe, où la prévalence tombe à 18 %, la sensibilité de 90 % se paie plus cher encore : sur 1 000 prélèvements, environ 605 alertes pour 162 bactériémies réelles, soit près de trois alertes fausses pour une vraie. Le PBS à 100 % de sensibilité fait pire sur ce point : sa spécificité de 32 % donne une valeur prédictive positive de 24 %. Dans un service où 74 % des isolats résistent aux carbapénèmes, chaque faux positif est une escalade potentielle vers la colistine ou les nouvelles bêta-lactamines.

Un résultat négatif utile, glissé dans le tableau 1. Ni la CRP (181 ± 92 contre 175 ± 85 mg/L, p = 0,6), ni la procalcitonine (11 ± 27 contre 7 ± 22 ng/mL, p = 0,2), ni la température (37,2 °C dans les deux groupes, p = 0,4), ni les leucocytes (p = 0,070) ne distinguent les patients bactériémiques des autres. Ce qui distingue, ce sont l'âge (71 ± 17 contre 67 ± 16 ans, p = 0,046), la ventilation mécanique invasive (84 % contre 69 %), le cathéter veineux central (76 % contre 64 %), les vasopresseurs et surtout l'isolement d'un Gram négatif dans les trente jours précédents (57 % contre 34 %, p < 0,001). L'histoire microbiologique du patient bat les marqueurs d'inflammation.

Ce qui est bien

Les modèles ont été réellement gelés, et c'est rare. Pas de réentraînement, pas de recherche de seuil optimal a posteriori, les seuils de Youden de l'étude de développement repris à l'identique, et des sorties masquées pendant toute la collecte. La tentation inverse — reseuiller sur la cohorte de validation puis appeler le résultat « validation » — est le péché le plus répandu du domaine, et il gonfle mécaniquement les performances. Ici, le protocole interdit cette respiration. C'est exactement ce qui rend le chiffre de 0,61 croyable, et c'est aussi le même problème que celui posé par les seuils figés transportés d'un pays à l'autre.

Le comparateur est honnête, et il gagne. Les auteurs auraient pu opposer leurs modèles au SIRS seul, le plus faible des cinq scores (AUROC 0,57), et conclure à une supériorité. Ils ont mis dans la même table le PBS et le qPitt, les ont vus battre leurs propres modèles dans les deux cohortes, et l'ont écrit. Cette ligne du tableau 3 est le résultat le plus informatif du papier, et il dessert ses auteurs.

La population de validation est définie de manière défendable. En restreignant l'analyse aux épisodes remplissant la définition Sepsis-3 d'infection suspectée, les auteurs excluent les patients chez qui personne ne soupçonnait de bactériémie — précisément ceux dont l'inclusion gonfle artificiellement les spécificités dans beaucoup d'études antérieures, ce qu'ils nomment explicitement. Ajoutons la publication de la courbe de calibration par déciles, qui contredit leur propre modèle, et les grilles TRIPOD et STARD complétées.

Ce qui est moins bien

Le résultat mis en avant repose sur seize événements, et son statut change selon la page. Le sous-groupe des jours 4 à 10 compte 89 prélèvements et 16 bactériémies. Avec seize événements, l'incertitude sur une AUROC est considérable — et aucun intervalle de confiance n'accompagne la moindre valeur du tableau 3, ni pour les modèles ni pour les scores. Plus gênant : la section Méthodes décrit ce sous-groupe comme « prédéfini », le résumé le qualifie de « post-hoc ». Les deux ne peuvent pas être vrais, et l'enregistrement de l'étude sur ClinicalTrials.gov le 17 août 2025, dix-sept jours après la clôture du recueil, ne permet pas de trancher — un enregistrement rétrospectif ne protège d'aucun des biais qu'un enregistrement est censé prévenir. C'est le mode d'échec classique de la métrique trompeuse : le seul chiffre du résumé est celui de la strate la plus favorable et la moins peuplée.

L'étiquette de sortie est contaminée par le traitement. 78 % des patients recevaient déjà un antibiotique actif sur les Gram négatif au moment du prélèvement, et cette exposition était plus fréquente chez les culture-négatifs (82 % contre 69 %, p = 0,022). Une partie des « négatifs » sont donc vraisemblablement des bactériémies stérilisées par l'antibiothérapie : le modèle est noté contre une vérité de référence bruitée, exactement le problème documenté ailleurs sur les étiquettes extraites de la routine clinique. Les auteurs le reconnaissent, mais leur lecture de l'analyse stratifiée mérite d'être retournée : ils concluent que les modèles « conviennent mieux » aux patients déjà traités. On peut lire la même donnée autrement — chez les 65 patients non exposés, ceux dont l'étiquette est la plus fiable, les AUC de 0,49 à 0,53 signifient que les modèles n'ont aucun pouvoir discriminant. Le signal apparent n'existe que là où la vérité de référence est la plus douteuse. La question de savoir si les modèles captent une infection ou une trajectoire de prescription n'est pas tranchée.

La calibration invalide l'usage principal que l'on ferait du modèle. Une chute de 58,8 % à 17,2 % entre le septième et le huitième décile n'est pas une imprécision, c'est une inversion. Un modèle sert précisément à classer des patients par risque décroissant pour décider qui traiter en premier ; si son décile le plus haut est moins souvent malade que son décile médian, ce classement ne peut pas porter de décision. Les auteurs évoquent des variables au poids disproportionné et suggèrent que la zone intermédiaire pourrait, elle, être exploitable. Cette hypothèse est plausible, mais elle n'est pas testée, et aucune mesure standard de calibration — pente, intercept, score de Brier — n'est rapportée. Le même angle mort a déjà été relevé sur les politiques d'alerte en réanimation. À quoi s'ajoutent les limites de taille : un seul centre, aucun calcul d'effectif a priori, une analyse par cas complets, et une épidémiologie locale — 74 % de résistance aux carbapénèmes — qui n'est transposable presque nulle part en Europe de l'Ouest.

Ce que ça change

Pour la communauté de recherche, ce papier est utile pour ce qu'il ne trouve pas. Il documente, avec un protocole que peu d'équipes s'imposent, l'écart entre une performance de développement et une performance en conditions réelles sur des modèles verrouillés. La comparaison que les auteurs font eux-mêmes est éclairante : Bhavani et collègues obtenaient une AUROC de 0,78 sur 252 569 patients hospitalisés, Ming et collègues une AUROC de 0,97 sur 20 850 patients — mais dans le sous-groupe des bactériémies nosocomiales de cette dernière étude, l'AUROC retombait à 0,64, tout près des 0,61 d'Istanbul. La bactériémie acquise en réanimation, chez des patients déjà sous antibiotiques et déjà porteurs de flore résistante, semble être un problème intrinsèquement plus dur que la bactériémie à l'admission. La piste que ce travail ouvre est moins algorithmique que méthodologique : tant que l'étiquette « hémoculture négative » dépend du traitement reçu, aucune architecture ne réglera le problème, et il faudra le traiter explicitement.

Pour les cliniciens, la conclusion pratique est inconfortable pour le champ mais claire. Dans cette cohorte, le Pitt Bacteremia Score et le quick Pitt — cinq et quatre items, calculables de tête au lit du patient, gratuits, sans système d'information — font mieux que trois modèles d'apprentissage automatique nourris de quarante-huit heures de constantes et de biologie. Rien ici ne justifie de déployer un outil algorithmique pour cette tâche aujourd'hui. Et aucun des neuf outils testés, modèle ou score, n'a une valeur prédictive positive supérieure à 42 % : un signal positif ne suffit jamais à lui seul à déclencher une escalade, surtout dans un contexte de résistance où l'escalade signifie colistine ou bêta-lactamines de dernière ligne. Le résultat directement transférable au chevet n'est d'ailleurs pas un modèle : c'est le fait qu'un isolement de Gram négatif dans les trente jours précédents discrimine mieux que la CRP, la procalcitonine, la température et les leucocytes, qui ne discriminent pas du tout.

Pour les patients et le public, deux ordres de grandeur valent d'être retenus. Une AUROC de 0,70, souvent qualifiée de « modérée » dans les articles, ne signifie pas que le modèle a raison sept fois sur dix : elle signifie que si l'on tire au hasard un patient bactériémique et un patient qui ne l'est pas, le modèle attribue un risque plus élevé au bon dans 70 % des cas. Et une alerte positive, ici, est fausse environ trois fois sur quatre. C'est le prix ordinaire d'un outil réglé pour ne rien rater dans une maladie grave — un prix qui se paie en antibiotiques à large spectre, en effets indésirables et en pression de sélection sur les bactéries résistantes.

Pour aller plus loin

L'article : Prospective validation of machine learning models predicting Gram negative bacteremia in ICU versus clinical scores, npj Digital Medicine, publié le 14 septembre 2026, DOI 10.1038/s41746-026-03239-4, en accès ouvert sous licence CC BY-NC-ND 4.0. Auteurs : Ahmet Doğukan Bayrak, Olcay Dilken, Gizem Çamkerten, Hakkı Meriç Türkkan, Ceren Atasoy Tahtasakal, Mustafa Altınay, Dilek Yıldız Sevgi, İlyas Dökmetaş et Okan Derin — services de maladies infectieuses et de réanimation de l'hôpital Şişli Hamidiye Etfal (Istanbul), département de statistiques de l'université technique Yıldız, service de réanimation adulte de l'Erasmus MC de Rotterdam, et programme de doctorat d'épidémiologie de l'université Medipol d'Istanbul.

Enregistrement : ClinicalTrials.gov NCT07126106, déposé le 17 août 2025. Approbation éthique n° 2880 du comité de l'hôpital Şişli Hamidiye Etfal, 14 janvier 2025, avec consentement écrit des patients ou de leurs représentants légaux. Grilles TRIPOD et STARD fournies en matériel supplémentaire.

Données et code : ni les jeux de données dépersonnalisés ni le code d'analyse ne sont déposés dans un dépôt public ; les deux sont annoncés comme disponibles auprès de l'auteur correspondant sur demande raisonnable. Analyses sous R 4.4.1. Les auteurs déclarent n'avoir reçu aucun financement externe et n'avoir aucun conflit d'intérêts.

L'étude de développement des trois modèles, signée Dilken et collègues, porte sur les trajectoires cliniques et biologiques courtes en réanimation. Pour les comparateurs cités : le Pitt Bacteremia Score (Al-Hasan et Baddour, Clinical Infectious Diseases, 2020), le quick Pitt (Battle et collègues, Infection, 2019), et les définitions Sepsis-3 (Singer et collègues, JAMA, 2016).