Bacteriemia por gramnegativos en la UCI: tres modelos congelados, validados de forma prospectiva, rinden menos que una escala de cabecera de cuatro ítems
Un equipo de enfermedades infecciosas y medicina intensiva del Hospital de Formación e Investigación Şişli Hamidiye Etfal, en Estambul, tomó tres modelos de aprendizaje automático desarrollados en su propio centro para predecir la bacteriemia por bacilos gramnegativos en la UCI, los congeló — sin reentrenamiento, sin ajuste de umbral, con las salidas ocultas durante el reclutamiento — y los probó de forma prospectiva sobre 289 hemocultivos consecutivos. Los tres se quedan en un área bajo la curva ROC de 0,61, es decir, por debajo del Pitt Bacteremia Score (0,63) y del quick Pitt (0,64), dos escalas de cabecera que se calculan en treinta segundos y sin ordenador. La cifra de 0,70 destacada en el resumen procede de un subgrupo de dieciséis eventos, calificado de predefinido en los métodos y de post hoc en el resumen, y la curva de calibración del mejor modelo muestra un octavo decil de riesgo tres veces menos bacteriémico que el séptimo.
El contexto
En la UCI, la bacteriemia — bacterias vivas circulando en la sangre — se confirma mediante hemocultivo, y un hemocultivo tarda de veinticuatro a setenta y dos horas. Durante ese intervalo el intensivista decide solo: antibióticos o no, cuáles, con qué espectro. Cada hora de tratamiento inadecuado cuesta mortalidad, sobre todo en los bacilos gramnegativos de la familia Enterobacterales. De ahí la vieja idea de una herramienta que prediga el resultado del hemocultivo antes del hemocultivo.
Ya conviven dos familias de herramientas, y no sirven para lo mismo. Las escalas de gravedad — SOFA, SIRS, NEWS-2 — miden el fallo orgánico y la magnitud de la respuesta inflamatoria; se construyeron para estratificar una sepsis, no para adivinar un hemocultivo. Las escalas específicas de bacteriemia — el Pitt Bacteremia Score (PBS) y su versión abreviada, el quick Pitt (qPitt) — se construyeron para predecir la mortalidad una vez confirmada la bacteriemia. Ninguna de las cinco se diseñó para la tarea que aquí se evalúa.
Frente a ellas, la literatura de aprendizaje automático sobre sepsis y bacteriemia es abundante. Tiene un defecto estructural que los propios autores citan: solo entre el 6 % y el 14 % de los modelos desarrollados con datos de UCI han pasado por una validación externa, y en ella el rendimiento cae casi siempre. El equipo de Estambul había publicado antes tres modelos entrenados retrospectivamente con los datos de rutina de sus propias UCI. Este artículo es el paso siguiente, el que casi nadie da: ir a probarlos en condiciones reales, sin tocarlos.
El método
Diseño prospectivo, modelos bloqueados. Estudio observacional unicéntrico, del 1 de febrero al 31 de julio de 2025, en las UCI de adultos de Şişli Hamidiye Etfal. Se incluyeron hemocultivos extraídos a pacientes de 18 años o más tras al menos 48 horas de UCI y que cumplían la definición Sepsis-3 de infección sospechada: un cultivo obtenido en las 24 horas siguientes al inicio de la antibioterapia, o una antibioterapia iniciada en las 72 horas siguientes al cultivo. Ese filtro importa, y volveremos sobre él: restringe el análisis a los episodios en los que un clínico sospechaba realmente algo.
Se recogieron 323 hemocultivos consecutivos. Se excluyeron 17 fungemias, 15 bacteriemias por grampositivos y 2 especies gramnegativas no elegibles. Quedan 289 muestras: 192 negativas y 97 bacteriemias por gramnegativos, una prevalencia del 33,6 %. Los 101 aislamientos están dominados por Klebsiella pneumoniae (56,4 %), Acinetobacter baumannii (15,8 %) y Pseudomonas aeruginosa (11,9 %); el 74,3 % son resistentes a carbapenémicos y el 39,6 % a colistina. El foco fue respiratorio en el 61,9 % de los casos.
Los tres modelos. Un Random Forest — un bosque de árboles de decisión que votan — y dos variantes de efectos mixtos: el BiMM (binary mixed model) y el MERF (mixed-effects random forest). Los «efectos mixtos» añaden al modelo un término propio de cada paciente, lo que permite tratar correctamente varias mediciones repetidas en la misma persona en lugar de considerarlas independientes — pertinente aquí, ya que cada paciente aporta una trayectoria de 48 horas de constantes y analítica.
Lo que hace creíble la validación. Los modelos se aplicaron tal cual: mismas variables, misma ventana de observación, sin reentrenamiento, sin ajuste de hiperparámetros. Los umbrales de decisión, derivados mediante el índice de Youden en el conjunto de entrenamiento del estudio de desarrollo, se mantuvieron sin recalibrar. Las salidas de los modelos no estaban accesibles durante el reclutamiento, y los análisis solo se realizaron una vez cerrada la recogida. Esa es la definición de una validación temporal limpia.
Los comparadores. ΔSOFA ≥ 2, SIRS ≥ 2, NEWS-2 ≥ 5, PBS ≥ 6, qPitt ≥ 3, más el diagnóstico de sepsis según Sepsis-3, todos con puntos de corte predefinidos. Los datos proceden de las 48 horas previas a la extracción, registrados a las 10 de la mañana para limitar las fluctuaciones intradía, en análisis de casos completos. Análisis en R 4.4.1, reportados según las listas TRIPOD y STARD. El estudio está registrado en ClinicalTrials.gov con el número NCT07126106 — el 17 de agosto de 2025, diecisiete días después del cierre de la recogida.
Los resultados
En la cohorte completa, los modelos pierden. AUROC de 0,61 para los tres modelos, frente a 0,64 del qPitt, 0,63 del PBS y del NEWS-2, y 0,62 del ΔSOFA. La exactitud equilibrada — la media de sensibilidad y especificidad, que corrige el desequilibrio entre clases — va del 60 % al 61 % en los modelos. Las especificidades son bajas, del 43 % al 50 %, y los valores predictivos positivos rondan el 41-42 %. El BiMM logra la mejor sensibilidad entre los modelos (78 %), pero el PBS alcanza el 93 %.
En el subgrupo todos mejoran, y las escalas más deprisa. Restringido a los hemocultivos extraídos entre los días 4 y 10 de UCI, el análisis cubre 89 muestras con 16 bacteriemias. Las AUROC de los modelos suben a 0,69-0,70 y la exactitud equilibrada al 68 %. Pero el PBS llega a 0,77 y el qPitt a 0,76. El PBS con un corte de 6 captura el 100 % de las bacteriemias; el BiMM y el MERF alcanzan el 90 % de sensibilidad; el Random Forest elige el otro extremo del compromiso, con un 74 % de especificidad para un 63 % de sensibilidad.
La calibración del MERF está rota. Los autores ordenaron a los pacientes en deciles de riesgo predicho y contaron las bacteriemias reales en cada uno. La tasa sube de forma regular en los siete primeros deciles y luego cae del 58,8 % en el séptimo decil al 17,2 % en el octavo. Después vuelve a subir sin recuperar nunca el nivel del séptimo. Dicho de otro modo, los pacientes que el modelo señala como de mayor riesgo son menos bacteriémicos que los que sitúa en la mitad de la clasificación.
Sin antibióticos previos, los modelos no predicen nada. Un análisis estratificado exploratorio divide la cohorte según la exposición a un antibiótico activo frente a gramnegativos antes de la extracción. En los 65 pacientes no expuestos, las AUC de los tres modelos van de 0,49 a 0,53 — el azar. En los 224 pacientes expuestos, todas suben a 0,65. La cohorte de desarrollo tenía alrededor de un 70 % de pacientes ya bajo antibióticos.
Traducción clínica. Tomemos el MERF en la cohorte principal, sobre 1000 hemocultivos con una prevalencia del 33,6 %. El modelo señalaría a unos 620 pacientes; 255 tendrían efectivamente bacteriemia por gramnegativos, 365 no. Se le escaparían 81. Tres alertas de cada cinco son falsas, y una bacteriemia de cada cuatro pasa desapercibida. En el subgrupo, donde la prevalencia cae al 18 %, el 90 % de sensibilidad se paga aún más caro: por cada 1000 muestras, unas 605 alertas para 162 bacteriemias reales, es decir, casi tres alertas falsas por cada verdadera. El PBS con un 100 % de sensibilidad lo hace peor en este punto: su especificidad del 32 % da un valor predictivo positivo del 24 %. En un servicio donde el 74 % de los aislamientos resisten a los carbapenémicos, cada falso positivo es una escalada potencial hacia colistina o betalactámicos de última línea.
Un resultado negativo útil, escondido en la tabla 1. Ni la PCR (181 ± 92 frente a 175 ± 85 mg/L, p = 0,6), ni la procalcitonina (11 ± 27 frente a 7 ± 22 ng/mL, p = 0,2), ni la temperatura (37,2 °C en ambos grupos, p = 0,4), ni los leucocitos (p = 0,070) distinguen a los pacientes bacteriémicos del resto. Lo que sí los distingue: la edad (71 ± 17 frente a 67 ± 16 años, p = 0,046), la ventilación mecánica invasiva (84 % frente a 69 %), el catéter venoso central (76 % frente a 64 %), los vasopresores y, sobre todo, el aislamiento de un gramnegativo en los treinta días previos (57 % frente a 34 %, p < 0,001). La historia microbiológica del paciente gana a los marcadores de inflamación.
Lo que está bien
Los modelos se congelaron de verdad, y eso es raro. Sin reentrenamiento, sin búsqueda a posteriori de un umbral óptimo, con los cortes de Youden del estudio de desarrollo aplicados sin cambios y con las salidas ocultas durante toda la recogida. La tentación contraria — reajustar el umbral sobre la cohorte de validación y llamar al resultado «validación» — es el pecado más extendido del campo, y infla mecánicamente el rendimiento. Aquí el protocolo prohíbe ese margen. Eso es precisamente lo que hace creíble la cifra de 0,61, y es el mismo problema que plantean los umbrales fijos trasladados de un país a otro.
El comparador es honesto, y gana. Los autores podrían haber enfrentado sus modelos al SIRS solo, la más débil de las cinco escalas (AUROC 0,57), y proclamar superioridad. Metieron en la misma tabla el PBS y el qPitt, los vieron batir a sus propios modelos en ambas cohortes, y lo escribieron. Esa fila de la tabla 3 es el resultado más informativo del artículo, y juega en contra de sus autores.
La población de validación está definida de forma defendible. Al restringir el análisis a los episodios que cumplen la definición Sepsis-3 de infección sospechada, los autores excluyen a los pacientes en quienes nadie sospechaba una bacteriemia — precisamente aquellos cuya inclusión infla artificialmente la especificidad en muchos estudios previos, algo que ellos mismos nombran. Añádase la publicación de la curva de calibración por deciles, que contradice a su propio modelo, y las listas TRIPOD y STARD completadas.
Lo que está menos bien
El resultado destacado se apoya en dieciséis eventos, y su condición cambia según la página. El subgrupo de los días 4 a 10 contiene 89 muestras y 16 bacteriemias. Con dieciséis eventos, la incertidumbre sobre una AUROC es considerable — y ningún intervalo de confianza acompaña a ningún valor de la tabla 3, ni para los modelos ni para las escalas. Más incómodo: la sección de métodos describe ese subgrupo como «predefinido», el resumen lo llama «post hoc». Ambas cosas no pueden ser ciertas, y el registro del estudio en ClinicalTrials.gov el 17 de agosto de 2025, diecisiete días después del cierre de la recogida, no resuelve nada — un registro retrospectivo no protege de ninguno de los sesgos que un registro debe prevenir. Es el modo de fallo clásico de la métrica engañosa: la única cifra del resumen es la del estrato más favorable y menos poblado.
La etiqueta de resultado está contaminada por el tratamiento. El 78 % de los pacientes ya recibía un antibiótico activo frente a gramnegativos en el momento de la extracción, y esa exposición era más frecuente entre los cultivos negativos (82 % frente a 69 %, p = 0,022). Parte de los «negativos» son, por tanto, probablemente bacteriemias esterilizadas por la antibioterapia: el modelo se puntúa contra un patrón de referencia ruidoso, exactamente el problema documentado en otros trabajos sobre las etiquetas extraídas de la rutina clínica. Los autores lo reconocen, pero su lectura del análisis estratificado merece darse la vuelta: concluyen que los modelos «encajan mejor» en pacientes ya tratados. El mismo dato se lee de otro modo — en los 65 pacientes no expuestos, aquellos cuya etiqueta es más fiable, unas AUC de 0,49 a 0,53 significan que los modelos no tienen ningún poder discriminante. La señal aparente solo existe donde el patrón de referencia es más dudoso. Si los modelos captan una infección o una trayectoria de prescripción es algo que queda sin resolver.
La calibración invalida el uso principal que se le daría al modelo. Una caída del 58,8 % al 17,2 % entre el séptimo y el octavo decil no es imprecisión, es una inversión. Un modelo sirve precisamente para ordenar pacientes por riesgo decreciente y decidir a quién tratar primero; si su decil más alto está menos enfermo que su decil medio, esa ordenación no puede sostener una decisión. Los autores invocan variables con un peso desproporcionado y sugieren que la zona intermedia sí podría ser aprovechable. La hipótesis es plausible, pero no se prueba, y no se reporta ninguna medida estándar de calibración — pendiente, intercepto, puntuación de Brier. El mismo punto ciego ya se ha señalado en las políticas de alerta en cuidados intensivos. A esto se suman los límites de tamaño: un solo centro, ningún cálculo previo del tamaño muestral, análisis de casos completos y una epidemiología local — un 74 % de resistencia a carbapenémicos — casi intransferible a Europa occidental.
Lo que esto cambia
Para la comunidad investigadora, este artículo es útil por lo que no encuentra. Documenta, con un protocolo que pocos equipos se imponen, la distancia entre el rendimiento de desarrollo y el rendimiento en condiciones reales con modelos bloqueados. La comparación que hacen los propios autores es esclarecedora: Bhavani y colaboradores obtuvieron una AUROC de 0,78 en 252 569 pacientes hospitalizados, y Ming y colaboradores una AUROC de 0,97 en 20 850 pacientes — pero en el subgrupo de bacteriemias nosocomiales de este último estudio la AUROC bajaba a 0,64, muy cerca del 0,61 de Estambul. La bacteriemia adquirida en la UCI, en pacientes ya bajo antibióticos y ya colonizados por flora resistente, parece un problema intrínsecamente más difícil que la bacteriemia al ingreso. La vía que abre este trabajo es metodológica más que algorítmica: mientras la etiqueta «hemocultivo negativo» dependa del tratamiento recibido, ninguna arquitectura resolverá el problema, y habrá que abordarlo de forma explícita.
Para los clínicos, la conclusión práctica es incómoda para el campo pero clara. En esta cohorte, el Pitt Bacteremia Score y el quick Pitt — cinco y cuatro ítems, calculables de cabeza junto a la cama, gratuitos, sin necesidad de sistema de información — rinden más que tres modelos de aprendizaje automático alimentados con cuarenta y ocho horas de constantes y analítica. Nada de lo que hay aquí justifica desplegar hoy una herramienta algorítmica para esta tarea. Y ninguna de las nueve herramientas evaluadas, modelo o escala, supera un valor predictivo positivo del 42 %: una señal positiva nunca basta por sí sola para desencadenar una escalada, y menos en un contexto de resistencia donde escalar significa colistina o betalactámicos de última línea. El resultado directamente trasladable a la cabecera no es un modelo: es que el aislamiento de un gramnegativo en los treinta días previos discrimina mejor que la PCR, la procalcitonina, la temperatura y los leucocitos, que no discriminan en absoluto.
Para los pacientes y el público, conviene retener dos órdenes de magnitud. Una AUROC de 0,70, a menudo calificada de «moderada» en los artículos, no significa que el modelo acierte siete de cada diez veces: significa que si se toma al azar un paciente bacteriémico y otro que no lo es, el modelo asigna el riesgo más alto al correcto en el 70 % de los casos. Y una alerta positiva, aquí, es falsa unas tres de cada cuatro veces. Es el precio habitual de una herramienta ajustada para no dejar escapar nada en una enfermedad grave — un precio que se paga en antibióticos de amplio espectro, en efectos adversos y en presión de selección sobre las bacterias resistentes.
Para saber más
El artículo: Prospective validation of machine learning models predicting Gram negative bacteremia in ICU versus clinical scores, npj Digital Medicine, publicado el 14 de septiembre de 2026, DOI 10.1038/s41746-026-03239-4, en acceso abierto bajo licencia CC BY-NC-ND 4.0. Autores: Ahmet Doğukan Bayrak, Olcay Dilken, Gizem Çamkerten, Hakkı Meriç Türkkan, Ceren Atasoy Tahtasakal, Mustafa Altınay, Dilek Yıldız Sevgi, İlyas Dökmetaş y Okan Derin — servicios de enfermedades infecciosas y de medicina intensiva del Hospital Şişli Hamidiye Etfal (Estambul), departamento de estadística de la Universidad Técnica Yıldız, servicio de cuidados intensivos de adultos del Erasmus MC de Róterdam y programa de doctorado en epidemiología de la Universidad Medipol de Estambul.
Registro: ClinicalTrials.gov NCT07126106, depositado el 17 de agosto de 2025. Aprobación ética n.º 2880 del comité del hospital Şişli Hamidiye Etfal, 14 de enero de 2025, con consentimiento escrito de los pacientes o de sus representantes legales. Listas TRIPOD y STARD aportadas como material suplementario.
Datos y código: ni los conjuntos de datos anonimizados ni el código de análisis están depositados en un repositorio público; ambos se anuncian como disponibles a petición razonable al autor de correspondencia. Análisis en R 4.4.1. Los autores declaran no haber recibido financiación externa y no tener conflictos de intereses.
El estudio de desarrollo de los tres modelos, firmado por Dilken y colaboradores, trata sobre las trayectorias clínicas y analíticas cortas en cuidados intensivos. Para los comparadores citados: el Pitt Bacteremia Score (Al-Hasan y Baddour, Clinical Infectious Diseases, 2020), el quick Pitt (Battle y colaboradores, Infection, 2019) y las definiciones Sepsis-3 (Singer y colaboradores, JAMA, 2016).