Fracaso de extubación: lo que realmente aportan las notas de fisioterapia respiratoria leídas por un LLM — 1,9 puntos de AUROC, y nada en absoluto al año siguiente

Un equipo de la University of Washington hace que Llama-3-8B lea las notas de fisioterapia respiratoria de las doce horas previas a una extubación, extrae de ellas nueve variables clínicas interpretables — cantidad y espesor de las secreciones, fuerza de la tos, fuga peribalón — y las añade a un modelo tabular que predice el fracaso de extubación en 3 243 estancias de cuidados intensivos. La ganancia es de 1,9 puntos de AUROC, de 0,733 a 0,752, con intervalos de confianza que se solapan casi por completo y ninguna prueba de significación sobre la diferencia. En la única partición temporal del artículo — entrenamiento 2021-2022, prueba 2023 — la ganancia se invierte, y es esa línea, relegada a un apéndice, la que merece leerse primero.

El contexto

Extubar a un paciente de cuidados intensivos significa retirar el tubo endotraqueal y devolverle su respiración autónoma. La decisión se toma a diario y resulta costosa en ambos sentidos. Demasiado pronto: el paciente se deteriora, hay que reintubar, y la reintubación se asocia a mayor mortalidad y estancias más largas. Demasiado tarde: cada día adicional de ventilación invasiva añade riesgo de neumonía asociada a la ventilación, sedación prolongada y debilidad adquirida en la unidad.

El instrumental clásico del destete es conocido: la prueba de ventilación espontánea, el índice de Tobin, la prueba de fuga peribalón. Los modelos de aprendizaje automático publicados en la última década declaran AUROC de 0,83 a 0,85 — pero sobre cohortes cuyos criterios de inclusión difieren hasta hacer vacía la comparación, algo que los autores se toman la molestia de tabular. Algunos no exigen duración mínima de ventilación, otros veinticuatro horas; unos definen el fracaso a dos días, otros a siete.

El hueco al que apunta este artículo está en otra parte. Parte de la información en la que el clínico realmente se apoya a pie de cama no existe en ningún campo estructurado de la historia: el volumen de las secreciones, su espesor, el vigor de la tos, la presencia de una fuga. Esa información solo vive en el texto libre de las notas de fisioterapia respiratoria, redactadas varias veces al día por los respiratory therapists, profesión propia del sistema sanitario norteamericano. La pregunta planteada es por tanto precisa: si ese texto se convierte en variables, ¿mejora el modelo?

El método

La cohorte. Historia clínica electrónica reconstruida en los tres hospitales de University of Washington Medicine, entre abril de 2021 y septiembre de 2023. De partida, 10 194 pacientes ventilados en 10 810 episodios y 34 834 notas de fisioterapia respiratoria anteriores a la primera extubación. Tras las exclusiones — 843 por talla o peso ausentes, 4 711 sin episodio de ventilación invasiva de al menos veinticuatro horas, 1 922 con orden de no intubar o no reanimar en los siete días siguientes a la extubación, 91 pacientes duplicados — quedan 3 243 episodios. El fracaso de extubación se define como fallecimiento o retorno a la ventilación invasiva en siete días: 647 casos, el 19,95 % — 618 reintubaciones y 29 fallecimientos.

La extracción. El modelo empleado es Meta-Llama-3-8B-Instruct, de pesos abiertos, a temperatura 0,01. Un punto importante: no se trata de embeddings — esas representaciones numéricas opacas de un texto — ni de reconocimiento de entidades nombradas, sino de clasificación de la nota completa mediante indicación con pocos ejemplos. Un prompt distinto por concepto, una respuesta restringida (sí/no, bajo/medio/alto) y el valor «sin etiquetar» cuando el concepto no se menciona. Se definen quince variables a partir de la literatura y del criterio de neumólogos, en cinco familias: aspiraciones, secreciones, tos, ruidos respiratorios, fuga peribalón.

La calidad de esa extracción se mide antes de cualquier uso, lo que no es la norma: 400 notas anotadas a mano, 200 para construir los prompts y 200 para evaluarlos, con revisión y corrección por dos neumólogos de cuidados intensivos en ejercicio. Los macro-F1 por variable van de 0,53 para la tos espontánea a 0,99 para las secreciones espesas. Se descartan seis variables por F1 inferior a 0,8 o por colinealidad — la presencia de aspiraciones correlaciona a 0,808 con la presencia de secreciones. Sobreviven nueve.

Las ventanas. Las notas retenidas son las de las doce horas previas a la extubación: 2 869 notas, que cubren 2 509 de los 3 243 episodios — una cuarta parte de la cohorte no tiene, pues, ninguna nota aprovechable. Las variables estructuradas se promedian sobre las cuatro horas anteriores: constantes vitales, laboratorio, parámetros de ventilación, medicación, treinta y dos diagnósticos de ingreso, edad superior a 60 años, sexo masculino documentado.

Los modelos. Regresión logística y gradient boosting, más dos modelos de supervivencia (Cox y gradient boosting de supervivencia) binarizados a siete días. Partición por muestreo aleatorio estratificado según origen étnico declarado y resultado: 646 episodios de prueba, el 20 %. Validación cruzada de ocho pliegues solo sobre el entrenamiento, únicamente para ajustar hiperparámetros. Umbral de decisión fijado en la prevalencia del entrenamiento, 0,201.

Los resultados

Las cifras en bruto. En el conjunto de prueba, la regresión logística con variables estructuradas solas alcanza un AUROC de 0,729 (IC 95 % 0,684-0,775); con la medicación, 0,733 (0,684-0,783); con las notas, 0,749 (0,701-0,795); con ambas, 0,752 (0,703-0,794). El AUPRC — área bajo la curva precisión-exhaustividad, más informativa que el AUROC cuando los positivos son escasos — pasa de 0,388 a 0,399. El gradient boosting es uniformemente peor, entre 0,669 y 0,671, por sobreajuste manifiesto (0,782 en entrenamiento frente a 0,712 de la regresión logística). Las notas solas dan 0,605 (0,548-0,658); la sola duración de ventilación da 0,658.

El comparador en uso. El hospital ya despliega una lista de verificación de apoyo a la decisión. En la prueba obtiene 0,55 de sensibilidad, 0,55 de especificidad y 21 % de precisión. El modelo eleva la precisión al 34 %. De los 81 pacientes con fracaso efectivamente evaluados por la lista, esta señala 40, el modelo 59, y 32 son comunes a ambos — los autores concluyen, correctamente, que las dos herramientas son complementarias más que sustitutivas.

La traducción clínica. En el umbral elegido por los autores, sobre 1 000 extubaciones de las que 200 fracasan: el modelo sin las notas detecta unos 139 fracasos a costa de 264 falsas alarmas; con las notas, unos 147 fracasos por 268 falsas alarmas. Ocho pacientes detectados más, cuatro alarmas más. A sensibilidad igualada, en cambio — 74,2 %, es decir 5 % de fracasos no detectados —, la tasa de falsos positivos cae del 40,0 % al 34,1 %, lo que los autores traducen como «cinco falsas alarmas menos por cada cien pacientes». El análisis de curva de decisión da un beneficio neto de unos 0,01, esto es un verdadero positivo adicional por cada cien pacientes tratados, entre los umbrales 0,17 y 0,22.

Lo que ve el modelo. Los coeficientes de la regresión logística, con todas las variables normalizadas, sitúan en cabeza la duración de la ventilación inicial (0,0955), la presión meseta (0,0679), la SpO2 (−0,0664) y la urea (0,0601). La cantidad de secreciones aparece en decimotercer lugar (0,0392), por delante de la edad y la FiO2. Es la única variable procedente de las notas que entra en los quince primeros coeficientes, junto al espesor de las secreciones y la tos débil en el modelo ampliado.

Lo que está bien

La extracción se valida antes de usarse, y se desechan seis variables de quince. Es el gesto metodológico que distingue este artículo de la masa de trabajos que enchufan una salida de LLM directamente a un clasificador. Aquí: 400 notas anotadas a mano, revisadas por dos intensivistas, un F1 publicado para cada una de las quince variables y una regla de eliminación aplicada incluso cuando cuesta — la presencia de aspiraciones, con F1 0,873, se descarta por colinealidad con las secreciones. La elección de variables clasificadas en lugar de embeddings densos se asume como un intercambio explícito de expresividad por interpretabilidad, que es la postura honesta. El mismo dilema se planteaba en la extracción de un índice de fragilidad a partir de notas clínicas.

Se hacen todos los análisis que habitualmente se omiten. Calibración reportada — puntuación de Brier de aproximadamente 0,14, pendiente de curva superior a 1 en ambas variantes, y los propios autores constatan que las notas no la mejoran. Análisis de curva de decisión, que cifra el beneficio neto en lugar de suponerlo. Tabla de rendimiento por subgrupo. Ablación por permutación de las columnas de notas, que hace desaparecer efectivamente la ganancia. Y sobre todo dos análisis de sensibilidad que faltan casi en todas partes: sobre el umbral de inclusión (una hora frente a veinticuatro horas de ventilación mínima) y sobre la ventana de definición del evento, de doce horas a catorce días.

El comparador es la herramienta realmente desplegada, y la comparación se reporta sin arreglos. Muchos artículos se miden contra una puntuación obsoleta o contra nada. Este se mide contra la lista de verificación que el hospital usa, publica la tabla de solapamiento paciente a paciente y extrae la conclusión desfavorable al modelo: 32 de los 40 pacientes señalados por la lista lo son también por el modelo, luego uno no sustituye al otro. El código está publicado, con los prompts finales incluidos.

Lo que está menos bien

La ganancia está dentro del ruido, y el apéndice H lo demuestra. Es el punto central. La diferencia de 1,9 puntos separa dos intervalos de confianza que se solapan en casi toda su longitud: 0,684-0,783 frente a 0,703-0,794. No se reporta ninguna prueba de significación sobre esa diferencia — ni prueba de DeLong, ni bootstrap pareado — pese a que la tabla 4 alinea catorce brazos, lo que multiplica mecánicamente las ocasiones de que aparezca alguna diferencia. Y el artículo aporta su propio contraejemplo: en la partición temporal, entrenando en 2021-2022 y probando en 2023, el AUROC es de 0,751 con las variables extraídas y 0,756 sin ellas. La ganancia se invierte. En una submuestra aleatoria del mismo tamaño reaparece: 0,761 frente a 0,754. Dicho de otro modo, el efecto entero cabe en la diferencia entre dos maneras de cortar el mismo conjunto de datos. Es la métrica engañosa en su forma más corriente: una cifra exacta, un intervalo honesto y una conclusión que el intervalo no sostiene.

Ninguna línea base textual clásica, y ningún centro externo. La ganancia se establece contra lo tabular solo. No se prueban ni TF-IDF, ni bolsa de palabras, ni embeddings densos de notas — y es exactamente la pregunta que uno se hace al leer el título: ¿valen estas variables más que un método de 1995? Los autores mencionan los embeddings en la discusión, para decir que serían menos interpretables, nunca para evaluarlos. En cuanto al comparador clínico, una lista con 0,55 de sensibilidad y 0,55 de especificidad apenas supera un sorteo: vencerla no establece gran cosa. Y no hay ninguna validación externa ni prospectiva — los autores lo justifican honestamente («no hay ningún conjunto de datos comparable disponible públicamente»: las bases públicas de cuidados intensivos no contienen notas de fisioterapia respiratoria), pero la justificación no cambia el hecho: la transportabilidad está enteramente sin probar.

Sesgo de población, y una brecha entre subgrupos que no puede zanjarse. Un solo sistema sanitario, tres hospitales de una misma ciudad estadounidense, notas únicamente en inglés — los propios autores señalan que el procedimiento podría no sostenerse en otra lengua. La tabla por subgrupo da un AUROC de 0,673 en pacientes blancos (n = 2 009, con mucho el grupo más numeroso) frente a 0,820 en pacientes asiáticos (n = 225). El modelo funciona peor en el grupo del que tiene más datos, lo que no es el sentido habitual del sesgo y no se explica. Los autores precisan que ninguna diferencia es significativa sobre 1 000 remuestreos y que la prueba es demasiado pequeña para detectar alguna: eso es admitir que la cuestión de equidad sigue abierta, no una prueba de equidad. Añádase la exclusión de los 1 922 episodios con orden de no reanimar — casi uno de cada cinco, y precisamente aquellos en los que se habría activado el componente «fallecimiento» del desenlace — y la ausencia reconocida de contrafactuales de tratamiento: los pacientes de alto riesgo fueron tratados, y nada en este diseño permite separar el riesgo de la respuesta al riesgo.

Lo que cambia

Para la comunidad investigadora, dos enseñanzas, una de las cuales desborda el tema. La primera: el patrón «LLM como extractor de variables estructuradas» rinde sobre todo en interpretabilidad, no en exactitud. La señal propia de las notas existe — 0,605 de AUROC por sí solas, y la cantidad de secreciones entrando en los quince primeros coeficientes — pero es ampliamente redundante con lo tabular. La segunda, más importante: este artículo contiene, en un apéndice, la demostración de que su propio resultado principal no sobrevive a una partición temporal. Todo equipo que anuncie dos puntos de AUROC sin partición temporal ni centro externo anuncia ruido mientras no se demuestre lo contrario, y ese apéndice H es el modelo del análisis que la revisión por pares debería exigir.

Para los clínicos, nada cambia a pie de cama. Dos cifras merecen sin embargo retenerse para quien haga funcionar una alerta de destete. Primero, la carga de alerta: a sensibilidad igualada, unas cinco falsas alarmas menos por cada cien extubaciones — modesto, pero es la unidad correcta, porque la carga de alerta es lo que mata a los modelos desplegados en cuidados intensivos mucho antes que el AUROC. Segundo, el efecto de los criterios de inclusión: el mismo modelo marca 0,796 cuando se incluyen las intubaciones cortas y 0,752 cuando no, pasando la tasa de fracaso del 11,3 % al 20,0 %. Ningún AUROC de extubación publicado es interpretable sin sus criterios de inclusión, y la estratificación lo muestra con crudeza: el modelo con umbral de una hora recupera el 85,5 % de los fracasos en pacientes ventilados más de veinticuatro horas, y el 25,8 % en el resto.

Para los pacientes y el público, una idea sencilla. Retirar el tubo respiratorio es una decisión de criterio, tomada a diario, que sale mal aproximadamente una vez de cada cinco en esta cohorte. Una IA que lee las notas del fisioterapeuta no decide: como mucho, señala. Y el estado honesto del arte es que señala unos ocho pacientes más por cada mil respecto a los solos datos numéricos de la historia, a costa de cuatro falsas alarmas adicionales, en un sistema hospitalario, en una lengua, sin que ningún otro hospital lo haya probado nunca. No es poco, y no es lo que haría de ello una nota de prensa.

Para saber más

El artículo: Enhancing Extubation Failure Prediction with LLM-Derived Features from Respiratory Therapy Clinical Notes, Izzy Chaiken, Aditya Khowal, Neha A. Sathe, Mark M. Wurfel y Lucy Lu Wang, depositado en arXiv en septiembre de 2026, categorías cs.CL, cs.LG y physics.soc-ph, DOI 10.48550/arXiv.2609.17532. Publicado en la Conference on Health, Inference, and Learning (CHIL) 2026, PMLR volumen 333. Preprint bajo licencia CC BY 4.0.

Afiliaciones: Information School, Paul G. Allen School of Computer Science and Engineering y Department of Medicine, University of Washington, Seattle. Los autores tercero y cuarto son neumólogos de cuidados intensivos en ejercicio en UW Medicine y contribuyeron al esquema de clasificación y a la interpretación. Protocolo aprobado por la Human Subjects Division de la University of Washington con la referencia STUDY00018582.

Código y datos: el código de entrenamiento y evaluación, junto con los prompts finales, están en github.com/larchlab/extubation-failure-camera-ready. La licencia del código no se especifica en el artículo. Los datos no se publican: contienen información identificativa y residen en un servidor conforme a la normativa estadounidense de confidencialidad de datos sanitarios. No se publica ningún peso, al no haberse ajustado el modelo — Llama-3-8B-Instruct se usa tal cual, mediante indicación con pocos ejemplos.

Financiación: University of Washington Institute of Medical Data Science Pilot Award, programa de créditos cloud del eScience Institute de la University of Washington, donaciones del Allen Institute for AI y beca NSF CSGrad4US para la primera autora. El artículo no incluye ninguna declaración de conflictos de interés.

También en Tatakoto: la transportabilidad de un modelo de cuidados intensivos de una base a otra, el análisis de curva de decisión aplicado a la mortalidad en cuidados intensivos, y una validación prospectiva de modelos congelados en cuidados intensivos.