PhysioFusion en cirugía cardíaca: qué cambia fusionar 26 señales intraoperatorias con el registro STS en 1 393 pacientes

Un equipo del Roux Institute (Northeastern University) y del Maine Medical Center construyó PhysioFusion, un conjunto de modelos que combina los datos preoperatorios del registro de la Society of Thoracic Surgeons (STS) con 26 señales de monitorización intraoperatoria para predecir complicaciones tras la cirugía cardíaca, en 1 393 pacientes de un solo hospital. El AUC llega a 0,87 en validación cruzada, pero las variables del registro por sí solas rinden igual (0,87): la señal intraoperatoria no aporta nada medible aquí. Debe leerse como un estudio interno honesto con un resultado negativo, no como prueba de que la fusión multimodal mejore la predicción.

El contexto

Tras una cirugía cardíaca, una proporción no desdeñable de pacientes sufre una complicación mayor (11,6 % en la cohorte estudiada): ventilación prolongada, ictus, insuficiencia renal, reintervención no planificada, infección profunda del esternón, muerte. En Estados Unidos, la Society of Thoracic Surgeons (STS) mantiene un registro nacional en el que se codifica cada operación, y sus puntuaciones de riesgo preoperatorio son la referencia para comparar centros. Estas puntuaciones solo usan lo que se sabe antes de la incisión.

Sin embargo, una operación de varias horas produce un flujo continuo de mediciones: presiones arteriales y venosas, electrocardiograma, saturación de oxígeno, temperatura, tiempos de circulación extracorpórea. La idea natural del artículo es que estas series temporales contienen una señal de riesgo que las variables preoperatorias no captan, y que un modelo que las fusione debería predecir mejor. Es un preprint publicado en medRxiv en septiembre de 2026 y aún no ha sido revisado por pares.

El método

Los datos. 1 393 pacientes adultos consecutivos operados en el Maine Medical Center (MaineHealth) entre septiembre de 2022 y abril de 2024, de los cuales 161 (11,6 %) presentaron al menos uno de los once eventos adversos avalados por la STS y el National Quality Forum, agrupados en un criterio compuesto. Las variables estáticas provienen de la base de datos de la STS (edad, antecedentes, función cardíaca, tipo de cirugía, duración de la circulación extracorpórea, etc.). Las series temporales cubren 26 señales intraoperatorias.

Los modelos. El núcleo es una red de dos ramas: una red residual (bloques apilados cuya salida se suma a la entrada, lo que estabiliza el entrenamiento) para las variables estáticas y, para las series temporales, una red convolucional (que detecta patrones locales en la señal) y una GRU bidireccional (una red recurrente que lee la serie en ambos sentidos). Junto a ella hay cuatro modelos clásicos: XGBoost (árboles de decisión sucesivos, cada uno corrigiendo los errores del anterior), regresión logística penalizada L1, una máquina de vectores de soporte (SVM) y una cascada de gradient boosting en dos etapas. Las predicciones se combinan con un promedio ponderado y se recalibran mediante regresión isotónica (una curva creciente que hace coincidir «el modelo dice 20 %» con «el 20 % de los pacientes tiene realmente el evento»).

La validación. Validación cruzada estratificada de cinco pliegues con mezcla: el conjunto se divide en cinco partes y cada una sirve por turno como prueba. El desequilibrio de clases se corrige con SMOTEENN (creación de casos positivos sintéticos y limpieza de los ambiguos), solo en los pliegues de entrenamiento. Se evalúan tres umbrales de decisión: uno que maximiza el valor predictivo positivo con sensibilidad ≥ 0,7, uno que maximiza el F1 y uno «equilibrado» en el que sensibilidad y especificidad coinciden.

Los resultados

Métricas de ML. En el umbral equilibrado, el modelo combinado obtiene un AUC (probabilidad de clasificar a un paciente con evento por encima de uno sin evento) de 0,87 (IC 95 % 0,82 a 0,91), sensibilidad 0,76, especificidad 0,83, valor predictivo positivo (VPP) 0,40 y valor predictivo negativo (VPN) 0,96. El error de calibración es de 0,036.

El resultado central es el desglose por modalidad. Las variables estáticas solas dan un AUC de 0,87 (0,82 a 0,92), sensibilidad 0,74, especificidad 0,82, VPP 0,45 y mejor calibración (0,023). Las series temporales solas dan 0,83 (0,80 a 0,86), con un VPP de 0,33. Los intervalos se solapan casi por completo: en esta cohorte, la fusión no mejora los datos del registro. Una ablación señal por señal concluye que ningún canal de monitorización es indispensable; la presión arterial media y la presión venosa central son las menos sustituibles. Entre los modelos individuales, el gradient boosting alcanza 0,86, la regresión logística 0,78, la SVM 0,69 y la red profunda 0,72 (0,60 solo con series temporales).

Traducción clínica. Para 1 000 pacientes operados con la prevalencia de la cohorte (116 eventos), una sensibilidad de 0,76 equivale a unas 88 complicaciones detectadas y 28 omitidas. Una especificidad de 0,83 entre los 884 pacientes sin evento supone unas 150 falsas alarmas. El cálculo directo da un VPP cercano a 0,37, algo por debajo del 0,40 notificado, probablemente por redondeos y por el cálculo por pliegue. En la práctica: unas dos de cada tres alertas serían falsas y algo más de una complicación de cada cuatro escaparía al modelo. El VPN de 0,96 tranquiliza, pero se debe sobre todo a lo raro del evento: predecir «sin complicación» para todos tendría un VPN de 0,88.

Lo que está bien

Un resultado negativo publicado sin maquillaje. Los autores informan de que las dos modalidades son sustituibles en lugar de presentar la fusión como un éxito. Es poco habitual en un campo donde la complejidad se vende a menudo como un valor en sí mismo, y es justo la información que necesita quien piense en equipar un quirófano.

Un protocolo de evaluación cuidado en los puntos técnicos. El reequilibrado SMOTEENN se limita a los pliegues de entrenamiento, los pliegues de prueba conservan la prevalencia real del 11,6 %, se informan tres umbrales operativos en lugar de uno y se dan intervalos de confianza. Cinco familias de modelos permiten ver que el resultado no depende de la elección de arquitectura.

Datos hospitalarios consecutivos y un criterio estandarizado. Los pacientes son consecutivos (sin selección de casos fáciles) y el criterio sigue las definiciones de la STS, no una definición ad hoc. El texto incluye una declaración de ausencia de conflictos de interés.

Lo que está peor

Una validación estrictamente interna (sesgo de población y de centro). Un solo hospital, 161 eventos, sin validación externa ni temporal: la validación cruzada mide el rendimiento en los mismos pacientes, el mismo quirófano y los mismos aparatos de monitorización. Los propios autores reconocen que el escaso número de eventos penaliza a los modelos de alta capacidad, lo que explica la mala puntuación de la red profunda (0,72), pero eso implica también que la comparación entre arquitecturas dice poco sobre lo que daría un conjunto mayor.

Un comparador ausente (comparador sesgado por omisión). El texto consultado no aplica ninguna puntuación de riesgo STS establecida. Es el comparador que importa: ¿es mejor un modelo con AUC 0,87 que la puntuación que el cirujano ya tiene a mano? Los comparadores internos son componentes del conjunto, no referencias clínicas. Sin ello, no se puede decir si el modelo supera la práctica actual.

Riesgos de fuga de información y una métrica que conviene leer con cautela (data leakage, métrica engañosa). El umbral «equilibrado» se elige sobre las predicciones evaluadas y la calibración isotónica se ajusta sobre predicciones de modelos; el texto consultado no precisa si ambos pasos están estrictamente separados de los pliegues de prueba, lo que podría hacer optimistas la sensibilidad, la especificidad y la calibración. Con una prevalencia del 11,6 %, un AUC de 0,87 se acompaña de un VPP de 0,40: la mayoría de las alertas serían falsas. El criterio compuesto de once eventos muy heterogéneos (una muerte y una reintervención no tienen el mismo mecanismo ni la misma prevención) complica además cualquier acción clínica dirigida. Por último, el código y los datos solo están disponibles previa solicitud.

Lo que cambia

Para la comunidad investigadora. El artículo aporta un caso de prueba útil: en una cohorte unicéntrica modesta, las señales intraoperatorias brutas no añaden nada a un registro bien cumplimentado. La pregunta siguiente es si esto se mantiene con más pacientes, validación externa y una representación de la señal mejor diseñada (preentrenamiento con grandes volúmenes de monitorización, por ejemplo), en lugar de apilar más redes sobre 161 eventos.

Para los clínicos. No cambia nada en la práctica: el modelo no está validado fuera del centro, no se compara con la puntuación STS y no se evalúa de forma prospectiva. Recuerda, sin embargo, que el registro preoperatorio ya contiene lo esencial de la señal predecible, lo que aboga por mejorar la calidad de la captura de datos antes de invertir en nuevos sensores o flujos de datos.

Para los pacientes y el público. Estos modelos no sustituyen el juicio del equipo quirúrgico. Una herramienta cuyas alertas aciertan una de cada tres veces sigue siendo una ayuda de triaje para el equipo, no un veredicto individual, y los pacientes no deben esperar a corto plazo una vigilancia «inteligente» en quirófano.

Para profundizar

El artículo (preprint, sin revisión por pares): PhysioFusion: A Multi-Modal Ensemble using Static Preoperative Variables and Time Series Intraoperative Data to Predict Adverse Events Following Cardiothoracic Surgery, Rajashekar Korutla, Anne Hicks, Marko Milosevic et al. (Roux Institute, Northeastern University; Spectrum Healthcare Partners; Maine Medical Center, MaineHealth), medRxiv, septiembre de 2026, DOI 10.64898/2026.09.24.26363920. Código y datos: bajo petición al autor de correspondencia, con acuerdo de uso de datos. Los autores declaran no tener conflictos de interés; la financiación no se identificó en el texto consultado.

Sobre modelos entrenados con muy pocos eventos, véase nuestro análisis sobre la recidiva precoz del carcinoma hepatocelular. Sobre un modelo de predicción clínica unicéntrico, véase nuestro análisis sobre la cirugía de Mohs.