SIMPLE-HF, una puntuación de mortalidad de 11 variables para la insuficiencia cardiaca: lo que cambia un Transformer destilado a partir de 373.000 pacientes británicos
Un equipo de la Universidad de Oxford construyó SIMPLE-HF, una puntuación de mortalidad para la insuficiencia cardiaca que condensa un modelo Transformer entrenado con las historias clínicas electrónicas de 373.389 pacientes británicos en solo 11 variables medibles de forma rutinaria, sin necesidad de ecocardiograma. En una cohorte de validación de 77.712 pacientes, la puntuación identifica el doble de muertes reales que MAGGIC-EHR —una versión del score de referencia MAGGIC adaptada a datos rutinarios— para el mismo número de pacientes señalados como de alto riesgo. El trabajo es metodológicamente sólido, pero sigue siendo una validación interna limitada a un único sistema de salud, frente a un comparador deliberadamente debilitado respecto al MAGGIC original.
El contexto
La insuficiencia cardiaca afecta a unos 64 millones de personas en el mundo y sigue siendo una de las patologías crónicas más letales de la medicina interna: una proporción importante de los pacientes diagnosticados muere en los cinco años siguientes. Estratificar ese riesgo —saber qué pacientes, ya sea en seguimiento ambulatorio o al alta hospitalaria, necesitan un seguimiento más estrecho, una escalada terapéutica o una valoración especializada— condiciona directamente la asignación de recursos de cardiología.
La herramienta más utilizada para ello, MAGGIC (Meta-Analysis Global Group in Chronic Heart Failure), se construyó en 2013 a partir de un metaanálisis de trece cohortes. Combina variables clínicas simples (edad, presión arterial, frecuencia cardiaca) con datos que requieren una prueba especializada: la clase funcional NYHA (disnea según el esfuerzo) y la fracción de eyección del ventrículo izquierdo (FEVI), medida por ecocardiograma. El equipo de Oxford documenta un problema doble. Por un lado, MAGGIC discrimina mal: su capacidad para distinguir a un paciente de alto riesgo de uno de bajo riesgo sigue siendo modesta. Por otro, sus variables clave suelen faltar en las historias clínicas electrónicas (HCE) rutinarias, simplemente porque no se realizó un ecocardiograma reciente. Los modelos de IA más complejos, entrenados directamente sobre las secuencias longitudinales de las HCE, son más precisos, pero siguen siendo cajas negras difíciles de integrar en un circuito asistencial y de hacer aceptar a los clínicos.
El objetivo del artículo es escapar de este dilema: conservar la precisión de un modelo complejo entrenado con datos longitudinales, sin conservar su complejidad de uso.
El método
El equipo trabajó con CPRD Aurum (Clinical Practice Research Datalink), que agrega los registros de atención primaria de una parte representativa de la población inglesa. De 19.094.480 personas, se seleccionaron 373.389 adultos con un diagnóstico incidente de insuficiencia cardiaca entre 2010 y 2020. Un detalle metodológico destacable: la separación entre los datos de entrenamiento (1.153 consultorios, 295.677 pacientes) y de validación (289 consultorios, 77.712 pacientes) se hizo a nivel de consultorio médico, no de paciente individual, para evitar que el estilo de codificación propio de un mismo profesional apareciera a la vez en el conjunto de entrenamiento y en el de prueba, lo que habría inflado artificialmente el rendimiento medido (un caso clásico de fuga de datos o data leakage).
La construcción del modelo final, SIMPLE-HF (Simplified Intelligent Mortality Prediction for Longitudinal EHRs), siguió tres pasos. Primero, se entrenó un modelo de referencia —un perceptrón multicapa (MLP), un tipo de red neuronal simple de varias capas— dentro de un marco de supervivencia (SODEN, que no modela un resultado binario sino el tiempo hasta la muerte) usando las variables del score MAGGIC. Después, un modelo Transformer independiente —la arquitectura que hizo posibles los grandes modelos de lenguaje, aplicada aquí a la secuencia temporal de diagnósticos y prescripciones de cada paciente— se entrenó con la totalidad de los datos longitudinales de la cohorte para identificar qué comorbilidades aportaban más información pronóstica. Finalmente, se utilizó SHAP (SHapley Additive exPlanations, que asigna a cada variable una contribución cuantificada a la predicción, tomada de la teoría de juegos cooperativos) para destilar ese conjunto de 21 variables candidatas hasta un modelo final de solo 11: año de nacimiento, edad, índice de masa corporal, tiempo transcurrido desde el diagnóstico de insuficiencia cardiaca, prescripción de betabloqueantes o IECA/ARA-II, y antecedentes de cáncer, insuficiencia renal aguda, neumonía, parada cardiaca, insuficiencia respiratoria y enfermedad pulmonar obstructiva crónica (EPOC).
El Transformer no es, por tanto, el modelo final: es una herramienta de descubrimiento de variables, cuyos hallazgos se transfieren después a una puntuación simple, calculable con datos presentes en cualquier historia clínica de atención primaria, sin ecocardiograma. Para la comparación, los autores tuvieron que construir MAGGIC-EHR, una versión del score MAGGIC original adaptada a los datos disponibles de forma rutinaria, ya que la ausencia de la clase NYHA y la FEVI habría hecho imposible la comparación en gran parte de la cohorte.
Los resultados
En la cohorte de validación, SIMPLE-HF alcanza un índice C de 0,801 (IC 95 %: 0,795–0,806) frente a 0,735 (0,728–0,741) de MAGGIC-EHR. El índice C mide la probabilidad de que, para dos pacientes elegidos al azar, el modelo clasifique correctamente cuál morirá primero: 0,5 equivale a un resultado aleatorio y 1,0 a una clasificación perfecta. En el AUPRC (área bajo la curva precisión-exhaustividad, más informativa que el AUC clásico cuando los eventos son frecuentes —aquí, aproximadamente un 42 % de mortalidad a cinco años—), la diferencia es similar: 0,684 frente a 0,560. Ambos modelos se mantienen bien calibrados: sus curvas de calibración, suavizadas mediante regresión spline, permanecen cerca de la referencia ideal.
Traducción clínica: con un umbral de riesgo del 60 %, de cada 1.000 pacientes cribados, SIMPLE-HF señala a 257 como de alto riesgo, de los cuales 199 morirán realmente, frente a 145 pacientes señalados y solo 99 muertes entre ellos con MAGGIC-EHR. Dicho de otro modo, con una carga de trabajo clínica comparable (poco menos de 260 pacientes por reevaluar de cada 1.000), SIMPLE-HF detecta el doble de muertes reales. Con un umbral del 50 % para la mortalidad a 12 meses, la puntuación identifica 4.218 verdaderos positivos adicionales y reduce en 4.818 el número de muertes no detectadas, con una ganancia de 7,2 puntos de valor predictivo positivo. El análisis de curva de decisión (decision curve analysis), que mide el beneficio neto de una herramienta de decisión en distintos umbrales clínicos, confirma la ventaja de SIMPLE-HF en todo el rango de umbrales probados, hasta aproximadamente el 60 %.
Lo que está bien
Una escala de validación poco frecuente en este campo. 373.389 pacientes seguidos durante una década (2010-2020), procedentes de una base de datos que cubre una parte representativa de la población inglesa: un orden de magnitud muy superior al de la mayoría de las puntuaciones de riesgo cardiovascular publicadas, muchas de las cuales se basan en cohortes de solo unos miles de pacientes.
Una separación entrenamiento/validación que se toma en serio la fuga de datos. Separar por consultorio médico en lugar de por paciente individual es una precaución metodológica correcta y pocas veces documentada con tanta claridad: impide que el estilo de codificación propio de un consultorio aparezca a la vez en el entrenamiento y en la prueba.
Una doble lectura clínica completa. Más allá del índice C, los autores aportan un análisis de curva de decisión y una traducción en verdaderos positivos y falsos negativos ganados por cada 1.000 pacientes cribados: exactamente el tipo de conversión que hace que una puntuación sea utilizable por un clínico y no solo una cifra de rendimiento abstracta. La puntuación final no exige ninguna prueba especializada, lo que la convierte en una herramienta potencialmente implementable en atención primaria.
Lo que no está tan bien
Ninguna validación externa: el modo de fallo más clásico de las puntuaciones de riesgo de IA en salud. Pese a su escala, toda la validación sigue siendo interna a una única base de datos, un único país, un único sistema de salud (el NHS inglés). Los propios autores lo reconocen explícitamente en sus limitaciones: «se necesita una validación externa adicional en cohortes internacionales diversas y sistemas de salud distintos para confirmar la generalizabilidad de nuestro enfoque en otros contextos». Separar por consultorio limita el riesgo de fuga de datos, pero no garantiza nada sobre la transportabilidad a un sistema de codificación distinto (por ejemplo, registros hospitalarios estadounidenses) o a una población con comorbilidades diferentes.
Un comparador debilitado por diseño. MAGGIC-EHR no es el score MAGGIC original: es una adaptación de la que los autores tuvieron que retirar variables predictivas importantes —la clase NYHA y la FEVI— porque no las encontraron en los datos rutinarios. Parte de la diferencia de rendimiento medida (0,801 frente a 0,735) refleja, por tanto, tanto la superioridad real de SIMPLE-HF como el hándicap impuesto al comparador para que la comparación fuera posible. Los autores lo declaran honestamente, pero un lector que solo retenga las dos cifras del índice C corre el riesgo de sobrestimar la diferencia real con el mejor uso posible de MAGGIC, con ecocardiograma.
Reproducibilidad limitada y vínculos con la industria nada triviales. Los datos de CPRD no son de libre acceso —su uso requiere una licencia y la aprobación de un comité científico independiente— y nada indica que el código o los pesos del Transformer o de SIMPLE-HF se hayan publicado. Una réplica independiente es, por ahora, imposible. Además, la financiación (una subvención Horizon Europe) va acompañada de vínculos declarados con la industria para varios autores: el autor principal, Kazem Rahimi, declara honorarios de consultoría de Medtronic y Lucem Health, así como financiación de investigación de la Fundación Novo Nordisk y de Roche; otro autor también declara honorarios de consultoría de Lucem Health. Esto no invalida los resultados, pero conviene conocerlo antes de que una puntuación así se integre en un producto comercial.
Qué cambia esto
Para la comunidad investigadora, SIMPLE-HF documenta un método de «destilación» reproducible: usar un modelo complejo (aquí, un Transformer) únicamente como herramienta de descubrimiento de variables pronósticas, para después transferir ese conocimiento a una puntuación simple e interpretable. Este enfoque podría aplicarse a otras enfermedades crónicas donde exista la misma tensión entre precisión y viabilidad de despliegue. El siguiente paso, señalado por los propios autores, es una validación externa en otros sistemas de salud.
Para los clínicos, hoy no cambia nada: SIMPLE-HF es una herramienta de investigación, no validada de forma prospectiva ni aprobada para uso clínico. Pero el principio que ilustra es concreto para la atención primaria: una puntuación de mortalidad fiable que no requiera ni clase NYHA ni FEVI podría, con el tiempo, ayudar a priorizar a los pacientes en contextos donde el acceso a un ecocardiograma reciente es limitado, algo frecuente en atención primaria.
Para los pacientes y el público general, el estudio ilustra una tendencia de fondo: la IA en salud no solo sirve para construir modelos cada vez más complejos, sino también para extraer de ellos herramientas más simples y de uso más amplio. Esa promesa, sin embargo, sigue condicionada a una validación en otros países y sistemas de salud antes de cualquier adopción clínica.
Para saber más
El artículo (versión publicada): Development and validation of a parsimonious AI-based mortality risk score for heart failure, Nouman Ahmed, Nathalie Conrad, Malgorzata Wamil, Ben Omega Petrazzini, Zhengxian Fan, Guyu Zeng, Jie Lian, Shishir Rao, Kazem Rahimi (Universidad de Oxford), npj Digital Medicine, 26 de septiembre de 2026, DOI 10.1038/s41746-026-03258-1. Versión preprint con detalle metodológico completo: medRxiv, 30 de septiembre de 2025.
Sobre otras puntuaciones de riesgo construidas y validadas con la base CPRD, véase nuestro análisis sobre la predicción de reingreso hospitalario con un autoencoder autosupervisado. Sobre la calibración multicéntrica de una puntuación de riesgo cardiovascular, véase nuestro análisis sobre el riesgo de ictus isquémico a 10 años.