SIMPLE-HF, un score de mortalité à 11 variables pour l'insuffisance cardiaque : ce que change la distillation d'un Transformer sur 373 000 patients britanniques

Une équipe de l'Université d'Oxford a construit SIMPLE-HF, un score de mortalité pour l'insuffisance cardiaque qui condense un modèle Transformer entraîné sur les dossiers médicaux électroniques de 373 389 patients britanniques en seulement 11 variables mesurables en routine, sans échocardiographie. Sur une cohorte de validation de 77 712 patients, ce score identifie deux fois plus de décès réels que MAGGIC-EHR — une version du score de référence MAGGIC adaptée aux données de routine — pour un même nombre de patients signalés à risque. Le résultat est solide sur le plan méthodologique, mais reste une validation interne au seul système de santé britannique, face à un comparateur volontairement appauvri par rapport au score MAGGIC original.

Le contexte

L'insuffisance cardiaque touche environ 64 millions de personnes dans le monde et reste l'une des pathologies chroniques les plus meurtrières en médecine interne : une proportion importante des patients diagnostiqués meurt dans les cinq années qui suivent. Stratifier ce risque — savoir qui, parmi les patients suivis en ville ou sortant d'hospitalisation, a le plus besoin d'un suivi rapproché, d'une escalade thérapeutique ou d'un avis spécialisé — conditionne directement l'allocation des ressources de cardiologie.

Le score le plus utilisé pour cela, MAGGIC (Meta-Analysis Global Group in Chronic Heart Failure), a été construit par méta-analyse de treize cohortes en 2013. Il combine des variables cliniques simples (âge, tension, fréquence cardiaque) à des données qui nécessitent un examen spécialisé : la classe fonctionnelle NYHA (essoufflement selon l'effort) et la fraction d'éjection ventriculaire gauche (FEVG), mesurée par échocardiographie. Le problème documenté par l'équipe d'Oxford est double. D'un côté, MAGGIC discrimine mal — sa capacité à distinguer un patient à haut risque d'un patient à bas risque reste modeste. De l'autre, ses variables clés sont souvent absentes des dossiers médicaux électroniques (EHR) de routine, parce qu'aucune échocardiographie récente n'a été réalisée. Les modèles d'IA plus complexes, entraînés directement sur les séquences temporelles des EHR, sont plus précis mais restent des boîtes noires difficiles à intégrer dans un parcours de soins et à faire approuver par les cliniciens.

L'objectif du papier est de sortir de ce dilemme : garder la précision d'un modèle complexe entraîné sur des données longitudinales, sans en garder la complexité d'utilisation.

La méthode

L'équipe a travaillé sur la base CPRD Aurum (Clinical Practice Research Datalink), qui agrège les dossiers de médecine générale d'une partie représentative de la population anglaise. Parmi 19 094 480 individus, 373 389 adultes avec un diagnostic incident d'insuffisance cardiaque entre 2010 et 2020 ont été retenus. Point méthodologique notable : la séparation entre les données d'entraînement (1 153 cabinets médicaux, 295 677 patients) et de validation (289 cabinets, 77 712 patients) s'est faite au niveau des cabinets médicaux, et non des patients individuels — pour éviter qu'un même praticien, avec ses habitudes de codage propres, se retrouve à la fois dans le jeu d'entraînement et de test, ce qui aurait artificiellement gonflé la performance mesurée (un cas classique de fuite de données, ou data leakage).

La construction du modèle final, SIMPLE-HF (Simplified Intelligent Mortality Prediction for Longitudinal EHRs), suit trois étapes. D'abord, un modèle de référence — un perceptron multicouche (MLP), un type de réseau de neurones simple à plusieurs couches — est entraîné dans un cadre de survie (SODEN, qui modélise non pas un résultat binaire mais le délai jusqu'au décès) en utilisant les variables du score MAGGIC. Ensuite, un modèle Transformer distinct — l'architecture qui a rendu possible les grands modèles de langage, ici appliquée aux séquences temporelles de diagnostics et prescriptions d'un patient — est entraîné sur l'ensemble des données longitudinales de la cohorte pour identifier quelles comorbidités portent le plus d'information pronostique. Enfin, la méthode SHAP (SHapley Additive exPlanations, qui attribue à chaque variable une contribution chiffrée à la prédiction, empruntée à la théorie des jeux coopératifs) est utilisée pour distiller cet ensemble de 21 variables candidates jusqu'à un modèle final ne comportant que 11 variables : l'année de naissance, l'âge, l'indice de masse corporelle, l'ancienneté du diagnostic d'insuffisance cardiaque, la prescription de bêtabloquants ou d'IEC/ARA2, et des antécédents de cancer, d'insuffisance rénale aiguë, de pneumopathie, d'arrêt cardiaque, d'insuffisance respiratoire et de bronchopneumopathie chronique obstructive (BPCO).

Le Transformer ne sert donc pas de modèle final : c'est un outil de découverte de variables, dont les enseignements sont ensuite transférés dans un score simple, calculable avec des données présentes dans n'importe quel dossier de médecine générale — sans échocardiographie. Pour la comparaison, les auteurs ont dû construire MAGGIC-EHR, une version du score MAGGIC original adaptée aux données disponibles en routine, faute de quoi la classe NYHA et la FEVG manquantes auraient rendu la comparaison impossible sur une large partie de la cohorte.

Les résultats

Sur la cohorte de validation, SIMPLE-HF atteint un C-index de 0,801 (IC95 % : 0,795–0,806) contre 0,735 (0,728–0,741) pour MAGGIC-EHR. Le C-index mesure la probabilité que, pour deux patients tirés au hasard, le modèle classe correctement celui qui décédera en premier — 0,5 correspond à un tirage aléatoire, 1,0 à un classement parfait. Sur l'AUPRC (aire sous la courbe précision-rappel, plus informative que l'AUC classique quand les événements sont fréquents, ici environ 42 % de décès à cinq ans), l'écart est similaire : 0,684 contre 0,560. Les deux modèles restent bien calibrés — leurs courbes de calibration, lissées par régression spline, restent proches de la référence idéale.

Traduction clinique : à un seuil de risque de 60 %, sur 1 000 patients dépistés, SIMPLE-HF signale 257 patients comme à haut risque et parmi eux 199 décéderont effectivement, contre 145 patients signalés et seulement 99 décès parmi eux pour MAGGIC-EHR. Autrement dit, à charge de travail clinique comparable (un peu moins de 260 patients à réévaluer sur 1 000), SIMPLE-HF capture deux fois plus de décès réels. À un seuil de 50 % sur la mortalité à 12 mois, le score identifie 4 218 vrais positifs supplémentaires et réduit de 4 818 le nombre de décès manqués, pour un gain de 7,2 points de valeur prédictive positive. L'analyse de courbe de décision (decision curve analysis), qui mesure le bénéfice net d'un outil de décision à différents seuils cliniques, confirme un avantage de SIMPLE-HF sur toute la plage de seuils testée jusqu'à environ 60 %.

Ce qui est bien

Une échelle de validation rare dans ce champ. 373 389 patients suivis sur une décennie (2010-2020), issus d'une base couvrant une portion représentative de la population anglaise — un ordre de grandeur bien supérieur à la plupart des scores de risque cardiovasculaire publiés, dont beaucoup reposent sur des cohortes de quelques milliers de patients.

Une séparation entraînement/validation qui prend le data leakage au sérieux. Le choix de séparer les cabinets médicaux plutôt que les patients individuels est une précaution méthodologique correcte et rarement documentée aussi explicitement : elle empêche qu'un style de codage propre à un cabinet donné se retrouve à la fois dans l'entraînement et le test.

Un double affichage clinique complet. Au-delà du C-index, les auteurs fournissent une analyse de courbe de décision et une traduction en nombre de vrais positifs et faux négatifs gagnés pour 1 000 patients dépistés — exactement le type de conversion qui rend un score utilisable par un clinicien plutôt qu'une performance abstraite. Le score final n'exige aucun examen spécialisé, ce qui en fait un outil potentiellement déployable en soins primaires.

Ce qui est moins bien

Aucune validation externe — le mode d'échec le plus classique des scores de risque IA-santé. Toute la validation, malgré son ampleur, reste interne à une seule base de données, un seul pays, un seul système de santé (le NHS anglais). Les auteurs le reconnaissent explicitement dans leurs limites : « une validation externe dans des cohortes internationales diverses est nécessaire pour confirmer la généralisabilité de cette approche dans d'autres contextes. » La séparation par cabinet médical limite le risque de fuite de données, mais ne garantit rien sur la transportabilité à un système de codage différent (dossiers hospitaliers américains, par exemple) ou à une population aux comorbidités différentes.

Un comparateur affaibli par construction. MAGGIC-EHR n'est pas le score MAGGIC original : c'est une adaptation dont les auteurs ont dû retirer des variables prédictives majeures — la classe NYHA et la FEVG — faute de les trouver dans les données de routine. Une partie de l'écart de performance mesuré (0,801 contre 0,735) reflète donc autant la supériorité de SIMPLE-HF que le handicap imposé au comparateur pour rendre la comparaison possible. Les auteurs le signalent honnêtement, mais le lecteur pressé qui ne retient que les deux chiffres de C-index risque de surestimer l'écart réel avec le meilleur usage possible de MAGGIC, avec échocardiographie.

Reproductibilité limitée et conflits d'intérêts industriels non anodins. Les données CPRD ne sont pas librement accessibles — leur usage nécessite une licence et l'approbation d'un comité scientifique indépendant — et rien n'indique que le code ou les poids du modèle Transformer ou de SIMPLE-HF soient publiés. Une réplication indépendante est donc impossible dans l'état actuel. Par ailleurs, le financement (subvention Horizon Europe) s'accompagne de liens déclarés entre plusieurs auteurs et l'industrie : l'auteur principal, Kazem Rahimi, déclare des honoraires de conseil auprès de Medtronic et de Lucem Health ainsi que des financements de recherche de la Fondation Novo Nordisk et de Roche ; un autre auteur déclare également des honoraires de conseil auprès de Lucem Health. Cela ne disqualifie pas les résultats, mais mérite d'être connu avant qu'un tel score ne soit intégré à un produit commercial.

Ce que ça change

Pour la communauté de recherche, SIMPLE-HF documente une méthode de « distillation » reproductible : utiliser un modèle complexe (ici un Transformer) uniquement comme outil de découverte de variables pronostiques, puis transférer cette connaissance dans un score simple et interprétable. Cette approche pourrait s'appliquer à d'autres pathologies chroniques où la même tension existe entre précision et déployabilité. La prochaine étape, indiquée par les auteurs eux-mêmes, est une validation externe dans d'autres systèmes de santé.

Pour les cliniciens, rien ne change aujourd'hui : SIMPLE-HF est un outil de recherche, non validé prospectivement ni approuvé pour un usage clinique. Mais le principe qu'il illustre est concret pour la médecine générale : un score de mortalité fiable qui ne nécessite ni classe NYHA ni FEVG pourrait, à terme, permettre de trier les patients à un stade où l'accès à une échocardiographie récente est limité — ce qui est fréquent en soins primaires.

Pour les patients et le grand public, l'étude illustre une tendance de fond : l'IA en santé ne sert pas seulement à construire des modèles toujours plus complexes, mais aussi à en extraire des outils plus simples et plus largement utilisables. La promesse reste cependant conditionnée à une validation dans d'autres pays et d'autres systèmes de santé avant toute adoption clinique.

Pour aller plus loin

Le papier (version publiée) : Development and validation of a parsimonious AI-based mortality risk score for heart failure, Nouman Ahmed, Nathalie Conrad, Malgorzata Wamil, Ben Omega Petrazzini, Zhengxian Fan, Guyu Zeng, Jie Lian, Shishir Rao, Kazem Rahimi (University of Oxford), npj Digital Medicine, 26 septembre 2026, DOI 10.1038/s41746-026-03258-1. Version préprint avec détails méthodologiques complets : medRxiv, 30 septembre 2025.

Sur d'autres scores de risque construits et validés sur la base CPRD, voir notre décryptage sur la prédiction de réadmission hospitalière par autoencodeur auto-supervisé. Sur la calibration multisite d'un score de risque cardiovasculaire, voir notre décryptage sur le risque d'AVC ischémique à 10 ans.