PhysioFusion en chirurgie cardiaque : ce que change la fusion de 26 signaux peropératoires avec le registre STS sur 1 393 patients
Une équipe du Roux Institute (Northeastern University) et du Maine Medical Center a construit PhysioFusion, un ensemble de modèles qui combine les données préopératoires du registre de la Society of Thoracic Surgeons (STS) et 26 signaux de monitorage peropératoire pour prédire les complications après chirurgie cardiaque, sur 1 393 patients d'un seul hôpital. L'AUC atteint 0,87 en validation croisée, mais les seules variables du registre font aussi bien (0,87) : le signal peropératoire n'apporte rien de mesurable ici. À lire comme une étude interne honnête sur un résultat négatif, pas comme une preuve que la fusion multimodale améliore la prédiction.
Le contexte
Après une chirurgie cardiaque, une proportion non négligeable de patients subit une complication majeure (11,6 % dans la cohorte étudiée ici) : ventilation prolongée, accident vasculaire cérébral, insuffisance rénale, réintervention non prévue, infection profonde du sternum, décès. Aux États-Unis, la Society of Thoracic Surgeons (STS) tient un registre national où chaque opération est codée, et ses scores de risque préopératoires servent de référence pour comparer les centres entre eux. Ces scores n'utilisent que ce que l'on sait avant l'incision.
Or une opération de plusieurs heures produit un flux continu de mesures : pressions artérielles et veineuses, électrocardiogramme, saturation en oxygène, température, durées de circulation extracorporelle. L'idée de ce papier, très naturelle, est que ces séries temporelles contiennent un signal de risque que les variables préopératoires ne captent pas, et qu'un modèle qui les fusionne devrait mieux prédire. Le papier est un preprint déposé sur medRxiv en septembre 2026 : il n'a pas encore été relu par des pairs.
La méthode
Les données. 1 393 patients adultes consécutifs opérés au Maine Medical Center (MaineHealth) entre septembre 2022 et avril 2024, dont 161 (11,6 %) ont eu au moins un des onze événements indésirables retenus par le STS et le National Quality Forum, regroupés en un critère composite. Les variables statiques viennent de la base STS (âge, antécédents, fonction cardiaque, type de chirurgie, durée de circulation extracorporelle…). Les séries temporelles couvrent 26 signaux peropératoires.
Les modèles. Le cœur est un réseau à deux branches : un réseau résiduel (empilement de blocs dont la sortie s'ajoute à l'entrée, ce qui stabilise l'entraînement) pour les variables statiques, et pour les séries temporelles un réseau convolutif (qui repère des motifs locaux dans le signal) et un GRU bidirectionnel (un réseau récurrent qui lit la série dans les deux sens). À côté, quatre modèles classiques : XGBoost (des arbres de décision successifs, chacun corrigeant les erreurs du précédent), une régression logistique pénalisée L1, une machine à vecteurs de support (SVM) et une cascade de gradient boosting en deux étapes. Les prédictions sont combinées par moyenne pondérée, puis recalibrées par régression isotonique (une courbe croissante qui fait correspondre « le modèle dit 20 % » à « 20 % des patients ont réellement l'événement »).
La validation. Validation croisée stratifiée en cinq plis avec mélange : le jeu est découpé en cinq parties, chacune servant à son tour de test. Les classes déséquilibrées sont rééquilibrées par SMOTEENN (création de cas positifs synthétiques et nettoyage des cas ambigus), uniquement sur les plis d'entraînement. Trois seuils de décision sont évalués : un seuil qui maximise la valeur prédictive positive à sensibilité ≥ 0,7, un seuil qui maximise le F1 et un seuil « équilibré » où sensibilité et spécificité s'égalent.
Les résultats
Métriques ML. Au seuil équilibré, le modèle combiné obtient une AUC (probabilité de classer un patient avec événement au-dessus d'un patient sans événement) de 0,87 (IC à 95 % 0,82 à 0,91), une sensibilité de 0,76, une spécificité de 0,83, une valeur prédictive positive (VPP) de 0,40 et une valeur prédictive négative (VPN) de 0,96. L'erreur de calibration est de 0,036.
Le résultat central est la décomposition par modalité. Les variables statiques seules donnent une AUC de 0,87 (0,82 à 0,92), une sensibilité de 0,74, une spécificité de 0,82, une VPP de 0,45 et une calibration meilleure (0,023). Les séries temporelles seules donnent 0,83 (0,80 à 0,86), avec une VPP de 0,33. Les intervalles se recouvrent presque entièrement : sur cette cohorte, la fusion ne fait pas mieux que les données du registre. Une ablation signal par signal conclut qu'aucun canal de monitorage n'est indispensable, la pression artérielle moyenne et la pression veineuse centrale étant les moins substituables. Parmi les modèles pris isolément, le gradient boosting arrive à 0,86, la régression logistique à 0,78, le SVM à 0,69 et le réseau profond à 0,72 (0,60 sur les séries temporelles seules).
Traduction clinique. Pour 1 000 opérés avec la prévalence de la cohorte (116 événements), une sensibilité de 0,76 correspond à environ 88 complications repérées et 28 manquées. Une spécificité de 0,83 sur les 884 patients sans événement fait environ 150 fausses alertes. Le calcul direct donne une VPP proche de 0,37, un peu sous les 0,40 rapportés, probablement à cause des arrondis et du calcul par pli. En pratique : environ deux alertes sur trois seraient de fausses alertes, et un peu plus d'une complication sur quatre échapperait au modèle. La VPN de 0,96 est rassurante mais découle surtout de la rareté de l'événement : prédire « pas de complication » pour tout le monde aurait une VPN de 0,88.
Ce qui est bien
Un résultat négatif publié sans maquillage. Les auteurs rapportent que les deux modalités sont substituables au lieu de présenter la fusion comme un succès. C'est rare dans un domaine où la complexité est souvent vendue comme une valeur en soi, et c'est précisément l'information utile pour qui envisage d'équiper un bloc opératoire.
Un protocole d'évaluation soigné sur les points techniques. Le rééquilibrage SMOTEENN est limité aux plis d'entraînement, les plis de test gardent la prévalence réelle de 11,6 %, trois seuils opérationnels sont rapportés plutôt qu'un seul, et les intervalles de confiance sont donnés. Les cinq familles de modèles permettent de voir que le gain ne vient pas d'un choix d'architecture.
Des données hospitalières consécutives et un critère standardisé. Les patients sont consécutifs (pas de sélection de cas faciles) et le critère repose sur les définitions STS, pas sur une définition ad hoc. La déclaration d'absence de conflit d'intérêts figure dans le texte.
Ce qui est moins bien
Une validation strictement interne (biais de population et de centre). Un seul hôpital, 161 événements, aucune validation externe ni temporelle : la validation croisée mesure la performance sur les mêmes patients, la même salle d'opération, les mêmes appareils de monitorage. Les auteurs reconnaissent eux-mêmes que le faible nombre d'événements pénalise les modèles de grande capacité, ce qui explique le mauvais score du réseau profond (0,72), mais il en résulte aussi que la comparaison entre architectures dit peu sur ce qu'un jeu plus grand donnerait.
Un comparateur manquant (comparateur biaisé par omission). Le texte consulté n'applique aucun score de risque STS établi. Or c'est le comparateur qui compte : un modèle à AUC 0,87 est-il meilleur que le score que le chirurgien a déjà sous la main ? Les comparateurs internes sont des composants de l'ensemble, pas des références cliniques. Sans ce point, on ne peut pas dire si le gain, nul entre modalités, est positif par rapport à la pratique.
Des risques de fuite d'information et une métrique à lire avec prudence (data leakage, métrique trompeuse). Le seuil « équilibré » est choisi sur les prédictions évaluées, et la calibration isotonique est ajustée sur des prédictions de modèles ; le texte consulté ne précise pas si ces deux étapes sont strictement séparées des plis de test, ce qui pourrait rendre sensibilité, spécificité et calibration optimistes. À 11,6 % de prévalence, une AUC de 0,87 s'accompagne d'une VPP de 0,40 : la majorité des alertes serait fausse. Le critère composite de onze événements, très hétérogènes (un décès et une réintervention n'ont ni le même mécanisme ni la même prévention), complique aussi toute action clinique ciblée. Enfin, le code et les données ne sont disponibles que sur demande.
Ce que ça change
Pour la communauté de recherche. Le papier fournit un cas test utile : sur une cohorte monocentrique de taille modeste, des signaux peropératoires bruts n'ajoutent rien à un registre bien rempli. La question suivante est de savoir si cela tient avec plus de patients, une validation externe et une représentation du signal mieux conçue (pré-entraînement sur de grands volumes de monitorage, par exemple), plutôt que d'ajouter des réseaux sur 161 événements.
Pour les cliniciens. Rien ne change dans la pratique : le modèle n'est pas validé hors du centre, pas comparé au score STS et pas évalué prospectivement. Il rappelle toutefois que le registre préopératoire contient déjà l'essentiel du signal prédictible, ce qui plaide pour soigner la qualité de saisie avant d'investir dans de nouveaux capteurs ou flux de données.
Pour les patients et le public. Ces modèles ne remplacent pas le jugement de l'équipe chirurgicale. Un outil qui prédit les complications avec une alerte sur trois exacte reste un outil de tri pour l'équipe, pas un verdict individuel, et les patients n'ont pas à s'attendre à une surveillance « intelligente » en salle d'opération à court terme.
Pour aller plus loin
Le papier (preprint, non relu par les pairs) : PhysioFusion: A Multi-Modal Ensemble using Static Preoperative Variables and Time Series Intraoperative Data to Predict Adverse Events Following Cardiothoracic Surgery, Rajashekar Korutla, Anne Hicks, Marko Milosevic et al. (Roux Institute, Northeastern University ; Spectrum Healthcare Partners ; Maine Medical Center, MaineHealth), medRxiv, septembre 2026, DOI 10.64898/2026.09.24.26363920. Code et données : sur demande auprès de l'auteur correspondant, sous accord d'utilisation de données. Les auteurs déclarent n'avoir aucun conflit d'intérêts ; le financement n'a pas été identifié dans le texte consulté.
Sur les modèles entraînés sur très peu d'événements, voir notre décryptage sur la récidive du carcinome hépatocellulaire. Sur un modèle de prédiction clinique monocentrique, voir notre décryptage sur la chirurgie de Mohs.