Maladie de Chagas sur l'ECG : ce que transfère un pré-entraînement aligné sur l'IRM cardiaque, et jusqu'où

Une équipe d'Amsterdam UMC et de l'ETH Zurich a aligné un encodeur d'électrocardiogramme sur un espace de représentation dérivé de l'IRM cardiaque, à partir de 63 193 examens appariés ECG–IRM de la UK Biobank, puis a jeté la branche IRM et appliqué l'encodeur gelé à la détection de la maladie de Chagas sur environ 345 000 ECG brésiliens. Sans qu'un seul patient chagasique n'ait été vu pendant l'alignement, la sonde linéaire passe de 0,827 à 0,851 d'AUROC et de 37,7 % à 42,7 % de sensibilité dans les 5 % de risque les plus élevés — devant un modèle entraîné spécifiquement sur des données Chagas. Mais sur ELSA-Brasil, la cohorte aveugle la plus éloignée des données d'entraînement, leur AUROC tombe à 0,556, la plus basse des quatre méthodes comparées, alors que c'est précisément sur cette cohorte que le papier revendique sa meilleure généralisation.

Le contexte

La maladie de Chagas est causée par le parasite Trypanosoma cruzi, transmis principalement par des punaises triatomes en Amérique latine. L'Organisation mondiale de la santé la classe parmi les maladies tropicales négligées et estime entre six et sept millions le nombre de personnes infectées. Sa complication redoutée est cardiaque : une cardiomyopathie chagasique qui s'installe des années après l'infection et qui est, sur le continent, l'une des premières causes de cardiomyopathie non ischémique. Sa nature est fondamentalement structurelle — fibrose du myocarde, remodelage ventriculaire, dysfonction progressive.

Le paradoxe diagnostique tient en une phrase. La modalité qui voit directement ces anomalies est l'IRM cardiaque ciné (cardiac magnetic resonance, CMR), considérée comme l'étalon de référence pour caractériser structure et fonction du cœur. Or les auteurs rappellent, chiffres de la littérature à l'appui, que l'Amérique latine compte environ quatre fois moins d'IRM par habitant que l'Europe, l'Asie du Sud-Est quinze fois moins, et l'Afrique jusqu'à trente fois moins. L'ECG douze dérivations, lui, coûte presque rien et existe partout — mais il enregistre l'activité électrique du cœur et ne renseigne sur sa structure qu'indirectement.

D'où l'idée, explorée depuis deux ou trois ans par plusieurs équipes (MMCL, PTACL, ECCL), d'un apprentissage contrastif multimodal : on prend des paires ECG–IRM du même patient, on force le modèle à produire pour l'ECG une représentation proche de celle de l'IRM correspondante et éloignée de celle des autres patients, puis on jette l'IRM. L'encodeur d'ECG résultant embarque, en principe, une trace de ce qu'aurait montré l'imagerie. Toutes ces études ont cependant été évaluées sur les populations et les pathologies de leur propre cohorte d'entraînement, presque toujours européennes ou nord-américaines. La question ouverte — et c'est celle que ce préprint attaque — est de savoir si ces représentations structurelles survivent à un changement de distribution, et plus radicalement si elles gardent une valeur diagnostique pour une maladie totalement absente des données de pré-entraînement.

La méthode

Deux modèles de fondation, un seul entraîné. Un modèle de fondation (foundation model) est un grand modèle pré-entraîné sur des données non étiquetées, destiné à être réutilisé sur de nombreuses tâches. Côté ECG, les auteurs partent d'ECG-FM, une architecture hybride CNN–Transformer pré-entraînée sur 1,4 million d'ECG douze dérivations. Côté imagerie, ils utilisent CineMA, un autoencodeur masqué multi-vues entraîné sur des séquences d'IRM ciné, qui projette une image de coupe petit axe et les vues grand axe (2, 3 et 4 cavités) dans une représentation commune. Pendant l'alignement, l'encodeur d'IRM reste strictement gelé : il sert de cible fixe, pas de partenaire d'apprentissage.

Le diagnostic qui change tout : l'espace IRM brut est dégénéré. C'est l'observation la plus utile du papier et elle est rarement faite ailleurs. Les représentations CineMA de la télédiastole (cœur rempli) et de la télésystole (cœur contracté) ont une similarité cosinus moyenne supérieure à 0,99 — autrement dit, elles sont presque indiscernables. L'anatomie statique écrase toute la variance et la fonction, c'est-à-dire le mouvement, disparaît. S'aligner sur ces vecteurs bruts revient donc à apprendre à l'ECG la taille du cœur, pas son comportement.

Une cible cliniquement ancrée plutôt que brute. Les auteurs extraient les deux représentations (télédiastole et télésystole), les concatènent, et les font passer par un perceptron multicouche supervisé à régresser sept phénotypes : fraction d'éjection du ventricule gauche (FEVG), volume télédiastolique du VG, masse du VG, volume télédiastolique du ventricule droit, déformation longitudinale globale du VG (global longitudinal strain), fibrillation atriale et infarctus du myocarde. Ce perceptron est ensuite gelé. On obtient un goulot d'étranglement de 256 dimensions qui concentre la capacité représentationnelle sur les axes de l'espace IRM les plus liés à la pathologie cardiovasculaire, en éliminant le bruit anatomique redondant.

L'alignement est asymétrique. La perte utilisée est InfoNCE — la fonction de coût standard de l'apprentissage contrastif, qui récompense le rapprochement des paires appariées et l'éloignement de toutes les autres paires du lot, avec un paramètre de température (ici τ = 0,1) qui règle la dureté de cette discrimination. Ici, les gradients ne circulent que du côté ECG : la géométrie de l'espace IRM ne bouge pas d'un iota, et c'est l'ECG qui doit venir s'y ranger. La projection est prise non pas en sortie mais à la couche 9 de l'encodeur ECG-FM, couche choisie par sondage linéaire de toutes les couches intermédiaires contre plusieurs phénotypes cardiaques — donc indépendamment de toute étiquette Chagas.

Les données. Pré-entraînement sur la UK Biobank : 63 193 examens appariés ECG douze dérivations et IRM ciné multi-vues, dont 47 683 pour l'alignement et 15 510 pour la validation et l'évaluation retenue, stratifiés par FEVG, masse du VG, sexe et diagnostic de fibrillation atriale. Les ECG font dix secondes à 500 Hz et sont coupés en deux segments de cinq secondes, l'un ou l'autre étant tiré au hasard comme augmentation de données. Évaluation aval sur les données publiées pour le PhysioNet/CinC Challenge 2025 : CODE-15 % et SaMi-Trop réunis, soit environ 345 000 ECG dont 8 192 positifs pour Chagas — une prévalence de 2,4 %. Pour la comparaison au protocole officiel du challenge, PTB-XL est ajouté comme source supplémentaire de négatifs (21 801 ECG). L'encodeur aligné est utilisé gelé, avec une simple tête linéaire entraînée en validation croisée à cinq plis, repondération de la classe positive et sélection du point de contrôle sur l'AUPRC.

Les résultats

L'alignement apporte quelque chose, et c'est mesuré proprement. Contre exactement le même encodeur sans alignement — ECG-FM gelé, même sonde, mêmes plis — le modèle aligné passe de 0,827 à 0,851 d'AUROC (l'aire sous la courbe ROC : la probabilité qu'un patient positif tiré au hasard reçoive un score plus élevé qu'un négatif tiré au hasard). Surtout, la métrique opérationnelle du challenge, le Top5 %-TPR — la proportion de vrais positifs capturés si l'on ne retient que les 5 % d'ECG les plus à risque — monte de 0,377 ± 0,014 à 0,427 ± 0,022, soit cinq points de pourcentage.

Et ce résultat dépasse un modèle entraîné sur la maladie. Jidling et al., qui avaient entraîné de bout en bout un ensemble de quinze ResNet 1D sur l'intégralité de CODE et SaMi-Trop, rapportaient une AUROC de 0,800. L'encodeur aligné, qui n'a jamais rencontré ni un patient chagasique ni une IRM chagasique, fait mieux avec une simple tête linéaire par-dessus des poids figés. Sous le protocole complet du challenge (avec PTB-XL), la sonde linéaire atteint 0,431 ± 0,005 de Top5 %-TPR contre 0,381 ± 0,003 pour l'ablation à encodeur gelé du vainqueur du challenge — les mêmes cinq points d'écart.

La traduction clinique ramène les pieds sur terre. À 2,4 % de prévalence, sur 1 000 personnes dépistées, il y a environ 24 cas. Envoyer en sérologie de confirmation les 5 % les plus à risque, c'est tester 50 personnes. Le modèle aligné en attrape environ 10, le modèle non aligné environ 9 : le gain réel est d'à peu près un cas supplémentaire détecté pour 1 000 personnes dépistées. Dans les deux cas, une quarantaine des 50 sérologies reviendront négatives, et une quatorzaine de cas resteront manqués en dehors du seuil. Ce n'est pas un échec — dans un contexte où la capacité sérologique est le facteur limitant, prioriser correctement dix cas sur cinquante tests a une valeur réelle — mais c'est très loin de ce que « 0,851 d'AUROC » laisse imaginer.

Sur les jeux de test aveugles, le tableau se complique. La soumission officielle obtient un score global de 0,269, juste derrière le trio de tête (0,280 à 0,323), soit la quatrième place. Deux résultats sont mis en avant par les auteurs : la meilleure AUROC sur SaMi-Trop-3 (0,773 contre 0,767 pour le vainqueur) et le meilleur score de challenge sur ELSA-Brasil (0,132), présentée comme la cohorte la plus difficile en raison de ses écarts démographiques et d'acquisition. Ce que la discussion ne souligne pas : sur cette même cohorte ELSA-Brasil, leur AUROC est de 0,556, contre 0,566, 0,567 et 0,626 pour les trois équipes classées devant. Sur REDS-II : 0,350 / 0,739.

Ce qui est bien

Le diagnostic de dégénérescence de l'espace cible, et ce qu'ils en font. Constater qu'un espace latent est presque unidimensionnel — cosinus télédiastole/télésystole supérieur à 0,99 — puis refuser de s'aligner dessus et construire à la place un goulot de 256 dimensions supervisé sur sept phénotypes cliniques, voilà une décision d'ingénierie spécifique, motivée, et directement réutilisable par quiconque travaille sur l'alignement ECG–imagerie. La plupart des papiers de contrastif multimodal se contentent d'aligner sur ce que crache l'encodeur d'en face. Le choix de l'asymétrie va dans le même sens : en gelant la cible, on empêche la mise à jour contrastive de déformer la variété structurelle qu'on cherche justement à transférer.

Le contrôle est le bon, et le choix de couche est protégé de la fuite. L'écart de cinq points n'est pas comparé à un modèle différent, sur d'autres données, avec un autre protocole. Il est comparé au même encodeur ECG-FM, gelé lui aussi, avec la même tête linéaire et les mêmes plis. Tout ce qui change est l'alignement. Et la couche 9 a été choisie par sondage contre des phénotypes cardiaques génériques, explicitement sans regarder les étiquettes Chagas — ce qui ferme la porte au biais de sélection le plus courant dans ce genre de travail, celui où l'on choisit la couche qui marche le mieux sur la tâche finale et où l'on présente ensuite le résultat comme du zéro-shot.

La validation externe est aveugle et c'est rare. Passer par un challenge PhysioNet, c'est accepter d'être évalué sur des jeux de test dont on n'a jamais vu une ligne, par un organisateur tiers, avec une métrique fixée à l'avance. Dans un sous-domaine où la « validation externe » consiste le plus souvent à tester sur un second jeu public qu'on a téléchargé soi-même, la différence est qualitative. Les auteurs signalent en outre, dans la légende du tableau des résultats officiels, que les équipes classées avaient accès à l'ensemble de validation REDS-II pour calibrer leur seuil et qu'eux ne l'avaient pas — une information désagréable pour leur classement, et qu'ils publient quand même.

Ce qui est moins bien

Le biais de population joue exactement à contre-emploi. La UK Biobank est une cohorte de volontaires britanniques d'âge moyen à avancé, très majoritairement blancs, avec un biais de sélection bien documenté vers les participants en meilleure santé que la population générale. Le prior structurel appris est donc celui d'une population où la cardiomyopathie est essentiellement ischémique ou hypertensive, où T. cruzi est absent, et dont la pyramide des âges n'a rien à voir avec celle d'un dépistage en zone endémique. Les auteurs retournent cette objection en argument — « les caractéristiques structurelles apprises de l'imagerie transfèrent le plus fiablement aux populations les plus éloignées de la distribution de pré-entraînement » — mais c'est précisément là que le papier est le plus fragile, et aucune évaluation prospective en Amérique latine n'est conduite. La discussion le reconnaît en une ligne, en le renvoyant aux travaux futurs.

Le risque d'apprentissage par raccourci n'est jamais audité. Le vivier d'entraînement Chagas est un assemblage : SaMi-Trop est une cohorte de cardiomyopathie chagasique établie, donc entièrement positive ; CODE-15 % est un échantillon de télémédecine brésilienne, très majoritairement négatif ; PTB-XL est allemande et entièrement négative. Un classifieur peut donc obtenir un excellent score en reconnaissant de quelle cohorte provient l'enregistrement — appareil, échantillonnage, positionnement des électrodes, âge, filtre — plutôt que la maladie. Le papier ne fait aucun audit de signature d'origine : pas de classifieur de domaine, pas de vue de contrôle négatif, pas d'analyse de saillance, pas de décomposition par cohorte des faux positifs. Or l'effondrement de 0,851 en validation croisée à 0,556 sur ELSA-Brasil est exactement ce que ce mode d'échec prédit. Nous avions décrit le même mécanisme sur la fusion de jeux de données en mammographie de dépistage.

La conclusion la plus vendue repose sur la métrique qui bouge avec le seuil. L'affirmation que la méthode transfère le mieux aux populations les plus éloignées tient entièrement au score de challenge sur ELSA-Brasil (0,132, meilleur des quatre), alors que l'AUROC sur cette même cohorte est de 0,556, la plus basse des quatre — à peine au-dessus du hasard. Or le score de challenge dépend d'un point de fonctionnement, l'AUROC non. Comme les auteurs écrivent eux-mêmes qu'ils n'ont pas eu accès à REDS-II pour calibrer leur seuil, la lecture « notre seuil est tombé par chance au bon endroit sur ELSA-Brasil » est au moins aussi plausible que « notre représentation généralise mieux ». Une cohorte, une soumission, aucun intervalle de confiance : la conclusion est surinterprétée. Trois autres réserves s'ajoutent. L'écart de cinq points n'est accompagné d'aucun test statistique apparié et le tableau 1 ne donne pas d'intervalle de confiance sur l'AUROC. Aucun dépôt de code ni poids publié n'est annoncé dans le préprint, et la UK Biobank comme les données du challenge sont d'accès conditionné à une demande — la reproduction exacte est donc hors de portée d'un lecteur ordinaire. Enfin, il s'agit d'un préprint non relu par les pairs, sans déclaration de financement ni de conflits d'intérêts, et dont la section « Impact in RCS » trahit un format de soumission à un atelier sur les environnements à ressources contraintes plutôt qu'un article de revue.

Ce que ça change

Pour la communauté de recherche. Le résultat transférable n'est pas le chiffre de 0,851, c'est la démonstration qu'un prior structurel appris par alignement sur l'imagerie garde de la valeur pour une pathologie absente du pré-entraînement. Cela déplace la question. Jusqu'ici, l'alignement ECG–IRM était vendu comme un moyen d'améliorer la prédiction de phénotypes qu'on sait déjà mesurer. Ici il est vendu comme un moyen de distiller la modalité coûteuse dans la modalité disponible, une fois pour toutes, dans un pays riche en données, puis de l'expédier ailleurs. Si ce mécanisme tient, il s'applique à toute cardiopathie structurelle sous-diagnostiquée faute d'imagerie. Le travail de vérification à faire en premier est cependant celui que ce papier ne fait pas : isoler quels phénotypes de l'espace cible portent réellement le signal chagasique, et vérifier que ce n'est pas la cohorte d'origine qui est apprise. La question de savoir ce que les modèles de fondation médicaux encodent réellement rejoint celle que nous avions abordée sur la convergence représentationnelle des modèles de fondation médicaux.

Pour les cliniciens. Rien ne change aujourd'hui. Un score de 0,269 au challenge, une AUROC de 0,556 sur la cohorte la plus réaliste, aucune évaluation prospective, aucun marquage réglementaire : nous sommes au stade de la preuve de concept méthodologique. Ce qui mérite d'être retenu est le cadre d'usage, qui est intelligent : il ne s'agit pas de diagnostiquer Chagas par l'ECG — le diagnostic reste sérologique — mais de hiérarchiser qui envoyer en sérologie quand la capacité de test est le facteur limitant. C'est un problème de tri, pas de diagnostic, et c'est la bonne manière de poser la question. Reste que le bon comparateur, absent ici, serait une règle clinique simple : âge, zone de résidence, antécédents familiaux, anomalies ECG classiques de la cardiomyopathie chagasique. Tant que ce comparateur n'est pas battu sur données réelles, le gain net reste inconnu.

Pour les patients et le public. L'intérêt de fond de ce travail est une forme d'équité technique : il propose d'apprendre dans un endroit où l'imagerie abonde, puis de déployer là où seul l'ECG existe, sans jamais exiger d'IRM au moment de l'usage. C'est une direction plus honnête que celle qui consiste à demander aux pays à ressources contraintes d'acquérir d'abord l'équipement des pays riches. Mais il faut voir la limite, et elle est structurelle : la connaissance distillée vient d'une population britannique âgée, et le seul test réalisé sur une cohorte brésilienne réellement différente donne un classement à peine meilleur que le hasard. Un modèle formé sur les cœurs d'ailleurs n'est pas automatiquement un modèle pour les cœurs d'ici. La même tension traverse d'autres travaux d'IA appliqués aux maladies négligées, comme le dépistage échographique de la fibrose périportale dans la schistosomiase.

Pour aller plus loin

Le préprint : Leveraging Cardiac Imaging to Improve ECG-Based Detection of Chagas Disease in Resource-Constrained Settings, arXiv:2609.08582 [cs.LG], DOI 10.48550/arXiv.2609.08582, déposé le 8 septembre 2026, sous licence CC BY 4.0. Auteurs : Laura Alvarez-Florez et Daniel Uyterlinde (contribution égale), Samuel Ruipérez-Campillo, Lukas P. A. Arts, Folkert W. Asselbergs et Fleur V. Y. Tjong — départements de génie biomédical et physique et de cardiologie clinique et expérimentale de l'Amsterdam University Medical Center, groupe Quantitative Healthcare Analysis de l'université d'Amsterdam, et département d'informatique de l'ETH Zurich. Aucune déclaration de financement ni de conflits d'intérêts ne figure dans le manuscrit. Le cadre d'évaluation est celui du George B. Moody PhysioNet Challenge 2025, consacré à la détection de la maladie de Chagas sur l'ECG. Le comparateur principal est Jidling et al., PLoS Neglected Tropical Diseases 2023, 17(7) : e0011118. Les jeux de données mobilisés sont la UK Biobank (Sudlow et al., PLOS Medicine, 2015), CODE-15 % (Ribeiro et al., Zenodo, 2021), la cohorte SaMi-Trop (Cardoso et al., BMJ Open, 2016, 6(5) : e011181) et PTB-XL (Wagner et al., PhysioNet, 2022) ; les modèles de fondation réutilisés sont ECG-FM (McKeen et al., JAMIA Open, 2025) et CineMA (Fu et al., préprint arXiv, 2025). Sur l'épidémiologie et la prise en charge, la référence de base est la fiche d'information de l'OMS sur la maladie de Chagas.