Enfermedad de Chagas en el ECG: qué transfiere realmente un preentrenamiento alineado con la resonancia cardíaca, y hasta dónde
Un equipo del Amsterdam UMC y de la ETH Zúrich alineó un codificador de electrocardiograma con un espacio de representación derivado de la resonancia magnética cardíaca, a partir de 63 193 exámenes emparejados ECG–RMC del UK Biobank, y después descartó la rama de imagen y aplicó el codificador congelado a la detección de la enfermedad de Chagas en unos 345 000 ECG brasileños. Sin que se viera ni un solo paciente chagásico durante la alineación, la sonda lineal pasa de 0,827 a 0,851 de AUROC y de 37,7 % a 42,7 % de sensibilidad en el 5 % de mayor riesgo previsto — por delante de un modelo entrenado específicamente con datos de Chagas. Pero en ELSA-Brasil, la cohorte ciega más alejada de los datos de entrenamiento, su AUROC cae a 0,556, la más baja de los cuatro métodos comparados, precisamente en la cohorte donde el artículo reivindica su mejor generalización.
El contexto
La enfermedad de Chagas está causada por el parásito Trypanosoma cruzi, transmitido principalmente por chinches triatominos en América Latina. La Organización Mundial de la Salud la clasifica como enfermedad tropical desatendida y estima entre seis y siete millones el número de personas infectadas. Su complicación temida es cardíaca: una miocardiopatía chagásica que se instala años después de la infección y que es, en ese continente, una de las principales causas de miocardiopatía no isquémica. Su naturaleza es fundamentalmente estructural: fibrosis miocárdica, remodelado ventricular, disfunción progresiva.
La paradoja diagnóstica cabe en una frase. La modalidad que visualiza directamente estas anomalías es la resonancia magnética cardíaca cine (cardiac magnetic resonance, RMC), considerada el patrón de referencia para caracterizar la estructura y la función del corazón. Sin embargo, los autores recuerdan, con cifras publicadas, que América Latina tiene unas cuatro veces menos equipos de resonancia por habitante que Europa, el Sudeste Asiático quince veces menos y África hasta treinta veces menos. El ECG de doce derivaciones, en cambio, no cuesta casi nada y existe en todas partes — pero registra la actividad eléctrica del corazón y solo refleja su estructura de forma indirecta.
De ahí la idea, explorada desde hace dos o tres años por varios grupos (MMCL, PTACL, ECCL), del aprendizaje contrastivo multimodal: se toman pares ECG–RMC del mismo paciente, se obliga al modelo a producir para el ECG una representación cercana a la de la imagen correspondiente y lejana de la de otros pacientes, y luego se descarta la imagen. El codificador de ECG resultante lleva, en principio, una huella de lo que habría mostrado la imagen. Todos esos estudios, no obstante, se evaluaron en las poblaciones y patologías de su propia cohorte de entrenamiento, casi siempre europeas o norteamericanas. La pregunta abierta — la que ataca este preprint — es si esas representaciones estructurales sobreviven a un cambio de distribución y, más radicalmente, si conservan valor diagnóstico para una enfermedad totalmente ausente de los datos de preentrenamiento.
El método
Dos modelos fundacionales, solo uno entrenado. Un modelo fundacional (foundation model) es un modelo grande preentrenado con datos sin etiquetar y destinado a reutilizarse en muchas tareas. Del lado del ECG, los autores parten de ECG-FM, una arquitectura híbrida CNN–Transformer preentrenada con 1,4 millones de ECG de doce derivaciones. Del lado de la imagen usan CineMA, un autocodificador enmascarado multivista entrenado con secuencias de RMC cine, que proyecta un corte de eje corto y las vistas de eje largo (2, 3 y 4 cámaras) en una representación común. Durante la alineación, el codificador de imagen permanece estrictamente congelado: sirve de diana fija, no de compañero de aprendizaje.
El diagnóstico que lo cambia todo: el espacio de imagen en bruto está degenerado. Es la observación más útil del artículo y rara vez se hace en otros trabajos. Las representaciones CineMA de la telediástole (corazón lleno) y de la telesístole (corazón contraído) tienen una similitud coseno media superior a 0,99 — es decir, son casi indistinguibles. La anatomía estática aplasta toda la varianza y la función, o sea el movimiento, desaparece. Alinearse con esos vectores en bruto equivale, por tanto, a enseñarle al ECG el tamaño del corazón, no su comportamiento.
Una diana clínicamente anclada en lugar de bruta. Los autores extraen ambas representaciones (telediástole y telesístole), las concatenan y las pasan por un perceptrón multicapa supervisado para regresar siete fenotipos: fracción de eyección del ventrículo izquierdo (FEVI), volumen telediastólico del VI, masa del VI, volumen telediastólico del ventrículo derecho, strain longitudinal global del VI, fibrilación auricular e infarto de miocardio. Ese perceptrón se congela después. Se obtiene un cuello de botella de 256 dimensiones que concentra la capacidad representacional en los ejes del espacio de RMC más ligados a la patología cardiovascular, eliminando el ruido anatómico redundante.
La alineación es asimétrica. La pérdida empleada es InfoNCE — la función de coste estándar del aprendizaje contrastivo, que premia acercar los pares emparejados y alejar todos los demás pares del lote, con un parámetro de temperatura (aquí τ = 0,1) que regula la dureza de esa discriminación. Aquí los gradientes circulan solo por el lado del ECG: la geometría del espacio de imagen no se mueve ni un ápice, y es el ECG el que debe acomodarse a ella. La proyección se toma no en la salida sino en la capa 9 del codificador ECG-FM, capa elegida mediante sondeo lineal de todas las capas intermedias contra varios fenotipos cardíacos — es decir, con independencia de cualquier etiqueta de Chagas.
Los datos. Preentrenamiento en el UK Biobank: 63 193 exámenes emparejados de ECG de doce derivaciones y RMC cine multivista, de los cuales 47 683 para la alineación y 15 510 para validación y evaluación reservada, estratificados por FEVI, masa del VI, sexo y diagnóstico de fibrilación auricular. Los ECG duran diez segundos a 500 Hz y se dividen en dos segmentos de cinco segundos, muestreándose uno u otro de forma estocástica como aumento de datos. Evaluación posterior con los datos publicados para el PhysioNet/CinC Challenge 2025: CODE-15 % y SaMi-Trop combinados, unos 345 000 ECG con 8 192 casos positivos de Chagas — una prevalencia del 2,4 %. Para la comparación con el protocolo oficial se añade PTB-XL como fuente adicional de negativos (21 801 ECG). El codificador alineado se usa congelado, con una simple cabeza lineal entrenada en validación cruzada de cinco pliegues, reponderación de la clase positiva y selección de punto de control por AUPRC.
Los resultados
La alineación aporta algo, y se mide con limpieza. Frente exactamente al mismo codificador sin alinear — ECG-FM congelado, misma sonda, mismos pliegues — el modelo alineado pasa de 0,827 a 0,851 de AUROC (el área bajo la curva ROC: la probabilidad de que un paciente positivo tomado al azar reciba una puntuación mayor que un negativo tomado al azar). Sobre todo, la métrica operativa del challenge, el Top5 %-TPR — la proporción de verdaderos positivos capturados si solo se retiene el 5 % de ECG de mayor riesgo — sube de 0,377 ± 0,014 a 0,427 ± 0,022, cinco puntos porcentuales.
Y ese resultado supera a un modelo entrenado sobre la propia enfermedad. Jidling et al., que entrenaron de extremo a extremo un conjunto de quince ResNet 1D con todo CODE más SaMi-Trop, informaron de un AUROC de 0,800. El codificador alineado, que nunca ha encontrado ni un paciente chagásico ni una imagen chagásica, lo hace mejor con una simple cabeza lineal sobre pesos congelados. Bajo el protocolo completo del challenge (con PTB-XL), la sonda lineal alcanza 0,431 ± 0,005 de Top5 %-TPR frente a 0,381 ± 0,003 de la ablación con codificador congelado del ganador — la misma brecha de cinco puntos.
La traducción clínica devuelve los pies a la tierra. Con una prevalencia del 2,4 %, entre 1 000 personas cribadas hay unos 24 casos. Enviar a serología de confirmación el 5 % de mayor riesgo significa testar a 50 personas. El modelo alineado captura unos 10, el no alineado unos 9: la ganancia real es de aproximadamente un caso adicional detectado por cada 1 000 personas cribadas. En ambos casos unas cuarenta de las 50 serologías volverán negativas, y alrededor de catorce casos seguirán perdiéndose por debajo del umbral. No es un fracaso — donde la capacidad serológica es el factor limitante, priorizar correctamente diez casos en cincuenta pruebas tiene valor real — pero queda muy lejos de lo que sugiere «0,851 de AUROC».
En los conjuntos de prueba ciegos, el cuadro se complica. La presentación oficial obtiene una puntuación global de 0,269, justo por detrás del trío de cabeza (0,280 a 0,323), en cuarto lugar. Los autores destacan dos resultados: el mejor AUROC en SaMi-Trop-3 (0,773 frente a 0,767 del ganador) y la mejor puntuación de challenge en ELSA-Brasil (0,132), presentada como la cohorte más difícil por sus diferencias demográficas y de adquisición. Lo que la discusión no subraya: en esa misma cohorte ELSA-Brasil su AUROC es de 0,556, frente a 0,566, 0,567 y 0,626 de los tres equipos clasificados por delante. En REDS-II: 0,350 / 0,739.
Lo que está bien
El diagnóstico de degeneración del espacio diana, y lo que hacen con él. Constatar que un espacio latente es casi unidimensional — coseno telediástole/telesístole por encima de 0,99 —, negarse luego a alinearse con él y construir en su lugar un cuello de botella de 256 dimensiones supervisado con siete fenotipos clínicos es una decisión de ingeniería específica, motivada y directamente reutilizable por cualquiera que trabaje en alineación ECG–imagen. La mayoría de los artículos de contrastivo multimodal se limitan a alinearse con lo que escupe el codificador de enfrente. La elección de la asimetría va en la misma dirección: al congelar la diana, se impide que la actualización contrastiva deforme precisamente la variedad estructural que se quiere transferir.
El control es el correcto, y la elección de capa está protegida contra la fuga. La brecha de cinco puntos no se compara con un modelo distinto, sobre otros datos, con otro protocolo. Se compara con el mismo codificador ECG-FM, también congelado, con la misma cabeza lineal y los mismos pliegues. Lo único que cambia es la alineación. Y la capa 9 se eligió sondeando contra fenotipos cardíacos genéricos, explícitamente sin mirar las etiquetas de Chagas — lo que cierra la puerta al sesgo de selección más habitual en este tipo de trabajos, aquel en que se escoge la capa que mejor funciona en la tarea final y luego se presenta el resultado como zero-shot.
La validación externa es ciega, y eso es raro. Pasar por un challenge de PhysioNet significa aceptar ser evaluado sobre conjuntos de prueba de los que no se ha visto ni una línea, por un organizador tercero, con una métrica fijada de antemano. En un subcampo donde «validación externa» suele significar probar en un segundo conjunto público descargado por uno mismo, la diferencia es cualitativa. Los autores señalan además, en el pie de la tabla de resultados oficiales, que los equipos clasificados tuvieron acceso al conjunto de validación REDS-II para calibrar su umbral y que ellos no — un dato incómodo para su posición, que publican igualmente.
Lo que está menos bien
El sesgo de población juega exactamente en contra del uso previsto. El UK Biobank es una cohorte de voluntarios británicos de edad media a avanzada, mayoritariamente blancos, con un sesgo de selección bien documentado hacia participantes más sanos que la población general. El prior estructural aprendido es, por tanto, el de una población donde la miocardiopatía es esencialmente isquémica o hipertensiva, donde T. cruzi está ausente, y cuya pirámide de edad no se parece en nada a la de un cribado en zona endémica. Los autores convierten esa objeción en argumento — «las características estructurales aprendidas de la imagen se transfieren de forma más fiable a las poblaciones más alejadas de la distribución de preentrenamiento» — pero es precisamente ahí donde el artículo es más frágil, y no se realiza ninguna evaluación prospectiva en América Latina. La discusión lo reconoce en una línea, remitiéndolo a trabajos futuros.
El riesgo de aprendizaje por atajo nunca se audita. El fondo de entrenamiento de Chagas es un ensamblaje: SaMi-Trop es una cohorte de miocardiopatía chagásica establecida, es decir, íntegramente positiva; CODE-15 % es una muestra de telemedicina brasileña, abrumadoramente negativa; PTB-XL es alemana e íntegramente negativa. Un clasificador puede, por tanto, puntuar muy bien reconociendo de qué cohorte procede el registro — aparato, muestreo, colocación de electrodos, edad, filtrado — en lugar de la enfermedad. El artículo no realiza ninguna auditoría de firma de origen: ni clasificador de dominio, ni vista de control negativo, ni análisis de saliencia, ni descomposición por cohorte de los falsos positivos. Y sin embargo, el desplome de 0,851 en validación cruzada a 0,556 en ELSA-Brasil es exactamente lo que predice ese modo de fallo. Describimos el mismo mecanismo en la fusión de conjuntos de datos en mamografía de cribado.
La conclusión más vendida se apoya en la métrica que se mueve con el umbral. La afirmación de que el método transfiere mejor a las poblaciones más alejadas del preentrenamiento se sostiene por completo en la puntuación de challenge en ELSA-Brasil (0,132, la mejor de cuatro), mientras que el AUROC en esa misma cohorte es de 0,556, el más bajo de los cuatro — apenas por encima del azar. Ahora bien, la puntuación de challenge depende de un punto de operación; el AUROC no. Puesto que los propios autores escriben que no tuvieron acceso a REDS-II para calibrar su umbral, la lectura «nuestro umbral cayó por casualidad en buen sitio en ELSA-Brasil» es al menos tan plausible como «nuestra representación generaliza mejor». Una cohorte, una presentación, ningún intervalo de confianza: la conclusión está sobreinterpretada. Se añaden otras tres reservas. La brecha de cinco puntos no viene acompañada de ninguna prueba estadística pareada y la tabla 1 no ofrece intervalo de confianza sobre el AUROC. No se anuncia ningún repositorio de código ni pesos publicados en el preprint, y tanto el UK Biobank como los datos del challenge son de acceso restringido — la reproducción exacta queda fuera del alcance de un lector ordinario. Por último, se trata de un preprint no revisado por pares, sin declaración de financiación ni de conflictos de interés, y cuya sección «Impact in RCS» delata un formato de envío a un taller sobre entornos con recursos limitados más que un artículo de revista.
Qué cambia
Para la comunidad investigadora. El resultado transferible no es la cifra de 0,851, sino la demostración de que un prior estructural aprendido por alineación con la imagen conserva valor para una patología ausente del preentrenamiento. Eso desplaza la pregunta. Hasta ahora, la alineación ECG–RMC se vendía como un modo de mejorar la predicción de fenotipos que ya sabemos medir. Aquí se vende como un modo de destilar la modalidad cara en la modalidad disponible, de una vez por todas, en un país rico en datos, y enviarla después a otra parte. Si ese mecanismo se sostiene, se aplica a cualquier cardiopatía estructural infradiagnosticada por falta de imagen. La verificación que habría que hacer primero es, sin embargo, la que este artículo no hace: aislar qué fenotipos del espacio diana portan realmente la señal chagásica y comprobar que no se está aprendiendo la cohorte de origen. La pregunta de qué codifican realmente los modelos fundacionales médicos enlaza con lo que tratamos en la convergencia representacional de los modelos fundacionales médicos.
Para los clínicos. Hoy no cambia nada. Una puntuación de 0,269 en el challenge, un AUROC de 0,556 en la cohorte más realista, ninguna evaluación prospectiva, ninguna marca regulatoria: estamos en fase de prueba de concepto metodológica. Lo que merece retenerse es el marco de uso, que es inteligente: no se trata de diagnosticar Chagas por el ECG — el diagnóstico sigue siendo serológico — sino de jerarquizar a quién enviar a serología cuando la capacidad de prueba es el cuello de botella. Es un problema de triaje, no de diagnóstico, y es la forma correcta de plantear la pregunta. Queda que el comparador adecuado, ausente aquí, sería una regla clínica simple: edad, zona de residencia, antecedentes familiares, anomalías electrocardiográficas clásicas de la miocardiopatía chagásica. Mientras ese comparador no se supere con datos reales, la ganancia neta sigue siendo desconocida.
Para los pacientes y el público. El interés de fondo de este trabajo es una forma de equidad técnica: propone aprender donde la imagen abunda y desplegar donde solo existe el ECG, sin exigir nunca resonancia en el momento del uso. Es una dirección más honesta que pedir a los países con recursos limitados que adquieran primero el equipamiento de los países ricos. Pero hay que ver el límite, y es estructural: el conocimiento destilado procede de una población británica mayor, y la única prueba realizada sobre una cohorte brasileña verdaderamente distinta arroja una ordenación apenas mejor que el azar. Un modelo formado con corazones de otro sitio no es automáticamente un modelo para los corazones de aquí. La misma tensión atraviesa otros trabajos de IA aplicados a enfermedades desatendidas, como el cribado ecográfico de la fibrosis periportal en la esquistosomiasis.
Para saber más
El preprint: Leveraging Cardiac Imaging to Improve ECG-Based Detection of Chagas Disease in Resource-Constrained Settings, arXiv:2609.08582 [cs.LG], DOI 10.48550/arXiv.2609.08582, depositado el 8 de septiembre de 2026, bajo licencia CC BY 4.0. Autores: Laura Alvarez-Florez y Daniel Uyterlinde (contribución igual), Samuel Ruipérez-Campillo, Lukas P. A. Arts, Folkert W. Asselbergs y Fleur V. Y. Tjong — departamentos de Ingeniería Biomédica y Física y de Cardiología Clínica y Experimental del Amsterdam University Medical Center, grupo Quantitative Healthcare Analysis de la Universidad de Ámsterdam, y Departamento de Informática de la ETH Zúrich. En el manuscrito no figura ninguna declaración de financiación ni de conflictos de interés. El marco de evaluación es el del George B. Moody PhysioNet Challenge 2025, dedicado a la detección de la enfermedad de Chagas a partir del ECG. El comparador principal es Jidling et al., PLoS Neglected Tropical Diseases 2023, 17(7): e0011118. Los conjuntos de datos movilizados son el UK Biobank (Sudlow et al., PLOS Medicine, 2015), CODE-15 % (Ribeiro et al., Zenodo, 2021), la cohorte SaMi-Trop (Cardoso et al., BMJ Open, 2016, 6(5): e011181) y PTB-XL (Wagner et al., PhysioNet, 2022); los modelos fundacionales reutilizados son ECG-FM (McKeen et al., JAMIA Open, 2025) y CineMA (Fu et al., preprint arXiv, 2025). Sobre epidemiología y manejo, la referencia básica es la nota descriptiva de la OMS sobre la enfermedad de Chagas.