Predecir quién se beneficia realmente de la quimioterapia: un modelo causal multimodal en cáncer de mama, sin una sola paciente aleatorizada

Treinta y cuatro autores dirigidos por Ataraxis AI, una empresa neoyorquina, presentan CTX: un modelo que combina la lámina teñida con hematoxilina-eosina y los datos clínicos de rutina para estimar, paciente por paciente, la ganancia absoluta que aporta la quimioterapia en el cáncer de mama HR+/HER2− precoz — 9 141 pacientes en desarrollo, 1 994 en un conjunto de evaluación reservado, diez países. La puntuación supera a Oncotype DX en la prueba de referencia del valor predictivo, y los autores calculan que una asignación guiada por el modelo dividiría por cuatro el número de quimioterapias con la misma tasa de recidiva. Pero ninguna paciente fue aleatorizada, los intervalos de confianza delatan un número muy pequeño de recidivas, y la cifra del resumen — un 30 % de reducción — no es la que da la sección de resultados.

El contexto

Alrededor del 70 % de los cánceres de mama son HR+/HER2−: expresan receptores hormonales (estrógenos, progesterona) y no expresan el receptor HER2. Todas estas pacientes reciben tras la cirugía una hormonoterapia adyuvante, que priva al tumor de la señal estrogénica de la que depende. La pregunta abierta, desde hace veinte años, es a quién añadir además una quimioterapia. Los grandes ensayos mostraron que añadirla mejora la supervivencia en promedio — pero el promedio encubre situaciones muy desiguales, y la quimioterapia cuesta cara en toxicidad: neutropenias, neuropatías periféricas duraderas, cardiotoxicidad de las antraciclinas, menopausia precoz, fatiga prolongada.

Para decidir, las recomendaciones se apoyan en firmas genómicas: la puntuación de recidiva de 21 genes (Oncotype DX), la firma de 70 genes (MammaPrint), la puntuación de 50 genes (Prosigna/PAM50). Todas fueron concebidas y validadas como herramientas pronósticas — estiman el riesgo de recidiva — y luego reutilizadas como predictivas, es decir, como indicadores del beneficio esperado de un tratamiento. La distinción dista de ser un matiz de vocabulario. Un marcador pronóstico dice «este tumor es peligroso»; un marcador predictivo dice «este tumor responderá a ese fármaco». TAILORx, RxPONDER, MINDACT y más recientemente OPTIMA mostraron que se puede retirar la quimioterapia a las pacientes clasificadas de bajo riesgo genómico sin empeorar los resultados en promedio. Nunca mostraron que un alto riesgo genómico identifique a las pacientes quimiosensibles: entre las de alto riesgo, algunas no obtienen nada de la quimioterapia y serían candidatas más bien a una escalada con otros agentes, como los inhibidores de CDK4/6.

Ese hueco es lo que ataca el artículo. En lugar de predecir el riesgo y leerlo como beneficio, propone estimar directamente, para cada paciente, la diferencia entre dos futuros: probabilidad de recidiva con hormonoterapia sola, probabilidad de recidiva con hormonoterapia más quimioterapia. La diferencia es el beneficio personalizado. Y como esa lectura se hace sobre una lámina de hematoxilina-eosina ya producida de rutina en todo cáncer de mama, no exige ninguna prueba molecular adicional, ningún tejido adicional, ni los varios miles de euros que cuestan las firmas comerciales.

El método

Los datos. Un conjunto observacional multinacional de 11 135 pacientes con cáncer de mama precoz, procedente de 17 cohortes en diez países. División: 9 141 pacientes en desarrollo (12 cohortes, nueve países), 1 994 pacientes HR+/HER2− en un conjunto de evaluación reservado (5 cohortes, tres países), incluidas cohortes francesas (UNIRAD, Centre Léon Bérard, Institut Curie, Gustave Roussy, Centre Jean Perrin y el IUCT-Oncopole figuran entre las afiliaciones). Cada paciente aporta sus variables clínicas armonizadas y al menos una lámina digitalizada. Recibieron quimioterapia el 47,4 % de las pacientes de desarrollo y el 40,7 % de las de evaluación. El criterio de valoración es el intervalo libre de recidiva (RFI) a cinco años: tiempo desde el diagnóstico hasta la primera recidiva locorregional o a distancia, tratando la muerte como censura.

El codificador de patología. Las láminas se dividen en teselas de 224 × 224 píxeles, codificadas por Falcon, el modelo de fundación propio de Ataraxis AI — sucesor de Kestrel —, un vision transformer gigante preentrenado por autosupervisión sobre más de dos mil millones de teselas con una receta próxima a DINOv2: se enseña al modelo a producir la misma representación de una región de tejido vista bajo dos transformaciones distintas, sin ninguna etiqueta. Falcon permanece congelado durante el desarrollo de CTX; sus salidas se agregan en una única representación por lámina mediante multiple instance learning (aprendizaje por bolsas: no se sabe qué tesela porta la señal, solo que la lámina entera está asociada a un desenlace). Las variables clínicas pasan en paralelo por una red tabular residual, y ambas representaciones se fusionan mediante una capa de atención con compuertas.

El componente causal. Es el núcleo del artículo. Como la quimioterapia no se aleatorizó, las pacientes tratadas difieren sistemáticamente de las demás: más jóvenes, tumores mayores, más ganglios afectados. Un modelo ingenuo entrenado sobre eso aprendería sobre todo a reconocer quién fue tratada, y fallaría gravemente en el escenario contrafactual — lo que le habría ocurrido a la misma paciente con el otro tratamiento. Los autores emplean por ello un CFRNet (red de regresión contrafactual): la red aprende una representación interna en la que ambos grupos de tratamiento se parecen, penalizando explícitamente la distancia entre sus distribuciones con una medida llamada maximum mean discrepancy. Sobre esa representación equilibrada, dos cabezas de supervivencia predicen el riesgo de recidiva a cinco años bajo cada tratamiento. De ahí las dos salidas: CTX-prognostic, el riesgo bajo el tratamiento realmente recibido, y CTX-τ, el aumento absoluto predicho de la probabilidad de permanecer libre de recidiva gracias a la quimioterapia.

El umbral del 2 % separa alto y bajo beneficio. Está justificado: las pacientes declaran que una ganancia del 1 % basta para que la quimioterapia merezca la pena, un panel de consenso de oncólogos sitúa el listón en el 3–5 %, y los autores toman el punto intermedio insistiendo en que la puntuación sigue siendo continua para que cada binomio médico-paciente fije su propio corte.

La evaluación. También aquí el tratamiento no está aleatorizado en el conjunto de evaluación. Los autores estiman por tanto una puntuación de propensión — la probabilidad, dadas las covariables clínicas, de que una paciente recibiera quimioterapia — y reponderan todos los análisis por su inverso (IPW). Efecto medido: la diferencia media estandarizada absoluta entre grupos cae de 0,376 a 0,125, por debajo del umbral de 0,20 considerado convencionalmente como desequilibrio despreciable.

Los resultados

Pronóstico. En las 1 994 pacientes reservadas, CTX-prognostic obtiene un AUC dependiente del tiempo de 0,711 [IC 95 %: 0,663–0,756] a cinco años y 0,765 [0,708–0,791] a diez — siendo el AUC la probabilidad de que el modelo clasifique por encima a una paciente que recidiva frente a una que no. Discriminación honesta, sin más, comparable a la de las mejores puntuaciones clínicas. La puntuación sigue siendo un predictor independiente tras ajustar por edad, estadio tumoral y estadio ganglionar (HR ajustado 2,02 [1,44–2,83] a cinco años; 2,28 [1,73–3,00] a diez). La calibración — la concordancia entre probabilidad anunciada y frecuencia observada — es el resultado más sólido del conjunto: pendiente 1,00 [0,82–1,18], ordenada en el origen 0,00 [−0,01; 0,01]. Un modelo que anuncia un 8 % de riesgo ve efectivamente un 8 % de recidivas.

Valor predictivo. En las pacientes clasificadas de bajo beneficio, la quimioterapia no cambia nada medible (HR 1,40 [0,77–2,57], p = 0,270). En las de alto beneficio, reduce el riesgo a menos de la mitad (HR 0,42 [0,20–0,88], p = 0,022). La prueba de referencia es la interacción tratamiento × biomarcador en un modelo de Cox: es significativa tras la ponderación IPW (p = 8,11 × 10⁻⁵) y lo sigue siendo en versión continua (HR por desviación típica 0,67 [0,57–0,79], p = 2,09 × 10⁻⁶), lo que descarta un artefacto de umbral. La ablación muestra que la clínica sola (p = 4,41 × 10⁻⁴) y la patología sola (p = 7,90 × 10⁻³) portan cada una señal, y que añadir la patología mejora significativamente el ajuste más allá de la clínica (prueba de razón de verosimilitud, p = 9,79 × 10⁻³). Frente a un panel de marcadores establecidos — edad, estadio, grado, histología, Ki67 —, ninguno alcanza la significación; solo Oncotype DX lo hace (p = 0,0247). En la comparación estricta sobre las 983 pacientes con ambas puntuaciones, CTX-τ conserva la interacción más fuerte (p = 9,68 × 10⁻⁴ frente a 0,0247).

Decisión terapéutica. Es la cifra que hará titulares. En el conjunto de evaluación, el 40,7 % de las pacientes recibió quimioterapia, con una tasa de supervivencia libre de recidiva a cinco años del 93,7 %. Ordenando a las pacientes por CTX-τ decreciente, los autores estiman que se alcanzaría la misma tasa tratando solo al 10,5 % — una reducción relativa del 74,2 %. Otra lectura: con una tasa de tratamiento idéntica, la tasa de recidiva pasaría del 6,3 % al 5,4 %, es decir −14,3 % en relativo.

En traducción clínica. De cada 1 000 pacientes comparables a esta cohorte, 407 reciben hoy quimioterapia y 63 recidivarán en cinco años. La estrategia guiada por CTX trataría a 105 para el mismo número de recidivas: 302 quimioterapias evitadas por cada 1 000 pacientes. A la inversa, tratando a las mismas 407 se evitarían 9 recidivas por cada 1 000. Hay que poner estas cifras junto a una tercera, que el artículo recoge sin destacarla: en el conjunto de la cohorte de evaluación, el beneficio medio de la quimioterapia es del 0,30 % en probabilidad de supervivencia libre de recidiva a cinco años. Tres pacientes de cada mil. Sobre esa cantidad minúscula, y sobre su heterogeneidad, versa todo el ejercicio.

Biología y transferencia. Tres patólogos especializados en mama, ciegos a las predicciones, revisaron los grupos morfológicos asociados a la puntuación. Los tumores de alto beneficio muestran nidos de carcinoma invasivo, celularidad elevada, grado nuclear intermedio a alto, figuras mitóticas identificables; los de bajo beneficio están dominados por estroma fibrótico y tejido adiposo, con poco o ningún carcinoma invasivo. En lo molecular, en TCGA (n = 348), los tumores de alto beneficio están enriquecidos en vías de proliferación (dianas E2F, punto de control G2M, dianas MYC, mTORC1), reparación del ADN y activación inmunitaria (interferones α y γ, cGAS-STING); los de bajo beneficio en transición epitelio-mesenquimatosa, angiogénesis y respuesta estrogénica temprana. Por último, el modelo congelado, aplicado sin recalibración alguna a 6 692 pacientes de 16 tipos de cáncer de TCGA, conserva señal pronóstica significativa en 11 de 16, y en 6 de los 7 tipos tratados con regímenes de la misma familia citotóxica.

Lo que está bien

La pregunta planteada es la correcta, y está bien planteada. Separar explícitamente el pronóstico de la quimiosensibilidad, producir dos salidas distintas en lugar de una puntuación única reinterpretada, y demostrarlo mediante la correlación entre ambas — CTX-τ solo correlaciona r = 0,389 con la puntuación Oncotype DX, r = 0,345 con el tamaño tumoral, r = 0,340 con el número de ganglios — es el punto teórico del artículo, y está respaldado. Incluso la correlación con CTX-prognostic, producido por el mismo modelo, se queda en r = 0,720: los dos ejes no se solapan.

La evaluación emplea la prueba adecuada y declara sus supuestos. La interacción tratamiento × biomarcador en un modelo de Cox es la referencia en oncología para establecer que un marcador es predictivo y no solo pronóstico, y los autores la reportan dicotomizada, continua, con y sin ponderación de propensión, en cinco cohortes reservadas de tres países. Sobre todo, publican el desequilibrio antes y después de reponderar (0,376 → 0,125): dar la medida del problema que se pretende corregir sigue siendo raro, y permite al lector juzgar. La calibración se reporta con pendiente y ordenada, no con un gráfico cualitativo. La comparación con Oncotype DX se hace en las mismas pacientes, no en dos poblaciones distintas.

La explicabilidad no es un mapa de calor. Tres patólogos certificados, ciegos a predicciones y desenlaces, anotan los grupos morfológicos; el análisis molecular se realiza por separado, y los propios autores precisan que es exploratorio puesto que TCGA pertenece al conjunto de desarrollo. Ambas lecturas convergen en la misma historia — proliferación, estrés replicativo, déficit de recombinación homóloga por un lado; firma estrogénica y resistencia mediada por el microambiente por otro — lo cual es biológicamente plausible para citotóxicos que actúan sobre células en división.

Lo que está menos bien

Ninguna paciente fue aleatorizada, y eso no se repara ponderando. Toda la construcción descansa en el supuesto de ausencia de confusión no medida: que las variables clínicas armonizadas bastan para explicar por qué una paciente recibió quimioterapia y otra no. Ese supuesto es indemostrable, y en oncología mamaria es francamente dudoso. La decisión de quimioterapia depende en la práctica del estado general, de las comorbilidades cardíacas y hematológicas, del deseo de gestación, de la preferencia de la paciente informada, de la costumbre del centro, del año de atención — nada de lo cual figura en un registro armonizado multipaís. La puntuación de propensión reequilibra solo lo que observa; es ciega al resto por construcción. Una diferencia estandarizada residual de 0,125 dice que el equilibrio es bueno en las variables incluidas, no que la confusión haya desaparecido. Es el modo de fallo del comparador sesgado en su versión más tenaz: lo que el modelo llama quimiosensibilidad podría ser, en parte, la huella de las razones no registradas que llevaron a tratar.

Los intervalos de confianza dicen que los eventos son muy pocos. Con una tasa de recidiva a cinco años del 6,3 % en 1 994 pacientes, hablamos del orden de 125 eventos para todo el conjunto de evaluación — que luego se reparten entre dos categorías de beneficio y dos brazos de tratamiento. El resultado clave, HR 0,42 [0,20–0,88] con p = 0,022, es compatible con dividir el riesgo por cinco y con una reducción del 12 %. El grupo de bajo beneficio, HR 1,40 [0,77–2,57], no permite excluir ni beneficio ni perjuicio. Las tablas de pacientes en riesgo bajo las curvas de Kaplan-Meier están ponderadas por IPW y por tanto no corresponden a efectivos reales, lo que dificulta aún más juzgar la robustez. El contraste entre valores de p con seis decimales e intervalos tan amplios es en sí mismo informativo: la significación se sostiene, la precisión no. Es el mismo problema ya visto en otros modelos pronósticos validados con muy pocos eventos.

La morfología descrita se parece a una medida de contenido tumoral. Los tumores clasificados de bajo beneficio están, según los propios patólogos revisores, dominados por estroma fibrótico y grasa «con poco o ningún carcinoma invasivo». Hay dos lecturas. O bien el modelo captó una biología de resistencia ligada al microambiente — la lectura de los autores, coherente con el enriquecimiento en transición epitelio-mesenquimatosa. O bien mide sobre todo la cantidad de tumor presente en la lámina digitalizada, es decir, un artefacto de muestreo y de tallado que correlaciona con la carga tumoral, y por tanto con el riesgo y con el beneficio esperado. Es un candidato clásico de shortcut learning, y el artículo no reporta ningún control que lo dirima: ningún análisis emparejado por contenido tumoral, ninguna prueba en láminas recortadas a la zona invasiva, ninguna comparación entre bloques de un mismo caso. La misma trampa ya se demostró en imagen mamaria, donde un modelo aprendía la firma del centro de origen en lugar de la lesión, y la fragilidad de los modelos de fundación en patología ante las variaciones de preparación está documentada.

Se añaden tres puntos que invitan a la prudencia. Resumen y resultados no dan la misma cifra: el primero anuncia una reducción del número de pacientes quimiotratadas «del 30 %», el segundo calcula un paso del 40,7 % al 10,5 %, es decir 74,2 % en relativo. Ambas no pueden describir la misma cantidad; el lector no sabe cuál es la correcta, y es precisamente la cifra que se citará. El modelo es propietario: Falcon y Kestrel son los modelos de fundación de Ataraxis AI, el primer y el último autor están afiliados a la empresa, la correspondencia pasa por una dirección corporativa, y nada en el texto anuncia pesos públicos. Estamos lejos de algo reproducible por un laboratorio académico. Por último, la transferencia «zero-shot» se presenta con más generosidad de la que se mide: usa la supervivencia global y no la recidiva, en TCGA, con la separación alto/bajo beneficio fijada en el percentil 90, y fracasa en 5 de 16 tipos de cáncer — lo que no impide ver una señal, pero no fundamenta la idea de una «estrategia universal».

Lo que cambia

Para la comunidad investigadora, el artículo instala limpiamente una distinción metodológica que le faltaba a la patología computacional: dejar de tratar una puntuación pronóstica como sustituto del beneficio terapéutico, y aprender directamente el efecto del tratamiento con una red de representación equilibrada. La demostración de que la lámina H&E aporta información de quimiosensibilidad no recuperable de las variables clínicas (p = 9,79 × 10⁻³) es el resultado más reproducible del conjunto, y el más fácil de replicar en otros lugares. Abre además una pregunta incómoda y útil: si un modelo causal entrenado con datos observacionales produce interacciones tratamiento-biomarcador más significativas que una prueba validada en ensayos aleatorizados, ¿hay que leer ahí mejor biología o confusión residual mejor explotada? La literatura sobre el aprendizaje de políticas terapéuticas con datos retrospectivos sugiere que la pregunta merece plantearse antes, no después.

Para los clínicos, hoy no cambia nada, y hay que decirlo con claridad. Una puntuación predictiva de quimiosensibilidad no puede adoptarse por la fe en análisis retrospectivos reponderados, por cuidadosos que sean: el propio Oncotype DX entró en las recomendaciones solo tras TAILORx y RxPONDER, es decir, tras ensayos prospectivos en los que la desescalada era el brazo estudiado. La prueba que se espera aquí es de la misma naturaleza: un ensayo en el que la asignación de quimioterapia la decida el modelo en un brazo y la práctica estándar en el otro. Mientras no exista, CTX es una hipótesis cuantificada, no una herramienta de decisión. Lo que sí merece retenerse es el orden de magnitud que recuerda el artículo: un beneficio medio del 0,30 % a cinco años en toda una población HR+/HER2− significa que la inmensa mayoría de las quimioterapias prescritas en ese grupo no aportan nada a quienes las reciben. El problema del sobretratamiento es real, sea cual sea la solución.

Para las pacientes y el público general, la promesa es fácil de formular y difícil de cumplir: leer en una lámina ya producida, sin prueba adicional ni sobrecoste, si merece la pena someterse a una quimioterapia. La distancia entre esa promesa y el estado de la evidencia cabe en una frase: sabemos que la puntuación separa grupos con desenlaces distintos en expedientes del pasado; no sabemos todavía qué ocurriría con mujeres cuyo tratamiento se decidiera con ella. Los dos casos presentados en el artículo — dos pacientes clínicamente indistinguibles cuyos destinos siguieron la predicción — son esclarecedores para entender el concepto, y los propios autores precisan que no establecen exactitud alguna. Es una cautela honesta; merece repetirse cada vez que se cite el resultado.

Para profundizar

El artículo: Causal multi-modal AI for personalized chemosensitivity prediction, arXiv:2609.13567 (cs.AI), depositado el 11 de septiembre de 2026, DOI 10.48550/arXiv.2609.13567.

Sobre el marco causal empleado: las redes de regresión contrafactual (CFRNet) de Shalit, Johansson y Sontag, que introducen la penalización de equilibrado entre grupos de tratamiento. Sobre los ensayos que hoy sirven de referencia para la desescalada de quimioterapia en cáncer de mama HR+/HER2−: TAILORx (NCT00310180), RxPONDER (NCT01272037), MINDACT (NCT00433589), OPTIMA (ISRCTN42400492). Sobre la base de imagen: DINOv2 para el método de autosupervisión, y los modelos de fundación en patología digital, de los que decriptamos el caso de GigaPath.