Prédire qui tire un bénéfice réel de la chimiothérapie : un modèle causal multimodal en cancer du sein, sans une seule patiente tirée au sort
Trente-quatre auteurs menés par Ataraxis AI, une société new-yorkaise, présentent CTX : un modèle qui combine la lame d'anatomopathologie et les données cliniques de routine pour estimer, patiente par patiente, le gain absolu apporté par la chimiothérapie dans le cancer du sein HR+/HER2− précoce — 9 141 patientes en développement, 1 994 dans un jeu d'évaluation tenu à l'écart, dix pays. Le score bat Oncotype DX sur le test de référence de la valeur prédictive, et les auteurs calculent qu'une allocation guidée par le modèle diviserait par quatre le nombre de chimiothérapies prescrites à taux de récidive constant. Mais aucune patiente n'a été tirée au sort, les intervalles de confiance trahissent un très petit nombre de récidives, et le chiffre du résumé — 30 % de réduction — n'est pas celui que donne la section résultats.
Le contexte
Environ 70 % des cancers du sein sont dits HR+/HER2− : ils expriment les récepteurs hormonaux (œstrogènes, progestérone) et n'expriment pas le récepteur HER2. Toutes ces patientes reçoivent après chirurgie une hormonothérapie adjuvante, qui prive la tumeur du signal œstrogénique dont elle dépend. La question ouverte, depuis vingt ans, est de savoir à qui ajouter une chimiothérapie par-dessus. Les grands essais ont montré que cet ajout améliore la survie en moyenne — mais la moyenne recouvre des situations extrêmement inégales, et la chimiothérapie coûte cher en toxicité : neutropénies, neuropathies périphériques durables, cardiotoxicité des anthracyclines, ménopause précoce, fatigue prolongée.
Pour trancher, les recommandations s'appuient sur des signatures génomiques : le score de récidive à 21 gènes (Oncotype DX), la signature à 70 gènes (MammaPrint), le score à 50 gènes (Prosigna/PAM50). Ces tests ont tous été conçus et validés comme pronostiques — ils estiment le risque de récidive — puis réutilisés comme prédictifs, c'est-à-dire comme indicateurs du bénéfice attendu d'un traitement. La distinction est loin d'être un détail de vocabulaire. Un marqueur pronostique dit « cette tumeur est dangereuse » ; un marqueur prédictif dit « cette tumeur répondra à ce médicament-là ». Les essais TAILORx, RxPONDER, MINDACT et plus récemment OPTIMA ont montré qu'on peut retirer la chimiothérapie aux patientes classées à bas risque génomique sans dégrader les résultats en moyenne. Ils n'ont jamais montré qu'un haut risque génomique identifie les patientes chimiosensibles : parmi les haut risque, certaines ne tirent rien de la chimiothérapie et relèveraient plutôt d'une escalade avec d'autres agents, comme les inhibiteurs de CDK4/6.
C'est cet écart que le papier attaque. Plutôt que de prédire le risque puis de l'interpréter comme un bénéfice, il propose d'estimer directement, pour chaque patiente, la différence entre deux futurs : probabilité de récidive sous hormonothérapie seule, probabilité de récidive sous hormonothérapie plus chimiothérapie. La différence est le bénéfice personnalisé. Et parce que cette lecture se fait sur une lame colorée à l'hématoxyline-éosine, déjà produite en routine pour tout cancer du sein, elle n'exige ni test moléculaire supplémentaire, ni tissu supplémentaire, ni les quelques milliers d'euros que coûtent les signatures commerciales.
La méthode
Les données. Un ensemble observationnel multinational de 11 135 patientes atteintes d'un cancer du sein précoce, issu de 17 cohortes réparties sur dix pays. Découpage : 9 141 patientes en développement (12 cohortes, neuf pays), 1 994 patientes HR+/HER2− dans un jeu d'évaluation tenu à l'écart (5 cohortes, trois pays), dont des cohortes françaises (UNIRAD, Centre Léon Bérard, Institut Curie, Gustave Roussy, Centre Jean Perrin, IUCT-Oncopole figurent parmi les affiliations). Chaque patiente apporte ses variables cliniques harmonisées et au moins une lame numérisée. La chimiothérapie a été reçue par 47,4 % des patientes en développement et 40,7 % en évaluation. Le critère de jugement est le recurrence-free interval (RFI) à cinq ans : délai entre diagnostic et première récidive locorégionale ou à distance, le décès étant traité comme une censure.
L'encodeur de pathologie. Les lames sont découpées en imagettes de 224 × 224 pixels, encodées par Falcon, le modèle de fondation maison d'Ataraxis AI — successeur de Kestrel —, un vision transformer géant pré-entraîné en auto-supervision sur plus de deux milliards d'imagettes selon une recette proche de DINOv2 : on apprend au modèle à produire la même représentation d'une région de tissu vue sous deux transformations différentes, sans aucune étiquette. Falcon reste gelé pendant le développement de CTX ; ses sorties sont agrégées en une représentation unique par lame via multiple instance learning (apprentissage par sacs : on ne sait pas quelle imagette porte le signal, seulement que la lame entière est associée à une issue). Les variables cliniques passent en parallèle dans un réseau tabulaire résiduel, et les deux représentations sont fusionnées par une couche d'attention à portes.
La brique causale. C'est le cœur du papier. Puisque la chimiothérapie n'a pas été tirée au sort, les patientes traitées diffèrent systématiquement des autres : plus jeunes, tumeurs plus grosses, plus de ganglions envahis. Un modèle naïf entraîné là-dessus apprendrait surtout à reconnaître qui a été traité, et se tromperait lourdement sur le scénario contrefactuel — ce qui serait arrivé à la même patiente sous l'autre traitement. Les auteurs emploient donc un CFRNet (counterfactual regression network) : le réseau apprend une représentation interne dans laquelle les deux groupes de traitement se ressemblent, en pénalisant explicitement l'écart entre leurs distributions par une mesure appelée maximum mean discrepancy. Sur cette représentation équilibrée, deux têtes de survie prédisent le risque de récidive à cinq ans sous chaque traitement. D'où les deux sorties : CTX-prognostic, le risque sous le traitement réellement reçu, et CTX-τ, l'augmentation absolue prédite de la probabilité de rester sans récidive grâce à la chimiothérapie.
Le seuil de 2 % sépare fort et faible bénéfice. Il est justifié : les patientes déclarent qu'un gain de 1 % suffit à rendre la chimiothérapie acceptable, un panel d'oncologues situe le seuil à 3–5 %, et les auteurs prennent l'entre-deux tout en insistant que le score reste continu et que chaque binôme médecin-patiente peut fixer son propre curseur.
L'évaluation. Là encore le traitement n'est pas randomisé dans le jeu d'évaluation. Les auteurs estiment donc un score de propension — la probabilité, au vu des covariables cliniques, qu'une patiente ait reçu la chimiothérapie — et repondèrent toutes les analyses par l'inverse de ce score (IPW). Effet mesuré : la différence standardisée moyenne absolue entre groupes tombe de 0,376 à 0,125, sous le seuil de 0,20 conventionnellement considéré comme un déséquilibre négligeable.
Les résultats
Pronostic. Sur les 1 994 patientes tenues à l'écart, CTX-prognostic obtient une AUC dépendante du temps de 0,711 [IC 95 % : 0,663–0,756] à cinq ans et 0,765 [0,708–0,791] à dix ans — l'AUC étant la probabilité que le modèle classe correctement une patiente qui récidive au-dessus d'une patiente qui ne récidive pas. C'est une discrimination honnête, sans plus, comparable à ce que donnent les meilleurs scores cliniques. Le score reste prédicteur indépendant après ajustement sur l'âge, le stade tumoral et le stade ganglionnaire (HR ajusté 2,02 [1,44–2,83] à cinq ans ; 2,28 [1,73–3,00] à dix ans). La calibration — l'accord entre probabilité annoncée et fréquence observée — est le résultat le plus solide du lot : pente 1,00 [0,82–1,18], ordonnée à l'origine 0,00 [−0,01 ; 0,01]. Un modèle qui annonce 8 % de risque voit bien 8 % de récidives.
Valeur prédictive. Chez les patientes classées faible bénéfice, la chimiothérapie ne change rien de mesurable (HR 1,40 [0,77–2,57], p = 0,270). Chez celles classées fort bénéfice, elle divise le risque par plus de deux (HR 0,42 [0,20–0,88], p = 0,022). Le test de référence est l'interaction traitement × biomarqueur dans un modèle de Cox : elle est significative après pondération IPW (p = 8,11 × 10⁻⁵), et le reste en version continue (HR par écart-type 0,67 [0,57–0,79], p = 2,09 × 10⁻⁶), ce qui écarte l'hypothèse d'un artefact de seuil. L'ablation montre que la clinique seule (p = 4,41 × 10⁻⁴) et la pathologie seule (p = 7,90 × 10⁻³) portent chacune du signal, et que l'ajout de la pathologie améliore significativement l'ajustement au-delà de la clinique (test du rapport de vraisemblance, p = 9,79 × 10⁻³). Face à un panel de marqueurs établis — âge, stade, grade, histologie, Ki67 —, aucun n'atteint la significativité ; seul Oncotype DX le fait (p = 0,0247). Dans la comparaison stricte sur les 983 patientes disposant des deux scores, CTX-τ conserve l'interaction la plus forte (p = 9,68 × 10⁻⁴ contre 0,0247).
Décision thérapeutique. C'est le chiffre qui fera les titres. Dans le jeu d'évaluation, 40,7 % des patientes ont reçu une chimiothérapie, pour un taux de survie sans récidive à cinq ans de 93,7 %. En classant les patientes par CTX-τ décroissant, les auteurs estiment qu'on atteindrait le même taux en ne traitant que 10,5 % d'entre elles — une réduction relative de 74,2 %. Autre lecture : à taux de traitement identique, le taux de récidive passerait de 6,3 % à 5,4 %, soit −14,3 % en relatif.
En traduction clinique. Sur 1 000 patientes comparables à cette cohorte, 407 reçoivent aujourd'hui une chimiothérapie et 63 récidiveront dans les cinq ans. La stratégie guidée par CTX en traiterait 105 pour le même nombre de récidives : 302 chimiothérapies évitées pour 1 000 patientes. À l'inverse, en traitant les mêmes 407, on épargnerait 9 récidives sur 1 000. Il faut mettre ces chiffres à côté d'un troisième, que le papier rapporte sans le mettre en avant : à l'échelle de toute la cohorte d'évaluation, le bénéfice moyen de la chimiothérapie est de 0,30 % en probabilité de survie sans récidive à cinq ans. Trois patientes sur mille. C'est sur cette quantité minuscule, et sur son hétérogénéité, que porte tout l'exercice.
Biologie et transfert. Trois anatomopathologistes spécialisés en sénologie, en aveugle des prédictions, ont relu les groupes morphologiques associés au score. Les tumeurs à fort bénéfice montrent des nids de carcinome invasif, une cellularité élevée, un grade nucléaire intermédiaire à élevé, des mitoses identifiables ; celles à faible bénéfice sont dominées par du stroma fibreux et du tissu adipeux, avec peu ou pas de carcinome invasif. Côté moléculaire, dans TCGA (n = 348), les tumeurs à fort bénéfice sont enrichies en voies de prolifération (cibles E2F, point de contrôle G2M, cibles MYC, mTORC1), de réparation de l'ADN et d'activation immunitaire (interférons α et γ, cGAS-STING) ; celles à faible bénéfice en transition épithélio-mésenchymateuse, angiogenèse et réponse œstrogénique précoce. Enfin, le modèle gelé, appliqué sans aucun réajustement à 6 692 patients de 16 types de cancer de TCGA, conserve un signal pronostique significatif dans 11 types sur 16, et dans 6 des 7 types traités par des régimes de même famille cytotoxique.
Ce qui est bien
La question posée est la bonne, et elle est posée proprement. Séparer explicitement le pronostic de la chimiosensibilité, produire deux sorties distinctes plutôt qu'un score unique réinterprété, et le démontrer par la corrélation entre les deux — CTX-τ n'est corrélé qu'à r = 0,389 au score Oncotype DX, r = 0,345 à la taille tumorale, r = 0,340 au nombre de ganglions — c'est le point théorique du papier, et il est étayé. Même la corrélation avec CTX-prognostic, pourtant produit par le même modèle, plafonne à r = 0,720 : les deux axes ne se recouvrent pas.
L'évaluation emploie le bon test et rend compte de ses hypothèses. L'interaction traitement × biomarqueur dans un modèle de Cox est bien la référence en oncologie pour établir qu'un marqueur est prédictif et pas seulement pronostique, et les auteurs la rapportent en version dichotomisée, en version continue, avec et sans pondération de propension, sur cinq cohortes tenues à l'écart dans trois pays. Surtout, ils publient le déséquilibre avant et après repondération (0,376 → 0,125) : donner la mesure du problème qu'on prétend corriger reste rare, et permet au lecteur de juger. La calibration est rapportée avec pente et ordonnée, pas par un graphique qualitatif. La comparaison à Oncotype DX est faite sur les mêmes patientes, pas sur deux populations différentes.
L'explicabilité n'est pas une carte de chaleur. Trois anatomopathologistes certifiés, en aveugle des prédictions et des issues, annotent les groupes morphologiques ; l'analyse moléculaire est menée séparément, et les auteurs précisent d'eux-mêmes qu'elle est exploratoire puisque TCGA appartient au jeu de développement. Les deux lectures convergent vers la même histoire — prolifération, stress réplicatif, déficit de recombinaison homologue d'un côté ; signature œstrogénique et résistance microenvironnementale de l'autre — ce qui est biologiquement plausible pour des cytotoxiques agissant sur les cellules en division.
Ce qui est moins bien
Aucune patiente n'a été tirée au sort, et c'est irréparable par pondération. Toute la construction repose sur l'hypothèse d'absence de confusion non mesurée : que les variables cliniques harmonisées suffisent à expliquer pourquoi telle patiente a reçu une chimiothérapie et telle autre non. Cette hypothèse est indémontrable, et en cancérologie du sein elle est franchement douteuse. La décision de chimiothérapie dépend en pratique de l'état général, des comorbidités cardiaques et hématologiques, du désir de grossesse, de la préférence de la patiente informée, de l'habitude du centre, de l'année de prise en charge — aucun de ces éléments ne figure dans un dossier harmonisé multipays. Le score de propension ne rééquilibre que ce qu'il observe ; il est aveugle au reste par construction. Une différence standardisée résiduelle de 0,125 dit que l'équilibre est bon sur les variables incluses, pas que la confusion a disparu. C'est le mode d'échec du comparateur biaisé dans sa version la plus tenace : ce que le modèle appelle chimiosensibilité pourrait être, pour partie, la trace des raisons non enregistrées qui ont conduit à traiter.
Les intervalles de confiance disent que les événements sont très peu nombreux. Avec un taux de récidive à cinq ans de 6,3 % sur 1 994 patientes, on est de l'ordre de 125 événements pour l'ensemble du jeu d'évaluation — à répartir ensuite entre deux catégories de bénéfice et deux bras de traitement. Le résultat clé, HR 0,42 [0,20–0,88] avec p = 0,022, est compatible avec une division du risque par cinq comme avec une réduction de 12 %. Le groupe faible bénéfice, HR 1,40 [0,77–2,57], ne permet d'exclure ni un bénéfice ni un préjudice. Les tables de patients à risque affichées sous les courbes de Kaplan-Meier sont pondérées par IPW et ne correspondent donc pas à des effectifs réels, ce qui rend l'appréciation de la robustesse plus difficile encore. Le contraste entre des valeurs de p à six décimales et des intervalles aussi larges est en soi une information : la significativité tient, la précision non. On rejoint ici un problème déjà vu sur d'autres modèles pronostiques validés sur très peu d'événements.
La morphologie décrite ressemble à une mesure de contenu tumoral. Les tumeurs classées faible bénéfice sont, de l'aveu des pathologistes relecteurs, dominées par du stroma fibreux et de la graisse « avec peu ou pas de carcinome invasif ». Il y a deux lectures. Ou bien le modèle a capté une biologie de résistance liée au microenvironnement — c'est la lecture des auteurs, cohérente avec l'enrichissement en transition épithélio-mésenchymateuse. Ou bien il mesure surtout la quantité de tumeur présente sur la lame numérisée, c'est-à-dire un artefact d'échantillonnage et de macroscopie, qui corrèle à la charge tumorale, donc au risque, donc au bénéfice attendu. C'est un candidat classique de shortcut learning, et le papier ne rapporte aucun contrôle qui le départage : pas d'analyse à contenu tumoral apparié, pas de test sur lames rognées à la zone invasive, pas de comparaison entre blocs d'un même cas. Le même piège a déjà été démontré ailleurs en imagerie du sein, où un modèle apprenait la signature du centre d'origine plutôt que la lésion, et la fragilité des modèles de fondation en pathologie face aux variations de préparation est documentée.
S'ajoutent trois points qui appellent à la prudence. Le résumé et les résultats ne donnent pas le même chiffre : le premier annonce une réduction du nombre de patientes chimiotraitées « de 30 % », le second calcule un passage de 40,7 % à 10,5 %, soit 74,2 % en relatif. Les deux ne peuvent pas décrire la même quantité ; le lecteur ne sait pas laquelle est la bonne, et c'est précisément le chiffre qui sera cité. Le modèle est propriétaire : Falcon et Kestrel sont les modèles de fondation d'Ataraxis AI, le premier et le dernier auteur y sont affiliés, la correspondance passe par une adresse d'entreprise, et rien dans le texte n'annonce de poids publics. On est très loin d'un outil reproductible par un laboratoire académique. Enfin, le transfert « zero-shot » est présenté plus généreusement qu'il ne se mesure : il porte sur la survie globale et non sur la récidive, dans TCGA, avec une séparation haut/bas bénéfice fixée au 90e percentile, et il échoue dans 5 types de cancer sur 16 — ce qui n'interdit pas d'y voir un signal, mais ne fonde pas l'idée d'une « stratégie universelle ».
Ce que ça change
Pour la communauté de recherche, le papier installe proprement une distinction méthodologique qui manquait à la pathologie computationnelle : cesser de traiter un score pronostique comme un substitut de bénéfice thérapeutique, et apprendre directement l'effet du traitement avec un réseau à représentation équilibrée. La démonstration que la lame H&E apporte de l'information de chimiosensibilité non récupérable dans les variables cliniques (p = 9,79 × 10⁻³) est le résultat le plus reproductible du lot, et le plus facile à répliquer ailleurs. Elle ouvre aussi une question inconfortable et utile : si un modèle causal entraîné sur des données observationnelles produit des interactions traitement-biomarqueur plus significatives qu'un test validé sur essais randomisés, faut-il y lire une meilleure biologie ou une confusion résiduelle mieux exploitée ? La littérature sur l'apprentissage de politiques thérapeutiques sur données rétrospectives suggère que la question mérite d'être posée avant, pas après.
Pour les cliniciens, rien ne change aujourd'hui, et il faut le dire nettement. Un score prédictif de chimiosensibilité ne peut pas être adopté sur la foi d'analyses rétrospectives repondérées, si soignées soient-elles : Oncotype DX lui-même n'est entré dans les recommandations qu'après TAILORx et RxPONDER, c'est-à-dire après des essais prospectifs où la désescalade était le bras étudié. La preuve attendue ici est de même nature : un essai où l'allocation de la chimiothérapie est décidée par le modèle dans un bras et par la pratique standard dans l'autre. Tant qu'il n'existe pas, CTX est une hypothèse chiffrée, pas un outil de décision. Ce qui mérite d'être retenu en revanche, c'est l'ordre de grandeur rappelé par le papier : un bénéfice moyen de 0,30 % à cinq ans à l'échelle d'une population HR+/HER2− entière signifie que la très grande majorité des chimiothérapies prescrites dans ce groupe n'apportent rien à celles qui les reçoivent. Le problème du surtraitement est réel, quelle que soit la solution.
Pour les patientes et le grand public, la promesse est facile à formuler et difficile à tenir : lire sur une lame déjà produite, sans test supplémentaire ni surcoût, si une chimiothérapie vaut la peine d'être subie. L'écart entre cette promesse et l'état de la preuve tient en une phrase : on sait que le score sépare des groupes aux devenirs différents dans des dossiers du passé, on ne sait pas encore ce qui arriverait à des femmes dont le traitement serait décidé par lui. Les deux études de cas présentées dans le papier — deux patientes cliniquement indiscernables dont les destins ont suivi la prédiction — sont éclairantes pour comprendre le concept, et les auteurs précisent eux-mêmes qu'elles n'établissent aucune exactitude. C'est une précaution honnête ; elle mérite d'être répétée à chaque reprise du résultat.
Pour aller plus loin
Le papier : Causal multi-modal AI for personalized chemosensitivity prediction, arXiv:2609.13567 (cs.AI), déposé le 11 septembre 2026, DOI 10.48550/arXiv.2609.13567.
Sur le cadre causal employé : les réseaux de régression contrefactuelle (CFRNet) de Shalit, Johansson et Sontag, qui introduisent la pénalité d'équilibrage entre groupes de traitement. Sur les essais qui font aujourd'hui référence pour la désescalade de chimiothérapie dans le cancer du sein HR+/HER2− : TAILORx (NCT00310180), RxPONDER (NCT01272037), MINDACT (NCT00433589), OPTIMA (ISRCTN42400492). Sur le socle d'imagerie : DINOv2 pour la méthode d'auto-supervision, et les modèles de fondation en pathologie numérique dont nous avons décrypté le cas de GigaPath.