预测谁真正能从化疗中获益:一个乳腺癌因果多模态模型——却没有一位患者被随机分组
以纽约公司 Ataraxis AI 为首的三十四位作者提出 CTX:一个把苏木精-伊红切片与常规临床数据结合起来的模型,用以逐个患者估计早期 HR+/HER2− 乳腺癌中化疗带来的绝对获益——开发集 9 141 例,留出评估集 1 994 例,覆盖十个国家。在衡量预测价值的标准检验上,该评分优于 Oncotype DX;作者计算,若按模型分配治疗,可在复发率不变的前提下把化疗人数减少到四分之一。但没有一位患者被随机分组,置信区间暴露出复发事件极少,而摘要中的数字——减少 30 %——并不是结果部分给出的那个。
背景
约 70 % 的乳腺癌属于 HR+/HER2−:表达激素受体(雌激素、孕激素),不表达 HER2 受体。这些患者术后都接受辅助内分泌治疗,以切断肿瘤赖以生存的雌激素信号。二十年来悬而未决的问题是:还应当给谁加上化疗。大型试验表明,加上化疗平均而言能改善生存——但平均值掩盖了极不均等的个体情况,而化疗的毒性代价高昂:中性粒细胞减少、持久的周围神经病变、蒽环类药物的心脏毒性、过早绝经、长期疲乏。
为了取舍,指南依赖基因组特征:21 基因复发评分(Oncotype DX)、70 基因特征(MammaPrint)、50 基因评分(Prosigna/PAM50)。它们全都是作为预后工具设计并验证的——估计复发风险——之后才被挪用为预测工具,即被当作治疗获益的指标。这一区别远非措辞之争。预后标志物说的是"这个肿瘤很危险";预测标志物说的是"这个肿瘤会对那种药物有反应"。TAILORx、RxPONDER、MINDACT 以及最近的 OPTIMA 表明,对基因组低危患者停用化疗平均不会恶化结局;但它们从未表明基因组高危能识别出化疗敏感的患者:高危人群中,有些人从化疗中一无所获,更适合用 CDK4/6 抑制剂等其他药物进行升级治疗。
论文攻击的正是这一空隙。它不再预测风险再把风险读作获益,而是提出对每位患者直接估计两种未来之间的差值:仅用内分泌治疗时的复发概率,与内分泌治疗加化疗时的复发概率。差值即个体化获益。而由于这一判读是在每例乳腺癌常规都会制作的苏木精-伊红切片上完成的,它不需要额外的分子检测、额外的组织,也不需要商业基因签名那几千欧元的费用。
方法
数据。一个多国观察性数据集,包含来自十个国家 17 个队列的 11 135 例早期乳腺癌患者。划分为:开发集 9 141 例(12 个队列,九个国家),留出评估集 1 994 例 HR+/HER2− 患者(5 个队列,三个国家),其中包含法国队列(UNIRAD、里昂 Centre Léon Bérard、居里研究所、Gustave Roussy、Centre Jean Perrin、IUCT-Oncopole 均见于作者单位)。每位患者提供经统一处理的临床变量和至少一张数字切片。开发集中 47.4 % 接受化疗,评估集中为 40.7 %。终点为五年无复发间期(RFI):从诊断到首次局部区域或远处复发的时间,死亡按删失处理。
病理编码器。切片被切成 224 × 224 的小块,由 Ataraxis AI 自研的基础模型 Falcon(Kestrel 的后继者)编码。Falcon 是一个超大 vision transformer,采用类似 DINOv2 的方法在超过二十亿个图块上自监督预训练:在完全没有标签的情况下,教模型对同一组织区域在两种不同变换下产出一致的表示。在 CTX 的开发过程中 Falcon 保持冻结;其输出通过多示例学习(bag 级学习:不知道哪一块携带信号,只知道整张切片与某个结局相关)聚合为单一的切片级表示。临床变量并行经过一个表格残差网络,两种表示再由门控注意力层融合。
因果部件。这是论文的核心。由于化疗并非随机分配,接受化疗的患者与其他人系统性不同:更年轻、肿瘤更大、阳性淋巴结更多。在这种数据上训练的朴素模型,主要会学会辨认谁被治疗过,而在反事实情境——同一位患者若接受另一种治疗会怎样——上严重失准。因此作者采用 CFRNet(反事实回归网络):网络学习一种内部表示,使两个治疗组彼此相似,并用名为最大均值差异的度量显式惩罚两者分布之间的差距。在这一平衡表示之上,两个生存预测头分别预测两种治疗下的五年复发风险。由此得到两个输出:CTX-prognostic,即在实际接受的治疗下的风险;以及 CTX-τ,即化疗带来的无复发概率的预测绝对增量。
2 % 的阈值用于区分高获益与低获益。这一取值有依据:患者表示 1 % 的获益就足以让化疗值得,而肿瘤科医师共识小组把门槛定在 3–5 %,作者取其中间,同时强调评分是连续的,医患双方可以自行选择切点。
评估。评估集中的治疗同样未随机化。因此作者估计倾向性评分——在给定临床协变量下患者接受化疗的概率——并用其倒数(IPW)对所有分析重新加权。实测效果:两组间绝对平均标准化差值从 0.376 降至 0.125,低于通常视为可忽略失衡的 0.20 阈值。
结果
预后。在 1 994 例留出患者中,CTX-prognostic 的时间依赖 AUC 在五年为 0.711[95 % CI 0.663–0.756],十年为 0.765[0.708–0.791]——AUC 即模型把复发者排在非复发者之上的概率。这是诚实但不出奇的区分度,与最好的临床评分相当。在校正年龄、肿瘤分期和淋巴结分期后,该评分仍是独立预测因子(五年校正 HR 2.02[1.44–2.83];十年 2.28[1.73–3.00])。校准度——预测概率与实际发生频率的吻合——是全文最扎实的结果:斜率 1.00[0.82–1.18],截距 0.00[−0.01,0.01]。模型说 8 % 的风险,实际就看到 8 % 的复发。
预测价值。在被判为低获益的患者中,化疗没有带来可测量的变化(HR 1.40[0.77–2.57],p = 0.270)。在被判为高获益的患者中,化疗使风险降低一半以上(HR 0.42[0.20–0.88],p = 0.022)。标准检验是 Cox 模型中的治疗 × 生物标志物交互作用:经 IPW 加权后显著(p = 8.11 × 10⁻⁵),在连续形式下依然显著(每个标准差 HR 0.67[0.57–0.79],p = 2.09 × 10⁻⁶),排除了阈值人为造成的假象。消融分析显示,仅临床特征(p = 4.41 × 10⁻⁴)和仅病理特征(p = 7.90 × 10⁻³)各自都携带信号,且在临床特征之外加入病理能显著改善拟合(似然比检验,p = 9.79 × 10⁻³)。与一组既有标志物——年龄、分期、分级、组织学类型、Ki67——相比,没有一个达到显著;只有 Oncotype DX 达到(p = 0.0247)。在同时具备两种评分的 983 例患者中做严格头对头比较,CTX-τ 仍保持更强的交互作用(p = 9.68 × 10⁻⁴ 对 0.0247)。
治疗决策。这是会上头条的数字。评估集中 40.7 % 的患者接受了化疗,五年无复发率为 93.7 %。按 CTX-τ 从高到低排序后,作者估计只治疗其中 10.5 % 即可达到同样的无复发率——相对减少 74.2 %。另一种读法:在治疗比例相同的情况下,复发率将从 6.3 % 降至 5.4 %,相对下降 14.3 %。
临床换算。在与该队列相当的 1 000 位患者中,目前有 407 位接受化疗,五年内将有 63 位复发。按 CTX 指导的策略只需治疗 105 位即可维持同样的复发数:每 1 000 位患者少做 302 次化疗。反过来,若仍治疗那 407 位,则每 1 000 人可避免 9 次复发。这些数字必须与论文中提到却未强调的第三个数字并列:在整个评估队列层面,化疗的平均获益是五年无复发概率的 0.30 %。一千人中三人。整项工作所围绕的,正是这个极小的量及其异质性。
生物学与迁移。三位乳腺专科病理医师在不知预测结果的情况下复核了与评分相关的形态学分组。高获益肿瘤呈现浸润癌巢、高细胞密度、中至高核级、可辨认的核分裂象;低获益肿瘤则以纤维化间质和脂肪组织为主,浸润癌很少甚至没有。分子层面,在 TCGA(n = 348)中,高获益肿瘤富集于增殖通路(E2F 靶基因、G2M 检查点、MYC 靶基因、mTORC1)、DNA 修复与免疫激活(α 和 γ 干扰素、cGAS-STING);低获益肿瘤富集于上皮-间质转化、血管生成和早期雌激素反应。最后,冻结的模型不经任何重新校准,直接应用于 TCGA 中 16 种癌症的 6 692 例患者,在 16 种中的 11 种保持显著的预后信号,在使用同类细胞毒方案的 7 种中有 6 种保持显著。
做得好的地方
问题提得对,而且提得干净。明确把预后与化疗敏感性分开,输出两个不同的结果而不是把一个评分重新解释,并用两者之间的相关性加以论证——CTX-τ 与 Oncotype DX 评分的相关仅 r = 0.389,与肿瘤大小 r = 0.345,与阳性淋巴结数 r = 0.340——这是论文的理论要点,并有数据支撑。即便是与同一模型产出的 CTX-prognostic 相关,也只有 r = 0.720:两条轴并不重合。
评估用了正确的检验,并交代了自己的前提。Cox 模型中的治疗 × 生物标志物交互作用,确实是肿瘤学中确立"预测性而非仅预后性"的标准方法;作者同时报告了二分版本、连续版本,以及加权与不加权两种情况,覆盖三个国家的五个留出队列。尤其值得一提的是,他们公布了重新加权前后的失衡程度(0.376 → 0.125):给出自己声称要解决的问题的量度,在文献中依然罕见,也让读者得以自行判断。校准度用斜率和截距报告,而非一张定性图。与 Oncotype DX 的比较是在同一批患者中完成的,而不是在两个不同人群之间。
可解释性不是一张热力图。三位获认证的病理医师在不知预测与结局的情况下标注形态学分组;分子分析单独进行,作者自己也指出该分析属探索性质,因为 TCGA 属于开发集。两条线索指向同一个故事——一侧是增殖、复制压力、同源重组缺陷;另一侧是雌激素信号特征与微环境介导的耐药——这对作用于分裂细胞的细胞毒药物而言在生物学上说得通。
做得不够的地方
没有一位患者被随机分组,而这不是加权能补救的。整个构架建立在不存在未测量混杂的假设之上:即经统一处理的临床变量足以解释为什么这位患者接受了化疗而那位没有。这一假设无法验证,而在乳腺肿瘤学中它相当可疑。实践中,化疗决策取决于体能状态、心脏与血液系统合并症、生育意愿、知情患者的偏好、中心习惯、就诊年份——这些都不会出现在一份多国统一的病历字段里。倾向性评分只能重新平衡它观察到的东西;对其余部分,它在构造上就是盲的。残余标准化差值 0.125 说明在纳入的变量上平衡良好,并不说明混杂已经消失。这正是对照偏倚最顽固的形态:模型称之为化疗敏感性的东西,可能有一部分是那些未被记录的、导致医生决定用药的理由留下的痕迹。
置信区间说明事件数极少。1 994 例患者、五年复发率 6.3 %,整个评估集约 125 个事件——再分摊到两个获益类别和两个治疗组。关键结果 HR 0.42[0.20–0.88]、p = 0.022,既与风险降到五分之一相容,也与仅降低 12 % 相容。低获益组 HR 1.40[0.77–2.57],既不能排除获益也不能排除危害。Kaplan-Meier 曲线下方的风险人数表是经 IPW 加权的,并不对应真实人数,使稳健性更难判断。六位小数的 p 值与如此宽的区间之间的反差本身就是信息:显著性站得住,精度站不住。这与其他基于极少事件验证的预后模型遇到的问题如出一辙。
被描述的形态学,更像是在度量肿瘤含量。按复核病理医师自己的说法,低获益肿瘤以纤维化间质和脂肪为主,"浸润癌很少甚至没有"。这有两种读法。一种是模型捕捉到了与微环境相关的耐药生物学——这是作者的读法,与上皮-间质转化的富集一致。另一种是它主要在度量数字切片上究竟有多少肿瘤,也就是取材与大体处理造成的人为因素,它与肿瘤负荷相关,因而与风险相关,也就与预期获益相关。这是典型的捷径学习候选,而论文没有报告任何能区分二者的对照:没有按肿瘤含量配对的分析,没有把切片裁剪到浸润区后的检验,也没有同一病例不同蜡块之间的比较。同样的陷阱在乳腺影像中已被证实,模型学到的是来源中心的特征而非病灶;病理基础模型在制片差异面前的脆弱性也有文献记录。
此外还有三点值得警惕。摘要与结果给出的数字不一致:前者宣称化疗患者数量减少"30 %",后者算出的是从 40.7 % 降到 10.5 %,即相对减少 74.2 %。两者不可能描述同一个量;读者无从知道哪一个是对的,而这恰恰是会被引用的数字。模型是专有的:Falcon 与 Kestrel 是 Ataraxis AI 的基础模型,第一作者与末位作者均隶属该公司,通讯地址是公司邮箱,正文中也没有公开权重的任何说明。这离一个学术实验室可复现的工具相去甚远。最后,"零样本"迁移的呈现比其实际测量更为慷慨:它用的是总生存而非复发,在 TCGA 上完成,高/低获益的切分固定在第 90 百分位,并且在 16 种癌症中有 5 种失败——这不妨碍从中看到信号,但不足以支撑"通用策略"的说法。
这改变了什么
对研究界,这篇论文干净地确立了计算病理学此前缺失的一个方法学区分:不要再把预后评分当作治疗获益的替代品,而要用平衡表示网络直接学习治疗效应。"H&E 切片携带临床变量中无法还原的化疗敏感性信息"(p = 9.79 × 10⁻³)是全文最可复现、也最容易在别处重做的结果。它同时提出了一个令人不安却有用的问题:如果一个在观察性数据上训练的因果模型,其治疗-生物标志物交互作用比在随机试验中验证过的检测更显著,那我们该把它读作更好的生物学,还是被更充分利用的残余混杂?关于从回顾性数据学习治疗策略的文献提示,这个问题应当事前提出,而非事后。
对临床医生,今天什么都没有改变,这一点必须说清楚。一个预测化疗敏感性的评分,不能仅凭重新加权的回顾性分析就被采纳,无论分析多么精细:Oncotype DX 本身也是在 TAILORx 和 RxPONDER 之后才进入指南的,也就是在以降阶治疗为研究臂的前瞻性试验之后。这里需要的证据是同一性质的:一项由模型在一个臂中决定化疗分配、由标准实践在另一个臂中决定的试验。在它出现之前,CTX 是一个被量化的假设,而不是决策工具。反过来,真正值得记住的是论文提醒的量级:整个 HR+/HER2− 人群五年平均获益 0.30 %,意味着这一群体中绝大多数被开出的化疗对接受者毫无益处。无论解决方案是什么,过度治疗的问题是真实的。
对患者和公众,这个承诺易于表述而难以兑现:在一张已经制作好的切片上读出化疗是否值得承受,不需要额外检测,也不增加费用。承诺与证据现状之间的距离可以用一句话概括:我们知道该评分能在过去的病历中区分出结局不同的人群;我们还不知道,如果让它来决定治疗,那些女性会发生什么。论文中给出的两个病例——两位临床上无法区分、结局却与预测一致的患者——有助于理解这一概念,而作者自己也说明它们并不确立任何准确性。这是诚实的保留;每一次引用该结果时都值得重复一遍。
延伸阅读
论文:Causal multi-modal AI for personalized chemosensitivity prediction,arXiv:2609.13567(cs.AI),2026 年 9 月 11 日提交,DOI 10.48550/arXiv.2609.13567。
关于所用的因果框架:Shalit、Johansson 与 Sontag 提出的反事实回归网络(CFRNet),其中引入了治疗组之间的平衡惩罚项。关于目前作为 HR+/HER2− 乳腺癌化疗降阶参照的试验:TAILORx(NCT00310180)、RxPONDER(NCT01272037)、MINDACT(NCT00433589)、OPTIMA(ISRCTN42400492)。关于影像基础:自监督方法 DINOv2,以及数字病理中的基础模型——我们曾解读过GigaPath 的案例。