结直肠外科:一个统一模型在 54 段手术视频上完成手术阶段切分,而只要抽走一个中心,性能就会损失三分之一
来自斯特拉斯堡 IHU、罗马 Gemelli 与 Sapienza、米兰 Policlinico 以及塞维利亚 Virgen Macarena 的十三位作者,训练了一个统一模型,对微创结直肠手术视频自动切分手术阶段与手术步骤,数据为来自四家中心和一个德国公开数据集的 54 例手术。该模型在阶段识别上达到宏平均 F1 73.01%,在步骤识别上为 39.82%,并在大多数测试配置中优于按中心分别训练或按术式分别训练的模型。但论文中最有启发性的结果恰恰推翻了上一句话:当把某个中心从训练集中移除、再在该中心上评估时,阶段 F1 平均跌至 48.42%,最差的中心低至 37.49%。
背景
微创结直肠手术——腹腔镜或机器人辅助的结肠切除与直肠切除——的特点是操作差异大,不同术者与不同中心之间结果不稳定。为了把这种差异变得可测量,该学科采用了一种工具:基于视频的评估(video-based assessment,VBA),即依据手术录像进行评价。原理很简单——标注视频,弄清谁在什么顺序下做了什么、持续多久——它支撑着培训、资质认证,以及关于操作与并发症之间关系的研究。
但这需要一套共同语汇。这正是 ColoWorkflow 的用途:这是同一团队的部分成员于 2026 年发表在 BJS Open 上的本体,通过改良德尔菲法、由四十余位国际专家共同构建。它定义了适用于所有结直肠术式的 9 个阶段(置入戳卡与探查、血管解剖、结肠游离、离断、吻合、手术收尾、预先计划的附加操作、非计划操作、体外操作)以及针对各术式的 34 个步骤。问题在于成本:按照 ColoWorkflow 手工标注一段视频,作者称大约需要视频时长的 60%。按每台手术两个半小时计算,VBA 无法规模化。
于是产生了自动化的动机。手术阶段自动识别本身是一个成熟领域——在腹腔镜胆囊切除的 Cholec80 数据集上,模型准确率已超过 90%。但胆囊切除手术时间短、标准化程度高、阶段数量少。在结直肠领域,已有工作仍是单一术式的:Nakajima 等针对乙状结肠切除,Kolbinger 等针对机器人辅助直肠切除。此前还没有模型尝试用一套统一的共识本体覆盖整个结直肠术式谱。这正是本文瞄准的空白。
方法
数据。 54 段手术视频,来自五个来源:四家合作中心,匿名化为「中心 1」至「中心 4」(分布在意大利、西班牙和法国,但未给出编号与医院的对应关系),以及来自海德堡的公开数据集 HeiCo,后者单独贡献了 54 段中的 22 段。五种术式:左半结肠切除(n = 9)、右半结肠切除(n = 13)、直肠切除(n = 10)、乙状结肠切除(n = 12)、全结直肠切除(n = 10)。平均时长 141 ± 59 分钟,从右半结肠切除的 93 ± 32 分钟到全结直肠切除的 210 ± 50 分钟。画面以每秒一帧抽取并缩放为 224 × 224,共计 462 000 帧。通过 Endoshare 应用在本地去标识化,在 MOSaiC 平台上标注,伦理批准来自 Policlinico Gemelli(编号 6456)。
标注。 由一名医生完成全部语料的标注,该医生受过 VBA 训练,并参与了 ColoWorkflow 的开发。在本体的 9 个阶段和 34 个步骤中,实际参与评估的是 8 个阶段和 33 个步骤:阶段 P7(预先计划的附加操作)与步骤 S25(回肠储袋制备)在测试集中不存在。
架构。 两个模块。首先是视觉特征提取器:一个 DINOv3 vision transformer——一种以自监督方式(即不依赖人工标签)在超大规模通用图像语料上预训练的图像模型——在标注帧上做了微调(fine-tuning),为每一帧生成向量表示。其次是时序模型:SAHC,一种多阶段时序卷积网络,堆叠因果膨胀卷积,即只看过去——因此该模型原则上可以在手术进行中实时运行,无需等到视频结束。每一级都会修正上一级的预测,从而减少过度分割(模型每两秒就改变判断的现象)。其特点在于:共享时序主干、两个输出头,分别对应阶段与步骤,通过等权重的组合交叉熵同时优化。其思路是阶段上下文可以正则化步骤预测,反之亦然。
数据划分与对照。 按病例级划分——32 段训练、11 段验证、11 段测试——从而避免同一台手术同时出现在两侧。测试集来自与训练相同的五个来源:作者自己把这种配置称为「最乐观的情形」。四类对照:多数类基线、仅用单一中心训练的模型、仅用单一术式训练的模型,以及留一中心法(leave-one-centre-out,LOCO)交叉验证——轮流把一个中心排除在训练之外,再在这个从未见过的中心上评估模型。配对 Wilcoxon 检验在 11 段测试视频上比较模型与基线。报告遵循 QUAIDE 清单的修改版。
结果
头条数字。 在测试集上,AI-ColoWorkflow 阶段识别取得宏平均 F1 73.01% ± 10.27(平衡准确率 73.43%,精确率 73.19%,召回率 73.43%),步骤识别为 39.82% ± 7.06(平衡准确率 38.65%,精确率 48.36%)。多数类基线仅为 6.71% 与 2.29%(p = 0.001)。要注意标准差的含义:它不是在随机种子之间、也不是在交叉验证折之间计算的,而是在 11 段测试视频之间计算的。73.01% 来自一次划分。
按阶段。 体外操作(P9)的 F1 达到 94.73%——这并不意外,镜头离开腹腔时画面完全改变。其次是血管解剖(P2,76.58%)与吻合(P5,75.27%)。表格底部是:非计划操作(P8)41.48%,结直肠离断(P4)64.11%,手术收尾(P6)66.45%,其精确率为 82.55% 而召回率仅 55.61%。
按步骤。 表格完整公布,而且相当严酷。三个步骤超过 79%:右侧肠切开缝合(S31,84.61%)、右侧远端离断(S22,81.53%)、切除肠段体外化(S21,79.96%)。但有两个步骤的 F1 为 0.00%——右侧腔内吻合准备(S29)与附加缝合(S32)——原因是它们在测试集中过于罕见。步骤 S23 的精确率为 100%,召回率却只有 3.88%,F1 为 7.46%:模型几乎从不预测它,但一旦预测就是对的。作者明确写道,某些短步骤的训练帧数少于测试帧数。
全局对专用。 在阶段识别上,全局模型在 5 个中心中的 4 个胜过单中心模型(中心 2:+18.9 个百分点;中心 4:+14.3;中心 1:+9.1;中心 3:−1.0),在 5 种术式中的 4 种胜过单术式模型(全结直肠切除 +10.4;乙状结肠 +10.2;直肠 +6.6;右半结肠 +1.8;左半结肠 −2.2)。在步骤识别上,它在 5 个中心中的 4 个胜过单中心模型(中心 4 高达 +23.4),但只在 5 种术式中的 2 种胜过单术式模型:右半结肠切除落后 10.2 个百分点,直肠切除落后 5.7 个百分点。
泛化测试。 这里论文才真正有意思。在 LOCO 下,未见中心上的阶段平均 F1 为 48.42%,而同一批折中仍留在训练集内的中心为 61.59%,全局模型为 73.01%。具体范围从 37.49%(中心 2)到 65.78%(中心 4)。若换算成相对全局模型的保留率,则为 51.3% 至 90.1%:中心 4 在自身视频不参与训练的情况下仍保留九成性能,中心 2 只保留一半。步骤识别的跌幅更大:被移除中心上平均 21.94%,而已见中心为 40.61%。
消融实验。 相比分别训练,阶段与步骤联合训练带来阶段 F1 +2.8 个百分点(70.2% → 73.0%),步骤 F1 +1.7 个百分点(38.1% → 39.8%)。
落到实处的换算。 阶段 73.43% 的平衡准确率意味着:在八个阶段上平均,略少于四分之三的帧获得了正确标签。对一台 141 分钟的手术来说,这足以给出一个由人工标注者再行修正的预切分——这恰恰是其目标用途——但不足以在无人复核的情况下产出可用的阶段时长。步骤层面 38.65% 的水平,则意味着细粒度时间线无法直接使用。因此,能否节省手工标注所耗的那 60% 视频时长并未被证明:在阶段层面是可信的,在步骤层面则不然。
做得好的地方
LOCO 实验被公布了,而且它与标题相矛盾。 没有任何东西要求作者逐一移除中心并公布随之而来的性能崩塌。他们做了,给出了全部五折结果,甚至进一步计算了每个中心的保留率——中心 2 为 51.3%,中心 4 为 90.1%——然后得出对自己不利的结论:「全局模型在这些站点的表现高度依赖本地训练样本的存在,这一发现对 AI-ColoWorkflow 在数据匮乏的新机构中的推广具有直接影响。」这正是同类论文通常不会写下的一句话。
逐类别表格是完整的,而非概要。 全部 8 个阶段和 33 个步骤都给出了精确率、召回率与 F1,并附标准差。正因如此,人们才能看出 39.82% 的步骤成绩里包含两个为零的类别,以及一个精确率 100%、召回率仅 3.88% 的类别。只公布宏平均的论文会讲同样的故事,却不给人核验的余地。此外还有三个正确的选择:病例级划分;以宏平均 F1 而非会被长阶段主导的准确率作为主要指标;以及配有统计检验的多数类基线。
失利之处与胜利之处一样被精确报告。 全局模型在右半结肠切除(步骤 −10.2 个百分点)和直肠切除(−5.7)上输给单术式模型,在中心 3(阶段 −1.0)和 HeiCo(步骤 −1.5)上输给单中心模型。作者由此给出的是有分寸的建议——阶段层面采用汇集训练,步骤层面对本体受限的术式保留专用模型——而不是一句「我们的模型全面胜出」。多任务消融同样如此:量化为 +2.8 与 +1.7 个百分点,即幅度不大,并如实呈现。
做得不够好的地方
步骤的宏平均 F1 是对噪声取平均。 这是误导性指标这一失效模式中较少被讨论的一种变体:当 33 个类别中有若干只在一段测试视频里出现时,仍以不加权平均汇总。标准差暴露了这一点——S8、S9、S31 和 S32 的标准差为 0.00,意味着该类别只出现在一段视频中;S23 的精确率写作「100.00 ± 32.69」,即均值 100% 却带着 32.69 的标准差,就其字面而言无法解释。作者承认某些步骤的训练帧数少于测试帧数,并写道这使「可靠的模型学习成为不可能」。因此,39.82% 并不是一个性能数字:它是二十来个有信息量的测量与十来个什么也没测到的数值的平均。
只有十一段测试视频,而支撑结论的那些比较没有置信区间。 Wilcoxon 检验只用于与多数类基线的比较,也就是与一个 6.71% 的对手比较——这样的胜利没有信息量。全局模型与各专用模型之间没有报告任何检验,而论文的核心论点恰恰在此。况且其中若干差距非常微小:右半结肠切除 +1.8 个百分点、中心 3 −1.0、HeiCo −1.5。在每个中心只有一到两段测试视频的情况下,这些差异与抽样噪声无法区分。人群偏倚同样无从刻画:论文未报告患者人口学特征、术者人数、机器人与腹腔镜的比例,也未报告数据采集年份——作者本人也把对相机、照明和机器人平台变化的鲁棒性列为未来工作。
金标准、可复现性与利益关系。 只有一名标注者,而这名标注者参与共同开发了他所应用的本体:规则与规则的执行并不独立。本研究未测量任何观察者间一致性——作者仅援引 ColoWorkflow 原始论文中「中等」程度的一致性,且未给出数值。在可复现性方面,可获取的正文中没有任何关于代码、权重或数据可用性的声明,预印本也未说明所用的 DINOv3 变体、SAHC 的级数、学习率或训练轮数;五个数据来源中只有 HeiCo 是公开的。最后,两位作者——Pietro Mascagni 与 Nicolas Padoy——声明为 Scialytics 公司的联合创始人与股东,而该公司经营的正是手术视频分析;被引作直接先行工作的「Marginal Gains」系列研究,也由本文的三位作者共同署名。这些都没有被隐瞒,全部作了声明,但整体上描绘出一个本体制定者、标注者、评估者与商业受益方高度重叠的生态。
这意味着什么
对研究界。 这篇论文中可复用的数字不是 73.01%,而是 48.42%。这是首个公开发表的测量结果,说明在共识本体之下、跨五种术式的结直肠手术流程识别模型,在一个从未见过的中心上究竟值多少。此后的任何方法——联邦学习、领域自适应、扩大规模——都必须与这个数字以及它 37.49 至 65.78 的离散范围相比较。第二个启示是两种粒度之间的分离:汇集所有中心的数据在阶段层面明显有帮助,在步骤层面却并非总是如此——对本体受限的术式而言,专用模型仍占优势。这支持采用混合策略,而不是再多做一个统一模型。第三点由作者明确提出,其意义超出外科本身:临床上重要但出现频率低的操作呈长尾分布,这「无法仅靠架构选择解决」,需要规模大得多的标注语料。
对临床医生。 今天什么也改变不了。论文未提及任何监管状态,没有进行前瞻性验证,而所检测到的流程模式与临床结局——手术时长、并发症率、学习曲线——之间的关系,用作者自己的话说,「仍有待研究」。有用的解读是:在提供过训练视频的中心,由人工复核的阶段级预切分是有可能实现的;而在没有提供视频的中心,模型性能按站点不同会损失 10% 至 49%,至于需要多少本地视频才能弥合这一差距,论文并未涉及。这恰恰是应当向任何提供此类工具的供应商提出的问题。
对患者与公众。 真正的关键不是一个算法,而是一个理念:用并发症之外的方式衡量手术质量——去看手术过程中实际发生了什么。手术录像让这种衡量成为可能,而自动化则会让它可以推广。就目前而言,对这份材料诚实的判断是:这是一项临床前的可行性验证——手术的粗粒度切分开始奏效,细粒度切分尚未奏效,而在未参与训练的医院里会发生什么,仍然无人知晓。
延伸阅读
- 论文:Artificial Intelligence for Workflow Analysis in Colorectal Surgery: A Multicentric, Cross-Procedural Development and Generalization Study,Mascagni、Alekseenko、Jain 等,arXiv:2608.20154,许可为 CC BY-NC-SA 4.0。资助:ERC CompSURG 101088553、ANR-10-IAHU-02、ANR-22-FAI1-0001。
- 所依据的本体:Jain 等,ColoWorkflow,BJS Open 10(3):zrag038, 2026。
- 所使用的公开数据集:HeiCo,Maier-Hein 等,Scientific Data 8(1):101, 2021。
- 时序模型:Ding 与 Li,SAHC,IEEE Transactions on Medical Imaging 41(11):3309-3319, 2022。视觉特征提取器:Siméoni 等,DINOv3,arXiv:2508.10104。
- Tatakoto 相关文章:模型在不同重症监护数据库之间可迁移性的分层、合并数据集会让乳腺 X 线模型学到什么,以及病理基础模型对扰动的鲁棒性。