Chirurgie colorectale : un modèle unique découpe l'opération en phases sur 54 vidéos, et perd un tiers de sa performance dès qu'un centre sort de l'entraînement

Treize auteurs de l'IHU Strasbourg, du Gemelli et de la Sapienza à Rome, du Policlinico de Milan et du Virgen Macarena à Séville entraînent un modèle unique à découper automatiquement des vidéos de chirurgie colorectale mini-invasive en phases et en étapes opératoires, à partir de 54 interventions issues de quatre centres et d'un jeu de données public allemand. Le modèle atteint un F1 macro de 73,01 % sur les phases et de 39,82 % sur les étapes, et fait mieux que des modèles entraînés centre par centre ou procédure par procédure dans la plupart des configurations testées. Le résultat le plus instructif du papier est celui qui abîme le précédent : quand on retire un centre de l'entraînement et qu'on évalue le modèle dessus, le F1 des phases tombe en moyenne à 48,42 %, et jusqu'à 37,49 % sur le centre le plus mal loti.

Le contexte

La chirurgie colorectale mini-invasive — colectomies et résections rectales par cœlioscopie ou par robot — se caractérise par une forte variabilité de pratique et des résultats inconstants d'un opérateur et d'un centre à l'autre. Pour objectiver cette variabilité, la discipline s'est dotée d'un outil : la video-based assessment (VBA), l'évaluation à partir de l'enregistrement vidéo de l'intervention. Le principe est simple — on annote la vidéo pour savoir qui a fait quoi, dans quel ordre, pendant combien de temps — et il alimente la formation, l'accréditation et la recherche sur les liens entre gestes et complications.

Encore faut-il un vocabulaire commun. C'est l'objet de ColoWorkflow, une ontologie publiée en 2026 dans BJS Open par une partie de la même équipe, construite par processus Delphi modifié avec plus de quarante experts internationaux. Elle définit 9 phases valables pour toutes les procédures colorectales (mise en place des trocarts et exploration, dissection vasculaire, mobilisation du côlon, transection, anastomose, fin d'intervention, procédures additionnelles prévues, procédures non prévues, temps extracorporel) et 34 étapes spécifiques à chaque type d'intervention. Le problème est le coût : annoter manuellement une vidéo selon ColoWorkflow prend, selon les auteurs, environ 60 % de la durée de la vidéo. À raison de deux heures et demie par opération, la VBA ne passe pas à l'échelle.

D'où la tentation de l'automatiser. La reconnaissance automatique de phases opératoires est un domaine mature — sur le jeu de données Cholec80 de cholécystectomies laparoscopiques, les modèles dépassent 90 % d'exactitude. Mais la cholécystectomie est courte, très standardisée, et découpée en peu de phases. En colorectal, les travaux existants restent mono-procédure : Nakajima et coll. sur la résection sigmoïdienne, Kolbinger et coll. sur la résection rectale robot-assistée. Aucun modèle n'avait jusqu'ici tenté d'appliquer une ontologie unique et consensuelle à l'ensemble du spectre colorectal. C'est le trou que ce papier vise.

La méthode

Les données. Cinquante-quatre vidéos opératoires, de cinq sources : quatre centres partenaires anonymisés en « Centre 1 » à « Centre 4 » (situés en Italie, en Espagne et en France, sans que la correspondance entre numéro et hôpital soit donnée), et le jeu de données public HeiCo de Heidelberg, qui fournit à lui seul 22 des 54 vidéos. Cinq types d'intervention : hémicolectomie gauche (n = 9), hémicolectomie droite (n = 13), résection rectale (n = 10), résection sigmoïdienne (n = 12), coloproctectomie totale (n = 10). Durée moyenne de 141 ± 59 minutes, de 93 ± 32 minutes pour l'hémicolectomie droite à 210 ± 50 minutes pour la coloproctectomie totale. Les images sont extraites à une image par seconde et redimensionnées en 224 × 224, soit 462 000 images au total. Dé-identification locale via l'application Endoshare, annotation sur la plateforme MOSaiC, approbation éthique du Policlinico Gemelli (ID 6456).

L'annotation. Un seul médecin, formé à la VBA et ayant participé au développement de ColoWorkflow, a annoté l'intégralité du corpus. Sur les 9 phases et 34 étapes de l'ontologie, 8 phases et 33 étapes sont effectivement évaluées : la phase P7 (procédures additionnelles prévues) et l'étape S25 (préparation du réservoir iléo-anal) sont absentes du jeu de test.

L'architecture. Deux blocs. D'abord un extracteur visuel : un vision transformer DINOv3 — un modèle d'images pré-entraîné de façon auto-supervisée, c'est-à-dire sans étiquettes humaines, sur de très grands corpus d'images génériques — affiné (fine-tuned) sur les images annotées pour produire une représentation vectorielle de chaque image. Ensuite un modèle temporel : SAHC, un réseau convolutionnel temporel multi-étages qui empile des convolutions dilatées causales, c'est-à-dire qui ne regardent que le passé — le modèle peut donc en principe fonctionner en direct pendant l'opération, sans attendre la fin de la vidéo. Chaque étage corrige les prédictions du précédent, ce qui réduit la sur-segmentation (le modèle qui change d'avis toutes les deux secondes). Particularité : un tronc temporel partagé avec deux têtes de sortie, phase et étape, optimisées simultanément par une entropie croisée combinée à pondération égale. L'idée est que le contexte de phase régularise la prédiction d'étape, et réciproquement.

Les découpages et les comparateurs. Partition au niveau du cas — 32 vidéos d'entraînement, 11 de validation, 11 de test — ce qui empêche qu'une même intervention se retrouve des deux côtés. Le jeu de test provient des mêmes cinq sources que l'entraînement : les auteurs qualifient eux-mêmes cette configuration de « scénario le plus optimiste ». Quatre comparateurs : une ligne de base « classe majoritaire », des modèles entraînés sur un seul centre, des modèles entraînés sur un seul type de procédure, et une validation croisée leave-one-centre-out (LOCO) qui retire tour à tour un centre de l'entraînement pour évaluer le modèle sur ce centre jamais vu. Un test de Wilcoxon apparié sur les 11 vidéos de test compare le modèle à la ligne de base. Le rapport est rédigé selon une version modifiée de la grille QUAIDE.

Les résultats

Le chiffre de tête. Sur le jeu de test, AI-ColoWorkflow obtient un F1 macro de 73,01 % ± 10,27 pour les phases (exactitude équilibrée 73,43 %, précision 73,19 %, rappel 73,43 %) et de 39,82 % ± 7,06 pour les étapes (exactitude équilibrée 38,65 %, précision 48,36 %). La ligne de base « classe majoritaire » plafonne à 6,71 % et 2,29 % (p = 0,001). Attention à l'écart-type : il n'est pas calculé sur des graines aléatoires ni sur des plis de validation croisée, mais entre les 11 vidéos de test. Le 73,01 % vient d'un seul découpage.

Par phase. Le temps extracorporel (P9) est reconnu à 94,73 % de F1 — sans surprise, l'image change radicalement quand l'optique sort de l'abdomen. Suivent la dissection vasculaire (P2, 76,58 %) et l'anastomose (P5, 75,27 %). En bas de tableau : les procédures non prévues (P8) à 41,48 %, la transection colorectale (P4) à 64,11 %, la fin d'intervention (P6) à 66,45 % avec une précision de 82,55 % pour un rappel de 55,61 %.

Par étape. Le tableau est publié en entier, et il est sévère. Trois étapes dépassent 79 % : fermeture de l'entérotomie à droite (S31, 84,61 %), transection distale à droite (S22, 81,53 %), extériorisation du segment réséqué (S21, 79,96 %). Mais deux étapes obtiennent un F1 de 0,00 % — préparation de l'anastomose intracorporelle à droite (S29) et sutures additionnelles (S32) — parce qu'elles sont trop rares dans le jeu de test. L'étape S23 affiche une précision de 100 % pour un rappel de 3,88 %, soit un F1 de 7,46 % : le modèle ne la prédit presque jamais, mais quand il la prédit, il a raison. Les auteurs écrivent noir sur blanc que certaines étapes courtes avaient moins d'images d'entraînement que d'images de test.

Global contre spécialisé. Pour les phases, le modèle global bat les modèles mono-centre dans 4 cas sur 5 (Centre 2 : +18,9 points ; Centre 4 : +14,3 ; Centre 1 : +9,1 ; Centre 3 : −1,0) et les modèles mono-procédure dans 4 cas sur 5 (coloproctectomie +10,4 ; sigmoïdienne +10,2 ; rectale +6,6 ; hémicolectomie droite +1,8 ; hémicolectomie gauche −2,2). Pour les étapes, il bat les modèles mono-centre dans 4 cas sur 5 (jusqu'à +23,4 pour le Centre 4) mais seulement 2 cas sur 5 en mono-procédure : l'hémicolectomie droite perd 10,2 points et la résection rectale 5,7 points face à un modèle dédié.

Le test de généralisation. C'est ici que le papier devient intéressant. En LOCO, le F1 moyen des phases sur le centre jamais vu est de 48,42 %, contre 61,59 % sur les centres restés dans l'entraînement lors des mêmes plis, et 73,01 % pour le modèle global. Le détail va de 37,49 % (Centre 2) à 65,78 % (Centre 4). Exprimé en taux de rétention par rapport au modèle global, cela donne de 51,3 % à 90,1 % : le Centre 4 conserve neuf dixièmes de la performance sans ses propres vidéos dans l'entraînement, le Centre 2 en conserve la moitié. Pour les étapes, la chute est plus nette encore : 21,94 % en moyenne sur le centre retiré, contre 40,61 % sur les centres vus.

L'ablation. Entraîner conjointement phase et étape plutôt que séparément apporte +2,8 points de F1 en phase (70,2 % → 73,0 %) et +1,7 point en étape (38,1 % → 39,8 %).

Traduction opérationnelle. L'exactitude équilibrée de 73,43 % en phase signifie que, en moyenne sur les huit phases, un peu moins de trois images sur quatre reçoivent la bonne étiquette. Sur une intervention de 141 minutes, c'est assez pour proposer une pré-segmentation qu'un annotateur humain corrige — ce qui est précisément l'usage visé — mais pas assez pour produire une durée de phase exploitable sans relecture. À 38,65 % en étape, la chronologie fine n'est pas utilisable telle quelle. Le gain sur les 60 % de durée vidéo que coûte l'annotation manuelle n'est donc pas démontré : il est plausible au niveau des phases, il ne l'est pas au niveau des étapes.

Ce qui est bien

L'expérience LOCO est publiée, et elle contredit le titre. Rien n'obligeait les auteurs à retirer un centre à la fois et à publier l'effondrement qui s'ensuit. Ils le font, ils donnent les cinq plis, et ils vont jusqu'à calculer un taux de rétention par centre — 51,3 % pour le Centre 2, 90,1 % pour le Centre 4 — puis à en tirer la conclusion qui les dessert : « la performance du modèle global sur ces sites dépend fortement de la présence d'exemples d'entraînement locaux, un constat aux implications directes pour l'adoption d'AI-ColoWorkflow dans de nouvelles institutions pauvres en données ». C'est exactement la phrase que la plupart des papiers de ce format n'écrivent pas.

Le tableau par classe est intégral, pas résumé. Les 8 phases et les 33 étapes sont publiées avec précision, rappel et F1, écarts-types compris. C'est ce qui permet de voir que le 39,82 % d'étape recouvre deux classes à zéro et une classe à 100 % de précision pour 3,88 % de rappel. Un papier qui ne publierait que la moyenne macro raconterait la même histoire sans permettre de la vérifier. S'y ajoutent trois choix corrects : partition au niveau du cas, F1 macro comme métrique principale plutôt qu'une exactitude qui serait dominée par les phases longues, et une ligne de base « classe majoritaire » assortie d'un test statistique.

Les défaites sont rapportées avec la même précision que les victoires. Le modèle global perd contre le modèle mono-procédure sur l'hémicolectomie droite (−10,2 points en étape) et la résection rectale (−5,7), contre le modèle mono-centre sur le Centre 3 (−1,0 en phase) et HeiCo (−1,5 en étape). Les auteurs en tirent une recommandation nuancée — entraînement global pour les phases, spécialisation conservée pour les étapes de procédures à ontologie contrainte — plutôt qu'un « notre modèle bat tout ». L'ablation du multi-tâche est du même ordre : elle est quantifiée à +2,8 et +1,7 point, c'est-à-dire modeste, et présentée comme telle.

Ce qui est moins bien

Le F1 macro d'étape est une moyenne de bruit. C'est le mode d'échec de la métrique trompeuse dans une variante peu discutée : agréger 33 classes par moyenne non pondérée quand plusieurs d'entre elles ne sont mesurées que sur une seule vidéo de test. Les écarts-types le trahissent — S8, S9, S31 et S32 affichent des écarts-types de 0,00, ce qui signifie que la classe n'apparaît que dans une vidéo ; S23 affiche une précision de « 100,00 ± 32,69 », une moyenne de 100 % assortie d'un écart-type de 32,69, ce qui n'est pas interprétable en l'état. Les auteurs reconnaissent que certaines étapes avaient moins d'images d'entraînement que de test, ce qui rend, écrivent-ils, « l'apprentissage fiable impossible ». Dès lors, le 39,82 % n'est pas une performance : c'est la moyenne d'une vingtaine de mesures informatives et d'une dizaine de mesures qui ne mesurent rien.

Onze vidéos de test, et aucun intervalle de confiance sur les comparaisons qui portent la conclusion. Le test de Wilcoxon n'est appliqué que contre la ligne de base « classe majoritaire », c'est-à-dire contre un adversaire à 6,71 % — une victoire qui n'apprend rien. Aucun test n'est rapporté entre le modèle global et les modèles spécialisés, alors que c'est là que se joue la thèse du papier. Or plusieurs des écarts invoqués sont minuscules : +1,8 point sur l'hémicolectomie droite, −1,0 sur le Centre 3, −1,5 sur HeiCo. Avec un ou deux vidéos de test par centre, ces différences sont indiscernables du bruit d'échantillonnage. Le biais de population n'est pas non plus caractérisable : ni démographie des patients, ni nombre de chirurgiens, ni répartition robot/cœlioscopie, ni années de collecte ne sont rapportés — les auteurs listent d'ailleurs la robustesse au changement de caméra, d'éclairage et de plateforme robotique comme un travail futur.

La vérité terrain, la reproductibilité et les intérêts. Un seul annotateur, et cet annotateur a co-développé l'ontologie qu'il applique : la règle et son application ne sont pas indépendantes. Aucun accord inter-observateur n'est mesuré dans cette étude — les auteurs renvoient à l'accord « modéré » du papier ColoWorkflow original, sans chiffre. Côté reproductibilité, le texte récupérable ne contient aucune déclaration de disponibilité du code, des poids ni des données, et le préprint ne précise ni le variant de DINOv3 utilisé, ni le nombre d'étages de SAHC, ni le taux d'apprentissage, ni le nombre d'époques ; sur les cinq sources, seule HeiCo est publique. Enfin, deux auteurs — Pietro Mascagni et Nicolas Padoy — déclarent être co-fondateurs et actionnaires de la société Scialytics, qui opère précisément sur l'analyse vidéo chirurgicale ; et les travaux « Marginal Gains » cités comme état de l'art immédiat sont co-signés par trois des auteurs du présent papier. Rien de tout cela n'est dissimulé, tout est déclaré, mais l'ensemble décrit un écosystème où producteur de l'ontologie, annotateur, évaluateur et bénéficiaire commercial se recoupent largement.

Ce que ça change

Pour la communauté de recherche. Le chiffre réutilisable de ce papier n'est pas 73,01 % : c'est 48,42 %. C'est la première mesure publiée de ce que vaut un modèle de reconnaissance de flux opératoire colorectal sur un centre qu'il n'a jamais vu, sous une ontologie consensuelle et à travers cinq types d'intervention. Toute méthode ultérieure — apprentissage fédéré, adaptation de domaine, augmentation d'échelle — devra se comparer à ce nombre, et à sa dispersion de 37,49 à 65,78. Le second enseignement est la dissociation entre les deux granularités : mutualiser les données de tous les centres aide clairement au niveau des phases, mais pas systématiquement au niveau des étapes, où un modèle dédié à une procédure à ontologie contrainte conserve l'avantage. Cela plaide pour des stratégies hybrides, et non pour un modèle unique de plus. Le troisième est explicitement formulé par les auteurs et vaut au-delà de la chirurgie : la distribution en longue traîne des gestes cliniquement importants mais rares « n'est pas résoluble par des choix d'architecture » et exige des corpus annotés substantiellement plus grands.

Pour les cliniciens. Rien aujourd'hui. Aucun statut réglementaire n'est évoqué, aucune validation prospective n'a eu lieu, et le lien entre les motifs détectés et les résultats cliniques — durée opératoire, complications, courbes d'apprentissage — reste, de l'aveu des auteurs, « à investiguer ». La lecture utile est la suivante : dans un centre qui a fourni des vidéos d'entraînement, une pré-segmentation en phases relue par un humain est plausiblement à portée ; dans un centre qui n'en a pas fourni, le modèle perd de 10 à 49 % de sa performance selon le site, et la question de savoir combien de vidéos locales il faut pour combler l'écart n'est pas traitée. C'est précisément la question à poser à tout fournisseur qui proposerait cet outil.

Pour les patients et le grand public. L'enjeu de fond n'est pas un algorithme mais une idée : mesurer la qualité d'une chirurgie autrement que par ses complications, en regardant ce qui s'est réellement passé pendant l'intervention. La vidéo opératoire rend cette mesure possible, et l'automatiser la rendrait généralisable. L'état honnête du dossier, à ce stade, est celui d'une preuve de faisabilité pré-clinique : le découpage grossier de l'opération commence à fonctionner, le découpage fin ne fonctionne pas encore, et rien ne dit ce qui se passe dans un hôpital qui n'a pas participé à l'entraînement.

Pour aller plus loin