Échographie thyroïdienne robotisée : le bras autonome FARUSS repère bien les nodules mais laisse passer une recommandation de biopsie sur cinq

Une équipe de l'hôpital Zhongshan (Université Fudan, Shanghai) a testé en conditions réelles FARUSS, un bras robotique à six degrés de liberté qui réalise seul l'échographie de la thyroïde, couplé à Aitrox-USIP, un logiciel de deep learning qui détecte les nodules et les classe selon la grille ACR TI-RADS. Sur 262 patients suivis dans trois centres chinois entre mars 2024 et août 2025, le système s'accorde bien avec l'échographie manuelle sur les mesures et aurait permis d'éviter 74,8 % des examens jugés inutiles, mais il a manqué 19,2 % des recommandations de cytoponction. Les auteurs eux-mêmes concluent que l'outil ne peut fonctionner que sous supervision experte — une prudence bienvenue, alors que trois des dix-sept auteurs sont salariés des entreprises qui commercialisent le robot et le logiciel évalués.

Le contexte

Le nodule thyroïdien est une découverte extrêmement fréquente : une majorité de la population en développe un au cours de sa vie, la grande majorité bénins. L'échographie est l'examen de première intention pour les caractériser, et la grille ACR TI-RADS (Thyroid Imaging Reporting and Data System du American College of Radiology) traduit l'aspect d'un nodule — forme, contours, échogénicité, composition, présence de microcalcifications — en un score qui indique s'il faut surveiller, ponctionner à l'aiguille fine (FNAB, fine-needle aspiration biopsy) ou ne rien faire. Le problème n'est pas la grille elle-même mais son application : l'échographie thyroïdienne reste un geste opérateur-dépendant, chronophage, et le nombre de sonologues qualifiés ne suit pas la demande de dépistage, en Chine comme ailleurs.

Deux pistes technologiques progressent en parallèle depuis quelques années. D'un côté, des logiciels de deep learning qui classent automatiquement des images déjà acquises par un opérateur humain — c'est l'objet de la plupart des études publiées jusqu'ici, presque toutes rétrospectives, sur des images déjà sélectionnées. De l'autre, des bras robotiques capables de réaliser eux-mêmes le balayage échographique, jusqu'ici surtout démontrés en faisabilité technique plutôt qu'en usage clinique répété. Le papier ici décrypté est l'un des premiers à combiner les deux — acquisition robotique autonome et interprétation automatisée — et à le faire de façon prospective, sur plusieurs centres, plutôt que sur une base d'images déjà constituée.

La méthode

Le système, baptisé FARUSS (Fully Autonomous Robotic UltraSound System), associe un bras robotique à six degrés de liberté — c'est-à-dire capable de déplacer la sonde selon six mouvements indépendants, position et orientation, comme un bras humain — à un pilotage par deep learning qui ajuste la trajectoire de balayage sans intervention humaine. Les images qu'il produit sont ensuite analysées par Aitrox-USIP, une plateforme de deep learning développée par la société Shanghai Aitrox Technology, qui détecte les nodules et propose une catégorie ACR TI-RADS.

262 participants ont été recrutés dans trois institutions — l'hôpital Zhongshan de l'université Fudan à Shanghai, un centre gériatrique shanghaïen et l'antenne de Xiamen du même hôpital — entre mars 2024 et août 2025. Chaque patient a bénéficié des deux examens : une échographie thyroïdienne conventionnelle, réalisée à la main par un sonologue, puis un passage sous FARUSS. L'accord entre les deux méthodes a été mesuré par deux outils statistiques classiques : le coefficient de corrélation intraclasse (ICC), qui évalue si deux séries de mesures continues (ici, les dimensions des nodules) varient de façon cohérente, et le kappa pondéré, qui fait la même chose pour un classement en catégories (ici, les scores TI-RADS), en pénalisant davantage un désaccord de plusieurs catégories qu'un désaccord d'une seule. Des sonologues ont par ailleurs évalué la qualité des images produites par le robot, et ont eu la possibilité de réviser la catégorie TI-RADS proposée par l'IA avant la décision finale.

Au-delà de l'accord de mesure, l'étude s'est intéressée à un critère plus concret : combien d'examens réalisés en présence physique d'un opérateur auraient pu être évités si le premier passage s'était fait par FARUSS à distance, et combien de recommandations de cytoponction — l'étape qui déclenche une biopsie — auraient été manquées dans ce scénario. Face à ce risque, les auteurs ont testé une parade : trier les examens selon la qualité d'image obtenue par le robot et ne considérer comme fiables que les meilleurs. Cette parade n'a toutefois été testée qu'en simulation exploratoire sur les données déjà recueillies, et non par une nouvelle collecte prospective.

Les résultats

Sur les mesures des nodules, l'accord entre FARUSS et l'échographie conventionnelle est bon : ICC entre 0,757 et 0,798 selon les dimensions considérées. La cohérence d'identification des nodules jugés cliniquement significatifs atteint 85,6 %. Réaliser l'examen avec le robot prend cependant plus de temps que la main d'un sonologue : 202 secondes contre 147 (p < 0,001) — le geste autonome n'est, à ce stade, pas plus rapide que le geste humain, même s'il ne mobilise pas d'opérateur pendant ce temps.

Côté interprétation, Aitrox-USIP analyse une image plus vite qu'un sonologue ne le fait à l'œil : 183 secondes contre 254 (p < 0,001). Une fois les propositions de l'IA relues et, si besoin, corrigées par un sonologue, l'accord avec la catégorie TI-RADS établie en échographie conventionnelle grimpe à un kappa pondéré de 0,754 à 0,879 — un accord qualifié de bon à très bon selon les échelles usuelles, mais obtenu après intervention humaine, pas par l'IA seule.

Le résultat qui compte le plus pour un usage en dépistage à distance est celui-ci : en simulant un scénario où FARUSS ferait un premier tri avant tout examen en présence d'un opérateur, le système aurait évité 74,8 % des échographies jugées inutiles — un gain d'efficience réel pour désengorger des files d'attente. Mais dans ce même scénario, il aurait aussi manqué 19,2 % des recommandations de cytoponction qu'un examen conventionnel aurait posées. Concrètement : sur cinq patients pour lesquels une biopsie thyroïdienne aurait dû être proposée, l'outil, utilisé seul en première ligne, en aurait laissé passer un. Le tri par qualité d'image a réduit ce taux de manqués dans la simulation, mais cette correction reste elle-même non validée prospectivement.

Ce qui est bien

Un design prospectif et multicentrique, ce qui reste rare dans ce champ : la plupart des études sur l'IA en échographie thyroïdienne comparent un algorithme à une vérité terrain déjà figée, sur des images déjà choisies. Ici, 262 patients réels ont subi les deux examens dans trois établissements différents, sur près d'un an et demi.

Un chiffre qui dérange, publié quand même. Beaucoup de papiers commerciaux mettent en avant le taux d'examens évités et passent sous silence le taux de faux négatifs cliniquement significatifs. Ici, le 19,2 % de recommandations de cytoponction manquées figure dans le résumé de l'article, pas seulement en annexe — et la conclusion des auteurs, qui exigent une « supervision experte », en tient compte plutôt que de la minimiser.

Un gain de temps d'interprétation démontré et mesuré : 183 secondes contre 254 pour l'analyse d'image, avec un test statistique à l'appui, sur les mêmes cas. C'est un résultat plus solide que la plupart des annonces de gain de temps en imagerie, qui restent souvent qualitatives.

Ce qui est moins bien

Conflit d'intérêts non secondaire. Trois des dix-sept auteurs sont employés de Wuhan Cobot Technology, qui fabrique le bras robotique, ou de Shanghai Aitrox Technology, qui développe le logiciel d'interprétation — les deux produits évalués par l'étude. Ce n'est pas disqualifiant en soi, mais cela justifierait une validation indépendante, par une équipe sans lien avec les fabricants, avant toute généralisation des conclusions.

Biais de population et validation seulement interne au système de santé chinois. Les 262 patients viennent de trois centres appartenant tous au même système hospitalier chinois. Rien n'indique la diversité des morphologies de cou, des habitudes d'échogénicité selon l'origine ethnique, ou des pratiques de sonologues formés ailleurs. Une performance mesurée dans ce cadre ne dit rien de la généralisation à d'autres populations ou d'autres écoles d'échographie.

La statistique la plus favorable masque la plus inquiétante — un exemple classique de métrique trompeuse. Présenter en premier le 74,8 % d'examens évités, sans donner le même poids au 19,2 % de cytoponctions manquées, produit un effet d'accroche qui ne resterait pas si les deux chiffres étaient mis sur un pied d'égalité. Or dans un contexte de dépistage du cancer thyroïdien, un faux négatif sur cinq à cette étape n'est pas un détail statistique : c'est un patient sur cinq nécessitant une biopsie qui repartirait rassuré à tort si le système fonctionnait seul, sans le filet de sécurité qu'est la relecture humaine. Le correctif proposé — le tri par qualité d'image — n'a lui-même été testé qu'en simulation exploratoire, c'est-à-dire recalculé après coup sur les données déjà collectées, et non vérifié sur une nouvelle cohorte suivie prospectivement. Enfin, ni le code d'Aitrox-USIP ni les poids du modèle ne sont mentionnés comme disponibles, ce qui empêche toute réplication indépendante.

Ce que ça change

Pour la communauté de recherche, l'étude fixe un standard méthodologique bienvenu — comparer un système robotique et son IA à l'échographie conventionnelle sur les mêmes patients, en prospectif et en multicentrique — que d'autres équipes devraient reproduire de façon indépendante, idéalement hors de Chine, pour tester la généralisation. Elle montre aussi qu'il ne suffit pas de rapporter un ICC ou un kappa favorables : la mesure qui compte pour la sécurité du patient est le taux de décisions cliniques manquées, pas seulement l'accord statistique.

Pour les cliniciens, rien ne change dans l'immédiat. FARUSS n'est validé, par les auteurs eux-mêmes, que comme outil de pré-tri sous supervision experte, pas comme substitut à l'échographie réalisée par un opérateur formé. Un taux de 19,2 % de recommandations de biopsie manquées interdit tout déploiement en autonomie complète tant qu'une nouvelle étude n'aura pas validé prospectivement la parade par tri de qualité d'image.

Pour les patients et le grand public, la promesse — un dépistage thyroïdien accessible dans des zones où les sonologues manquent — reste réelle à moyen terme, mais conditionnelle : ce que montre ce papier, c'est qu'un robot peut aujourd'hui accélérer l'acquisition et l'analyse d'images, pas encore remplacer le regard d'un professionnel formé sur la décision de biopsier.

Pour aller plus loin

Le papier : Prospective multicenter evaluation of an autonomous robotic ultrasound system integrated with AI-assisted thyroid nodule assessment, Yi-Kang Sun, Ya-Qin Zhang, Xin-Yuan Hu et al. (Zhongshan Hospital, université Fudan, Shanghai ; Wuhan Cobot Technology Co., Ltd ; Shanghai Aitrox Technology Co., Ltd), npj Digital Medicine, 22 septembre 2026, DOI 10.1038/s41746-026-03260-7.

Sur l'IA appliquée à l'échographie thyroïdienne, voir aussi notre décryptage sur ThyroidXAgent, testé sur 35 centres. Sur les systèmes d'échographie embarquant de l'IA en présence d'un opérateur, voir notre décryptage sur l'échographie abdominale assistée par IA en essai croisé randomisé.