机器人甲状腺超声:全自主FARUSS机械臂能很好识别结节,但五分之一的穿刺活检建议被漏诊

复旦大学附属中山医院(上海)的一个团队在真实临床条件下测试了FARUSS——一款拥有六个自由度、能够独立完成甲状腺超声扫描的机械臂,并搭配深度学习平台Aitrox-USIP,后者负责检测结节并按照美国放射学会甲状腺影像报告和数据系统(ACR TI-RADS)进行分类。在2024年3月至2025年8月期间,三家中国医疗机构对262名患者进行了随访,该系统在结节测量上与人工超声吻合良好,理论上可避免74.8%被判定为不必要的检查,但漏诊了19.2%本应提出的细针穿刺活检(FNAB)建议。作者本人也得出结论:该工具只能在专家监督下运行——这一谨慎表态尤为可贵,因为在十七位作者中,有三位受雇于生产这台机械臂和这套软件的公司。

背景

甲状腺结节是一种极为常见的发现:大多数人一生中都会长出至少一个,其中绝大多数是良性的。超声检查是评估甲状腺结节的一线手段,而ACR TI-RADS量表(美国放射学会甲状腺影像报告和数据系统)将结节的外观特征——形态、边界、回声、成分、是否存在微钙化——转化为一个分数,用以指示应当随访观察、进行细针穿刺活检(FNAB,fine-needle aspiration biopsy),还是无需处理。问题并不在量表本身,而在于其应用:甲状腺超声检查仍然高度依赖操作者,耗时较长,而合格超声医师的数量增长跟不上筛查需求的增长,无论在中国还是其他地方都是如此。

近几年,两条技术路线并行发展。一方面,深度学习软件对操作者已经采集好的图像进行自动分类——这是迄今为止大多数已发表研究的主题,几乎全部为回顾性研究,基于已经筛选好的图像。另一方面,机械臂能够自主完成超声扫描本身,但迄今大多只是验证了技术可行性,而非反复用于临床实践。本文解读的这篇论文,是首批将两者结合起来——自主机器人采集加自动化判读——并以前瞻性、多中心的方式完成研究的论文之一,而非依赖已经建好的图像库。

方法

该系统名为FARUSS(全自主机器人超声系统,Fully Autonomous Robotic UltraSound System),将一台具有六个自由度的机械臂——即能够像人的手臂一样,沿六个独立的位置和方向自由移动探头——与基于深度学习的控制算法结合,后者可在无人干预的情况下自主调整扫描轨迹。机械臂采集的图像随后由Aitrox-USIP分析,这是由上海爱声科技公司(Shanghai Aitrox Technology)开发的深度学习平台,用于检测结节并给出ACR TI-RADS分类建议。

研究团队于2024年3月至2025年8月期间,在三家机构招募了262名参与者——上海复旦大学附属中山医院、上海市某老年医学中心,以及中山医院厦门分院。每位患者都接受了两次检查:一次由超声医师徒手完成的传统甲状腺超声,另一次由FARUSS完成的扫描。两种方法之间的一致性通过两种经典统计工具评估:组内相关系数(ICC,intraclass correlation coefficient),用于评估两组连续测量值——此处为结节尺寸——是否具有一致的变化趋势;以及加权kappa系数,用于评估分类结果的一致性——此处为TI-RADS评分——对相差多个级别的分歧给予比相差一个级别更重的惩罚。此外,超声医师还对机械臂生成图像的质量进行了评估,并可以在做出最终决定前修改人工智能给出的TI-RADS分类。

除了测量一致性之外,该研究还关注了一个更具体的指标:如果第一次检查改由FARUSS远程完成,有多少需要操作者现场在场的检查本可以被避免,又有多少本应提出的FNAB建议——即触发活检的那一步——会在这种情境下被漏掉。面对这一风险,作者测试了一种补救措施:根据机械臂获得的图像质量对检查结果进行分级,只信任质量最高的那部分。然而,这一补救措施仅在已收集数据上进行了探索性模拟,并未通过新的前瞻性数据采集加以验证。

结果

在结节测量方面,FARUSS与传统超声的一致性良好:根据所测量的维度不同,ICC介于0.757至0.798之间。对具有临床意义结节的识别一致性达到85.6%。然而,用机械臂完成检查所需的时间比超声医师徒手操作更长:202秒对147秒(p < 0.001)——就目前而言,自主扫描并不比人工操作更快,尽管它在这段时间内不占用操作者的人力。

在判读方面,Aitrox-USIP分析一幅图像的速度快于超声医师肉眼判读:183秒对254秒(p < 0.001)。在人工智能给出的建议经超声医师审核、必要时加以修正之后,其与传统超声所确定的TI-RADS分类的一致性上升至加权kappa值0.754至0.879——按常用量表属于良好至极好的一致性,但这一结果是在人工干预之后取得的,而非人工智能单独达成。

对于远程筛查应用而言,最重要的结果如下:在模拟"FARUSS在任何现场检查之前先行初筛"这一场景时,该系统本可避免74.8%被判定为不必要的超声检查——这对于缓解排队等候压力是一项实实在在的效率提升。但在同一场景下,它也会漏掉本应由传统检查作出的19.2%的FNAB建议。具体而言:在每五名本应被建议进行甲状腺活检的患者中,如果单独使用该工具作为一线检查,会有一人被漏诊。按图像质量分级的做法在模拟中降低了这一漏诊率,但这项修正本身尚未经过前瞻性验证。

做得好的地方

前瞻性、多中心的研究设计,这在该领域仍属罕见:大多数关于甲状腺超声人工智能的研究,都是将算法与早已固定的参考标准进行比较,基于事先筛选好的图像。而在本研究中,262名真实患者在近一年半的时间里,于三家不同机构接受了两种检查。

一个令人不安、却依然被公开发表的数字。 许多带有商业关联的论文会突出强调"避免检查"的比例,而对具有临床意义的假阴性比例避而不谈。本研究中,19.2%的FNAB建议漏诊率出现在论文摘要中,而非被藏在附录里——作者要求"专家监督"的结论,正视了这一数字,而不是淡化它。

判读时间的缩短得到了明确证实和测量:在相同病例上,图像分析时间为183秒对254秒,并有统计检验支持。相比影像医学中大多数停留在定性层面的"节省时间"说法,这是一个更为扎实的结果。

做得不够好的地方

不容忽视的利益冲突。 在十七位作者中,有三位受雇于生产机械臂的武汉库柏特科技(Wuhan Cobot Technology),或开发判读软件的上海爱声科技——正是本研究所评估的这两款产品的制造商。这本身并不足以否定研究结果,但意味着在推广结论之前,理应由与制造商没有关联的团队进行独立验证。

人群偏倚,且验证仅局限于中国医疗体系内部。 262名患者均来自同属一个中国医院系统的三家中心。研究并未说明颈部形态的多样性、不同族裔背景下回声特征的差异,或在其他地方接受培训的超声医师的操作习惯。在这一背景下测得的性能,无法说明该系统能否推广至其他人群或其他超声流派。

最亮眼的数字掩盖了最令人担忧的数字——一个典型的"误导性指标"案例。 把74.8%的"避免检查"比例放在最前面强调,却不给19.2%的FNAB漏诊率同等的分量,制造出一种若把两个数字并列呈现就无法成立的吸睛效果。在甲状腺癌筛查的语境下,这一步骤中五分之一的假阴性绝非一个统计学细节:这意味着五名本应接受活检的患者中,就有一人会在系统单独运行、缺少人工复核这道安全网的情况下,被错误地告知"无须担心"。研究提出的补救方案——按图像质量分级——本身也只在探索性模拟中测试过,也就是在已收集的数据上事后重新计算,而未在新的前瞻性随访队列中得到验证。此外,论文既未提及Aitrox-USIP的代码是否开放,也未提及模型权重是否可获取,这使得任何独立复现都无从谈起。

这意味着什么

对研究界而言,这项研究确立了一个值得欢迎的方法学标准——在同一批患者身上,以前瞻性、多中心的方式,将机器人系统及其人工智能与传统超声进行比较——其他团队应当独立重复这一研究,最好是在中国以外的地区,以检验其可推广性。研究也表明,仅仅报告一个理想的ICC或kappa值是不够的:真正关乎患者安全的指标,是临床决策的漏诊率,而不仅仅是统计学上的一致性。

对临床医生而言,目前尚无需改变任何做法。按作者自己的说法,FARUSS仅被验证为一种在专家监督下使用的初筛工具,而非训练有素的操作者所做超声检查的替代品。19.2%的活检建议漏诊率,使得任何完全自主的部署都无从谈起,除非新的研究能够前瞻性地验证按图像质量分级这一补救措施。

对患者和公众而言,这项技术所承诺的愿景——在超声医师短缺地区提供便捷的甲状腺筛查——在中期内仍然真实可期,但附有条件:这篇论文表明,机器人如今可以加快图像采集和分析的速度,但尚不能取代训练有素的专业人员在是否进行活检这一决策上的判断。

延伸阅读

论文原文:Prospective multicenter evaluation of an autonomous robotic ultrasound system integrated with AI-assisted thyroid nodule assessment,作者Yi-Kang Sun、Ya-Qin Zhang、Xin-Yuan Hu等(复旦大学附属中山医院,上海;武汉库柏特科技有限公司;上海爱声科技有限公司),发表于npj Digital Medicine,2026年9月22日,DOI 10.1038/s41746-026-03260-7。

关于人工智能在甲状腺超声中的应用,另见我们对ThyroidXAgent(在35家中心测试)的解读。关于在操作者在场情况下嵌入人工智能的超声系统,另见我们对一项随机交叉试验中人工智能辅助腹部超声的解读。