Skip to main content
QUICK REVIEW

[论文解读] Intuitive Surgical SurgToolLoc Challenge Results: 2022-2023

Aneeq Zia, Max Berniker|arXiv (Cornell University)|May 11, 2023
Surgical Simulation and Training被引用 5
一句话总结

本文展示了2022-2023年MICCAI SurgToolLoc挑战赛的结果,该挑战赛要求参赛团队利用仅来自机器人手术系统日志的工具存在事件(弱标签)而非昂贵的人工标注边界框,开发机器学习模型以检测并定位内镜视频中的手术器械。尽管在工具分类任务(类别1)中表现良好,但模型在定位任务(类别2)中表现显著不佳,凸显了在标签噪声大、稀疏的手术视频上训练鲁棒弱监督模型的挑战。

ABSTRACT

Robotic assisted (RA) surgery promises to transform surgical intervention. Intuitive Surgical is committed to fostering these changes and the machine learning models and algorithms that will enable them. With these goals in mind we have invited the surgical data science community to participate in a yearly competition hosted through the Medical Imaging Computing and Computer Assisted Interventions (MICCAI) conference. With varying changes from year to year, we have challenged the community to solve difficult machine learning problems in the context of advanced RA applications. Here we document the results of these challenges, focusing on surgical tool localization (SurgToolLoc). The publicly released dataset that accompanies these challenges is detailed in a separate paper arXiv:2501.09209 [1].

研究动机与目标

  • 通过利用机器人辅助手术系统中的工具存在数据作为弱标签,解决手术视频分析中昂贵的人工标注瓶颈。
  • 评估工具存在事件(如器械安装和移除的时间戳)是否足以作为训练准确的手术器械检测与定位模型的监督信号。
  • 通过实现无需逐帧边界框标注的可扩展、自动化的模型训练,推动手术数据科学领域的发展。
  • 发布一个大规模、公开可用的数据集,包含24,695段视频剪辑及其工具存在标签,以支持未来在手术人工智能领域的研究。

提出的方法

  • 参赛者在训练过程中仅使用工具存在标签(如器械安装/卸载时间)作为弱监督,未访问真实边界框。
  • 团队采用了最先进的深度学习架构,包括ResNet主干网络和基于Transformer的模型,并在手术视频数据上进行微调。
  • 在定位任务(类别2)中,采用类激活映射(CAM)等方法从分类头生成预测工具位置的热力图。
  • 许多团队在公开的手术数据集(如EndoVis和Cholec80)上进行预训练,以提升特征学习能力和泛化性能。
  • 挑战赛分为两个类别:类别1为每帧的工具分类,类别2为联合分类与定位(含边界框)。
  • 性能评估采用标准指标:分类任务使用mAP,定位任务使用带IoU阈值的mAP。
Figure 1: Overview of challenge categories 1 and 2
Figure 1: Overview of challenge categories 1 and 2

实验结果

研究问题

  • RQ1机器人手术系统中的工具存在事件能否作为训练手术器械检测与定位模型的有效弱监督信号?
  • RQ2与完全监督基线相比,弱监督模型在手术视频上的表现如何,特别是在定位任务中?
  • RQ3在公开手术数据集上进行预训练在多大程度上能提升弱监督手术器械识别与定位的性能?
  • RQ4当前深度学习模型在应用于具有噪声和稀疏标签的手术视频时,存在哪些关键局限性?
  • RQ5通过改进网络架构或损失函数设计,能否缩小分类与定位任务之间的性能差距?

主要发现

  • 在类别1(工具分类)中,参赛团队表现优异,顶尖模型达到高mAP分数,表明弱标签足以实现可靠的分类。
  • 在类别2(定位)中,性能显著低于类别1,大多数模型在标准IoU阈值下未能达到可接受的定位准确率。
  • 类激活映射(CAM)在定位中至关重要,但效果仅中等,表明空间注意力机制在手术器械检测方面存在局限性。
  • 在EndoVis等公开数据集上进行预训练显著提升了模型性能,其中13支队伍中有5支在类别1、3支在类别2中使用了此类数据。
  • 在类别1中表现良好的模型通常在类别2中也表现更优,表明准确的工具存在识别是实现定位的前提条件。
  • 训练数据包含24,695段带工具存在标签的视频剪辑,已公开发布,以支持未来在手术人工智能与弱监督学习领域的研究。
Figure 2: Sample frames with presence labels (left) and a snapshot of the labels CSV file (right)
Figure 2: Sample frames with presence labels (left) and a snapshot of the labels CSV file (right)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。