Skip to main content
QUICK REVIEW

[论文解读] Pixel-Wise Recognition for Holistic Surgical Scene Understanding

Nicolás Ayobi, Santiago Rodríguez|arXiv (Cornell University)|Jan 20, 2024
Surgical Simulation and Training被引用 4
一句话总结

本文介绍了GraSP数据集,这是一个用于机器人辅助前列腺切除术中整体手术场景理解的多粒度基准,并提出了TAPIS模型——一种将全局视频特征与局部器械分割相结合的视觉变换器架构,以实现对手术阶段、步骤、器械实例和原子动作的联合识别。TAPIS在所有任务中均达到最先进性能,表明像素级分割可提升短期识别能力,且层级化任务关系可提高整体准确性。

ABSTRACT

This paper presents the Holistic and Multi-Granular Surgical Scene Understanding of Prostatectomies (GraSP) dataset, a curated benchmark that models surgical scene understanding as a hierarchy of complementary tasks with varying levels of granularity. Our approach encompasses long-term tasks, such as surgical phase and step recognition, and short-term tasks, including surgical instrument segmentation and atomic visual actions detection. To exploit our proposed benchmark, we introduce the Transformers for Actions, Phases, Steps, and Instrument Segmentation (TAPIS) model, a general architecture that combines a global video feature extractor with localized region proposals from an instrument segmentation model to tackle the multi-granularity of our benchmark. Through extensive experimentation in ours and alternative benchmarks, we demonstrate TAPIS's versatility and state-of-the-art performance across different tasks. This work represents a foundational step forward in Endoscopic Vision, offering a novel framework for future research towards holistic surgical scene understanding.

研究动机与目标

  • 为内窥镜视觉中的手术场景理解缺乏全面、多粒度基准的问题提供解决方案。
  • 将手术过程建模为长期(阶段、步骤)与短期(器械分割、原子动作)任务的层次结构,实现高标注粒度。
  • 开发一个统一框架,利用空间与时间粒度上的互补视觉识别能力。
  • 验证视觉变换器与分割引导识别在提升各层次手术理解性能方面的有效性。
  • 建立可复现的基准,提供清晰的训练/验证/测试划分,以支持未来在手术流程分析领域的研究。

提出的方法

  • 提出GraSP数据集,一个经过筛选的基准,包含四个层次化任务:手术阶段与步骤识别、器械实例分割、原子视觉动作检测,所有任务均以最高可能的粒度进行标注。
  • 设计TAPIS模型——一种基于视觉变换器的架构,结合全局视频特征提取器与来自独立器械分割头的局部区域提议,以实现多粒度理解。
  • 采用双流训练策略,其中器械分割提供空间线索,从而提升下游时间任务(如动作检测)的性能。
  • 根据不同任务采用逐步细化的时间与空间采样:阶段任务为64秒、0.25fps;步骤任务为16秒、1fps;器械识别任务为8秒、2fps;原子动作任务为0.53秒、30fps。
  • 通过使用更高级别任务(如阶段识别)的预训练权重初始化模型,实现迁移学习,以提升在短期任务上的性能。
  • 建立标准化数据划分,包含专用的训练集、验证集与测试集,以确保方法可复现性与公平比较。

实验结果

研究问题

  • RQ1在原子动作检测等短期手术识别任务中,引入像素级器械分割如何提升性能?
  • RQ2各层次手术场景理解(阶段、步骤、器械分割、原子动作)所需的最优时间与空间粒度为何?
  • RQ3任务之间的层级关系(如利用阶段识别提升步骤或动作检测性能)在多大程度上能增强整体模型性能?
  • RQ4统一的基于变换器的架构是否能有效处理长期与短期任务中手术场景理解的多粒度特性?
  • RQ5所提出方法在不同公开基准上的鲁棒性如何?其泛化能力是否超越GraSP数据集?

主要发现

  • TAPIS在GraSP基准的全部四项任务中均达到最先进性能,优于传统的CNN模型与先前基线方法。
  • 引入器械分割标注显著提升了原子动作检测的性能,证明了形状级空间线索的价值。
  • 高级任务(如阶段识别)受益于更稀疏的时间采样(如64秒、0.25fps),而低级任务(如原子动作检测)则需要精细的时间处理(0.53秒、30fps)。
  • 从阶段识别迁移学习至短期任务可带来可测量的性能提升,证实了手术理解各层次之间的层级依赖性。
  • 该模型在多个公开基准上保持一致的相对性能,验证了其鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。