Skip to main content
QUICK REVIEW

[论文解读] RASNet: Segmentation for Tracking Surgical Instruments in Surgical Videos Using Refined Attention Segmentation Network

Zhen-Liang Ni, Gui‐Bin Bian|arXiv (Cornell University)|May 21, 2019
Surgical Simulation and Training参考文献 12被引用 13
一句话总结

该论文提出RASNet,一种基于U-Net的分割网络,引入了一种新颖的注意力融合模块(AFM),通过利用高层特征中的全局上下文来优化低层特征,从而增强特征融合。通过迁移学习、结合交叉熵与对数Jaccard指数的混合损失函数,并在MICCAI EndoVis 2017数据集上进行训练,RASNet在手术器械分割与分类任务中实现了最先进性能,平均Dice系数达94.65%,平均IOU达90.33%。

ABSTRACT

Segmentation for tracking surgical instruments plays an important role in robot-assisted surgery. Segmentation of surgical instruments contributes to capturing accurate spatial information for tracking. In this paper, a novel network, Refined Attention Segmentation Network, is proposed to simultaneously segment surgical instruments and identify their categories. The U-shape network which is popular in segmentation is used. Different from previous work, an attention module is adopted to help the network focus on key regions, which can improve the segmentation accuracy. To solve the class imbalance problem, the weighted sum of the cross entropy loss and the logarithm of the Jaccard index is used as loss function. Furthermore, transfer learning is adopted in our network. The encoder is pre-trained on ImageNet. The dataset from the MICCAI EndoVis Challenge 2017 is used to evaluate our network. Based on this dataset, our network achieves state-of-the-art performance 94.65% mean Dice and 90.33% mean IOU.

研究动机与目标

  • 提升内镜视频中手术器械分割的准确性,这对机器人辅助手术至关重要。
  • 应对视野受限、器械几何形态多变以及因前景区域较小导致的严重类别不平衡等挑战。
  • 开发一种能够同时识别器械类别并生成精确边界预测的分割网络。
  • 通过注意力机制引入全局上下文信息,增强编码器与解码器之间的特征融合。
  • 通过损失函数设计与迁移学习,提升对小型、稀有或视觉上相似器械的分割性能。

提出的方法

  • RASNet采用U-Net架构,以预训练于ImageNet的ResNet-50作为编码器,利用迁移学习提升特征表示能力。
  • 提出注意力融合模块(AFM),通过高层特征的全局上下文动态加权低层特征,替代传统的拼接操作。
  • AFM对高层特征计算全局平均池化,经1×1卷积与批量归一化处理后,使用softmax生成注意力权重,用于特征调制。
  • 采用混合损失函数,结合交叉熵与Jaccard指数的对数形式,以缓解前景(器械)与背景像素之间的类别不平衡问题。
  • 通过跳跃连接融合高层与低层特征,AFM通过聚焦于相关区域,确保更精确的定位。
  • 网络在MICCAI EndoVis 2017数据集上端到端训练,推理阶段生成每类器械的像素级掩码。

实验结果

研究问题

  • RQ1注意力机制是否能提升在小尺寸、形态多变且易被遮挡的内镜视频中手术器械的分割准确性?
  • RQ2与标准拼接方式相比,所提出的注意力融合模块(AFM)在增强编码器与解码器之间特征融合方面的有效性如何?
  • RQ3混合损失函数(交叉熵 + 对数Jaccard)在缓解手术器械分割中的类别不平衡问题方面,效果如何?
  • RQ4从ImageNet进行迁移学习对在有限的手术视频数据集上的性能有何影响?
  • RQ5哪些类型的器械最难分割,性能差异的潜在原因是什么?

主要发现

  • 在MICCAI EndoVis 2017数据集上,RASNet的平均Dice系数达94.65%,平均IOU达90.33%,优于U-Net(70.04% Dice)与TernausNet(88.04% Dice)。
  • 与未使用AFM的相同网络相比,AFM使Dice系数提升5.34个百分点,IOU提升7.58个百分点。
  • 弯曲剪刀的性能最高(Dice系数99.01%),而Prograsp力臂与抓持拉钩的Dice系数较低(分别为84.59%与88.05%),原因在于视觉相似性与数据稀缺性。
  • 采用ImageNet预训练的网络达到94.65% Dice,显著优于随机初始化(78.11% Dice),证明了迁移学习的优势。
  • 可视化对比显示,RASNet的预测结果与真实标签高度吻合,而U-Net与TernausNet则存在误分类与边界不准确的问题。
  • 混合损失函数有效降低了类别不平衡的影响,即使在前景像素数量极少的情况下,仍能提升对小型、稀有器械的分割性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。