Skip to main content
QUICK REVIEW

[论文解读] Concurrent Segmentation and Localization for Tracking of Surgical Instruments

Iro Laina, Nicola Rieke|arXiv (Cornell University)|Mar 30, 2017
Surgical Simulation and Training参考文献 18被引用 16
一句话总结

本文提出一种基于深度学习的腹腔镜器械并发分割与定位(CSL)方法,将2D姿态估计重新表述为热力图回归,实现分割与关键点定位的端到端联合学习。该方法在MICCAI EndoVis挑战赛2015年和视网膜微创手术基准测试中均达到最先进性能,在模糊和镜面反光等挑战性条件下表现出更高的准确性和鲁棒性。

ABSTRACT

Real-time instrument tracking is a crucial requirement for various computer-assisted interventions. In order to overcome problems such as specular reflections and motion blur, we propose a novel method that takes advantage of the interdependency between localization and segmentation of the surgical tool. In particular, we reformulate the 2D instrument pose estimation as heatmap regression and thereby enable a concurrent, robust and near real-time regression of both tasks via deep learning. As demonstrated by our experimental results, this modeling leads to a significantly improved performance than directly regressing the tool position and allows our method to outperform the state of the art on a Retinal Microsurgery benchmark and the MICCAI EndoVis Challenge 2015.

研究动机与目标

  • 解决传统顺序或两阶段方法在实时体内条件下(如运动模糊和镜面反光)性能下降的问题。
  • 通过在统一的深度学习框架中联合建模分割与定位任务,利用二者之间的固有空间依赖性。
  • 消除器械跟踪中对初始化、后处理或时间正则化的依赖。
  • 通过共享权重的全卷积网络引入全局上下文信息,提升模型的鲁棒性与准确性。
  • 在推理阶段实现对不同数量器械、关节及语义类别的灵活适应。

提出的方法

  • 将2D器械姿态估计重新表述为热力图回归,其中每个像素的值表示其为关键点位置的置信度。
  • 采用带有跳跃连接的全卷积残差网络(FCRN),以保留空间分辨率并增强特征学习能力。
  • 通过共享编码器-解码器结构,端到端联合训练模型完成语义分割与热力图回归。
  • 采用多类别分割与可学习热力图,支持多个器械与关节的区分,可明确识别左右工具。
  • 通过水平翻转数据增强策略,提升模型对未见器械视角与构型的泛化能力。
  • 采用联合损失函数,结合交叉熵损失用于分割任务与均方误差损失用于热力图回归,实现双任务的联合优化。

实验结果

研究问题

  • RQ1并发学习分割与2D姿态估计是否能提升微创手术在复杂视觉条件下的跟踪鲁棒性与准确性?
  • RQ2将定位建模为热力图回归是否优于直接的2D坐标回归,在腹腔镜器械跟踪中表现更优?
  • RQ3统一的深度学习框架是否能消除器械跟踪中对初始化、后处理或时间正则化的依赖?
  • RQ4该方法在仅在训练中见过单一器械的情况下,对未见器械与视角的泛化能力如何?
  • RQ5模型性能在语义类别数与跟踪关节数增加时,其扩展性如何?

主要发现

  • 在MICCAI EndoVis挑战赛2015中,所提出的CSL方法实现了24.8/51.6像素的平均定位误差,在所有评估指标上均优于此前最先进方法。
  • 在视网膜微创手术序列的半数分割实验中,CSL在α=0.15时平均KBB得分超过84%,显著优于基线方法。
  • 在视网膜微创手术的交叉验证实验中,CSL展现出对未见器械类型与几何形态的强大泛化能力,达到最先进性能。
  • 在视网膜微创手术基准上,模型DICE分数达到75.4%,超过U-Net(72.5%)及其他基线模型。
  • 该方法在EndoVis数据集序列5和6中成功实现了对训练中未见器械的分割与定位,即使训练时仅出现单一器械。
  • 消融实验表明,与无跳跃连接的CSL相比,加入跳跃连接使DICE分数提升0.9%,凸显其在特征精炼中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。