Skip to main content
QUICK REVIEW

[论文解读] Weakly-Supervised Learning for Tool Localization in Laparoscopic Videos

Armine Vardazaryan, Didier Mutter|arXiv (Cornell University)|Jun 14, 2018
Surgical Simulation and Training参考文献 17被引用 4
一句话总结

本文提出了一种弱监督深度学习方法,仅使用图像级标注即可在腹腔镜视频中实现手术器械定位,避免了昂贵的空间标注。通过将全卷积网络(FCN)与ResNet18主干网络结合,并引入扩展空间池化(ESP),模型生成定位热力图,以高精度预测器械的存在与位置,在Cholec80数据集上达到88%的平均精度(mAP)。

ABSTRACT

Surgical tool localization is an essential task for the automatic analysis of endoscopic videos. In the literature, existing methods for tool localization, tracking and segmentation require training data that is fully annotated, thereby limiting the size of the datasets that can be used and the generalization of the approaches. In this work, we propose to circumvent the lack of annotated data with weak supervision. We propose a deep architecture, trained solely on image level annotations, that can be used for both tool presence detection and localization in surgical videos. Our architecture relies on a fully convolutional neural network, trained end-to-end, enabling us to localize surgical tools without explicit spatial annotations. We demonstrate the benefits of our approach on a large public dataset, Cholec80, which is fully annotated with binary tool presence information and of which 5 videos have been fully annotated with bounding boxes and tool centers for the evaluation.

研究动机与目标

  • 解决手术视频数据集中空间标注有限的问题,该问题限制了模型的可扩展性与泛化能力。
  • 实现在训练过程中无需边界框或分割掩码即可进行器械定位。
  • 利用深度网络的特征层次结构,仅通过图像级标签推断空间位置。
  • 证明弱监督学习在大规模公开数据集(如Cholec80)上实现手术器械检测与定位的可行性。
  • 为手术视频分析中的自动化标注工具及未来的分割方法提供基础。

提出的方法

  • 通过将最后的全连接层和平均池化层替换为全卷积架构,对ResNet18主干网络进行改进,以保留空间分辨率。
  • 将最后两个残差块的步长从2降低为1,以提高特征图分辨率,使全局步长为8时输出分辨率提升四倍。
  • 使用1×1卷积层生成C个定位热力图(C=7,对应7种器械),随后通过扩展空间池化(ESP)增强目标检测的细节。
  • 应用ESP池化:$ s^c = \max z^c + \alpha \min z^c $,其中$\alpha = 0.6$,以生成类别相关的置信度分数并优化定位图。
  • 推理阶段,通过双线性插值上采样热力图,并将最大激活位置作为工具中心的预测结果。
  • 引入数据增强技术,包括随机裁剪、颜色抖动和mixup,以提升模型的鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1弱监督深度学习模型是否能仅使用图像级标注实现准确的手术器械定位?
  • RQ2与标准池化相比,扩展空间池化(ESP)在提升定位精度方面表现如何?
  • RQ3像mixup和掩码等数据增强策略在手术视频数据上的泛化能力提升方面有多大作用?
  • RQ4对于形状模糊或外观多变的器械(如标本袋),模型的性能如何?
  • RQ5所学习的定位图是否可用于指导未来的弱监督分割或自动化标注流程?

主要发现

  • 所提出的弱监督方法在Cholec80测试集上的工具定位平均精度(mAP)达到88%,证明了在无空间标注条件下仍具备强大性能。
  • 采用ESP与掩码策略的模型(FCN_ESP_Msk)在预测与真实工具中心之间的平均距离误差最低(6.8%),优于其他变体。
  • 标本袋的定位误差最高(平均距离9.7%),归因于其形状多变且中心点定义模糊。
  • 采用ESP与掩码的模型生成的定位图对器械区域覆盖更佳,且激活模式更具区分性,尤其在剪刀和灌注器等器械上表现明显。
  • 模型将剪刀和灌注器的杆部识别为高度区分性的特征,这可能是AP得分较低的原因,因为真实标注的边界框通常聚焦于器械尖端。
  • 定性结果表明,FCN_ESP_MM_Msk生成的定位图最为一致且细节丰富,工具尖端处激活强烈,且误报极少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。