Skip to main content
QUICK REVIEW

[论文解读] Multitask Learning of Temporal Connectionism in Convolutional Networks using a Joint Distribution Loss Function to Simultaneously Identify Tools and Phase in Surgical Videos

Shanka Subhra Mondal, Rachana Sathish|arXiv (Cornell University)|May 20, 2019
Surgical Simulation and Training参考文献 23被引用 13
一句话总结

该论文提出了一种多任务深度学习框架,采用ResNet-50主干网络和双向LSTM,并引入一种新颖的加权联合分布损失函数,以在腹腔镜视频中同时检测手术器械和手术阶段。该方法在Cholec80数据集上实现了工具检测的最先进mAP(0.99)和阶段检测的mAP(0.857),通过联合建模工具-阶段共现关系以及双向时序建模,优于以往方法。

ABSTRACT

Surgical workflow analysis is of importance for understanding onset and persistence of surgical phases and individual tool usage across surgery and in each phase. It is beneficial for clinical quality control and to hospital administrators for understanding surgery planning. Video acquired during surgery typically can be leveraged for this task. Currently, a combination of convolutional neural network (CNN) and recurrent neural networks (RNN) are popularly used for video analysis in general, not only being restricted to surgical videos. In this paper, we propose a multi-task learning framework using CNN followed by a bi-directional long short term memory (Bi-LSTM) to learn to encapsulate both forward and backward temporal dependencies. Further, the joint distribution indicating set of tools associated with a phase is used as an additional loss during learning to correct for their co-occurrence in any predictions. Experimental evaluation is performed using the Cholec80 dataset. We report a mean average precision (mAP) score of 0.99 and 0.86 for tool and phase identification respectively which are higher compared to prior-art in the field.

研究动机与目标

  • 开发一种统一的深度学习框架,用于在内窥镜视频中同时检测手术器械和手术阶段。
  • 通过引入联合分布损失函数,建模工具与手术阶段之间的共现依赖关系,以提升检测性能。
  • 利用双向LSTM捕捉手术流程中的长期时序依赖关系,同时处理前向和后向上下文。
  • 在无需数据增强的情况下,实现对类别不平衡和时长可变的手术视频数据的鲁棒性能。
  • 支持临床应用,如手术流程分析、质量控制和手术进度监控。

提出的方法

  • 使用ResNet-50卷积神经网络从单个视频帧中提取高层视觉特征。
  • 将提取的特征输入双向LSTM,以建模帧之间的过去和未来时序依赖关系。
  • 提出一种新颖的加权联合分布损失函数,用于编码与每个手术阶段相关的工具集合的概率,以纠正共现模式。
  • 多任务学习框架通过共享视觉特征和联合损失函数,联合优化工具检测与阶段分类任务。
  • 在Bi-LSTM训练前,对CNN特征应用特征白化和完整视频批量堆叠,以提升收敛性和性能。
  • 对阶段预测结果应用中值滤波,以减少突变过渡,提升mAP和准确率。

实验结果

研究问题

  • RQ1单一深度学习模型能否有效实现手术视频中工具与阶段的联合检测并实现更高的准确率?
  • RQ2引入建模工具-阶段共现关系的联合分布损失函数,对检测性能有何影响?
  • RQ3与单向或非循环模型相比,双向LSTM对时序上下文的建模在多大程度上提升了阶段检测性能?
  • RQ4该模型在无需数据增强的情况下,能否在时长可变的手术阶段和类别不平衡的工具-阶段分布上实现良好泛化?
  • RQ5采用共享特征和联合损失的多任务框架,是否相比独立训练具有更好的收敛性和鲁棒性?

主要发现

  • 所提方法在工具检测上实现了0.99的平均平均精度(mAP),超越了该领域所有先前工作。
  • 在阶段检测方面,模型实现了0.857的mAP,高于大多数先前方法,且与最先进水平相当。
  • 该模型对Cholec80数据集中的类别不平衡表现出强鲁棒性,在无需数据增强的情况下仍保持高性能。
  • 使用双向LSTM结合完整视频批量堆叠和特征白化,显著提升了收敛速度和性能。
  • 对阶段预测结果应用中值滤波,通过平滑突变过渡,显著提升了mAP和准确率。
  • 该框架在不同阶段时长和视觉差异下均表现出良好泛化能力,表明其具备强大的时序和外观泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。