Skip to main content
QUICK REVIEW

[论文解读] LRTD: Long-Range Temporal Dependency based Active Learning for Surgical Workflow Recognition

Xueying Shi, Yueming Jin|arXiv (Cornell University)|Apr 21, 2020
Surgical Simulation and Training参考文献 28被引用 6
一句话总结

本文提出LRTD,一种用于外科手术流程识别的新型主动学习方法,通过非局部循环卷积网络(NL-RCNet)建模长程时序依赖性(LRTD),以选择信息量丰富的视频片段。通过基于低片段内依赖性得分对片段进行排序(表明信息含量更高),该方法仅使用完整数据集的50%即实现优越性能,在Cholec80数据集上优于完全监督训练和当前最先进的主动学习基线方法。

ABSTRACT

Automatic surgical workflow recognition in video is an essentially fundamental yet challenging problem for developing computer-assisted and robotic-assisted surgery. Existing approaches with deep learning have achieved remarkable performance on analysis of surgical videos, however, heavily relying on large-scale labelled datasets. Unfortunately, the annotation is not often available in abundance, because it requires the domain knowledge of surgeons. In this paper, we propose a novel active learning method for cost-effective surgical video analysis. Specifically, we propose a non-local recurrent convolutional network (NL-RCNet), which introduces non-local block to capture the long-range temporal dependency (LRTD) among continuous frames. We then formulate an intra-clip dependency score to represent the overall dependency within this clip. By ranking scores among clips in unlabelled data pool, we select the clips with weak dependencies to annotate, which indicates the most informative ones to better benefit network training. We validate our approach on a large surgical video dataset (Cholec80) by performing surgical workflow recognition task. By using our LRTD based selection strategy, we can outperform other state-of-the-art active learning methods. Using only up to 50% of samples, our approach can exceed the performance of full-data training.

研究动机与目标

  • 为解决外科视频数据集标注成本高昂的问题,这些数据集需要专家知识且标注耗时。
  • 通过利用超出局部帧级不确定性的长程时序依赖性,改进外科视频分析中的主动学习。
  • 在保持或超越完全监督训练性能的同时,减少标注工作量。
  • 开发一种数据选择策略,优先选择片段内依赖性弱的片段,因其最具信息量,适于模型训练。
  • 在大规模公开外科数据集(Cholec80)上验证该方法,并展示其在低成本视频分析中的临床潜力。

提出的方法

  • 提出一种非局部循环卷积网络(NL-RCNet),通过集成非局部模块来建模视频片段中跨帧的长程时序依赖性。
  • 引入片段内依赖性得分,基于帧间注意力权重量化每个片段内部的整体时序一致性。
  • 根据片段内依赖性得分选择未标注片段进行标注——得分越低的片段被认为信息量越大,优先被选中。
  • 在未标注数据池上采用排序机制,优先选择依赖性弱的片段,假设其包含更多样化或模糊的时序模式。
  • 使用所选片段增量式地训练深度学习模型,并在每次主动学习迭代中更新模型。
  • 采用具有长短期记忆(LSTM)单元的循环架构,以建模外科视频片段中的序列动态,并通过非局部操作增强长程建模能力。

实验结果

研究问题

  • RQ1建模长程时序依赖性是否能提升外科手术流程识别中主动学习所选视频片段的信息量?
  • RQ2与基于帧级不确定性或局部帧关系的方法相比,选择低片段内依赖性得分的片段是否能带来更好的模型性能?
  • RQ3基于全局时序一致性的数据选择策略是否能超越仅依赖邻近帧信息的当前最先进主动学习方法?
  • RQ4LRTD在多大程度上可降低标注成本,同时保持或超越完全监督训练的性能?
  • RQ5基于LRTD选择片段如何影响不同外科阶段(尤其是具有复杂转换的阶段)的性能表现?

主要发现

  • LRTD方法在Cholec80数据集上表现优异,当仅标注50%数据时,性能超越完全监督训练。
  • LRTD在所有标注比例下均持续提升准确率、Jaccard分数、F1分数和召回率,性能稳定且波动极小。
  • 在所有数据比例下,LRTD在准确率、Jaccard分数、F1分数和召回率方面均优于当前最先进的基于DBN的主动学习方法。
  • Phase 1(43.0%)和Phase 4(27.5%)的片段被选中频率最高,表明较长或更复杂的阶段对模型学习贡献更大。
  • 可视化结果证实,所选片段具有低依赖性得分(深色矩阵),表明时序一致性弱且信息含量高;而未选片段则显示强而均匀的依赖性。
  • 该方法表现出鲁棒性和稳定性,精确率与召回率仅出现微小波动,而DBN方法在召回率上表现出不稳定性,表明LRTD具有更好的数据分布控制能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。