Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Convolutional LSTM Approach for Tool Tracking in Laparoscopic Videos

Chinedu Innocent Nwoye, Didier Mutter|arXiv (Cornell University)|Dec 4, 2018
Surgical Simulation and Training参考文献 28被引用数 6
ひとこと要約

本論文は、空間的バウンディングボックスやセグメンテーションラベルの代わりに二値の存在ラベルのみを用いる弱教師付きConvLSTM手法を提案し、腹腔鏡動画における手術用具の追跡を実現する。時間的・空間的整合性を考慮したConvLSTMを用いて局在化ヒートマップを平滑化することで、完全教師ありベースラインと比較してMOTAが12.6%向上、局在化精度が13.9%向上、ツール存在検出のmAPが5.0%向上を達成した。

ABSTRACT

Purpose: Real-time surgical tool tracking is a core component of the future intelligent operating room (OR), because it is highly instrumental to analyze and understand the surgical activities. Current methods for surgical tool tracking in videos need to be trained on data in which the spatial positions of the tools are manually annotated. Generating such training data is difficult and time-consuming. Instead, we propose to use solely binary presence annotations to train a tool tracker for laparoscopic videos. Methods: The proposed approach is composed of a CNN + Convolutional LSTM (ConvLSTM) neural network trained end-to-end, but weakly supervised on tool binary presence labels only. We use the ConvLSTM to model the temporal dependencies in the motion of the surgical tools and leverage its spatio-temporal ability to smooth the class peak activations in the localization heat maps (Lh-maps). Results: We build a baseline tracker on top of the CNN model and demonstrate that our approach based on the ConvLSTM outperforms the baseline in tool presence detection, spatial localization, and motion tracking by over 5.0%, 13.9%, and 12.6%, respectively. Conclusions: In this paper, we demonstrate that binary presence labels are sufficient for training a deep learning tracking model using our proposed method. We also show that the ConvLSTM can leverage the spatio-temporal coherence of consecutive image frames across a surgical video to improve tool presence detection, spatial localization, and motion tracking. keywords: Surgical workflow analysis, tool tracking, weak supervision, spatio-temporal coherence, ConvLSTM, endoscopic videos

研究の動機と目的

  • 手術動画解析における疎で高コストな空間的アノテーションの課題に対処し、空間的アノテーションを一切用いずに二値の存在ラベルでの学習を可能にする。
  • 完全教師ありの局在化データに依存せずに、腹腔鏡動画における手術用具の追跡性能を向上させること。
  • 時間的整合性を活用して、弱教師あり設定下での検出、局在化、トラジェクトリの平滑化を向上させること。
  • 弱教師あり条件下で検出、局在化、追跡を統合したエンドツーエンドで学習可能なモデルを構築すること。

提案手法

  • 完全畳み込みニューラルネットワークアーキテクチャが、CNNバックボーンとConvLSTMを組み合わせ、腹腔鏡動画シーケンス内の空間的・時間的依存性をモデル化する。
  • 画像レベルの二値ラベル(ツール存在有無)のみを用いてエンドツーエンドで学習し、バウンディングボックスやセグメンテーションアノテーションは一切不要である。
  • 最終層の活性化から生成される局在化ヒートマップ(Lh-maps)が、時間的に連続するフレーム間でConvLSTMによって平滑化・改善され、空間的局在化が向上する。
  • ConvLSTMが連続フレーム間の特徴表現を伝搬することで時間的整合性を学習し、検出のロバスト性とトラジェクトリの一貫性が向上する。
  • Cholec80データセットを用いて弱教師あり設定下で評価し、MOTA、平均局在化精度、存在検出のmAPを指標に性能を測定する。
  • 時間的精錬を局在化の前に行うR+CL+Cというアーキテクチャの変種を検討し、特徴マップの意味的整合性を保ったままにすることで、優れた性能を達成した。

実験結果

リサーチクエスチョン

  • RQ1二値の存在アノテーションのみで、空間的教師信号なしに、深層学習モデルが腹腔鏡動画における手術用具の追跡を安定して行えるか?
  • RQ2弱教師あり設定下で、ConvLSTMが時間的整合性をどれほど効果的に活用して局在化・追跡性能を向上させられるか?
  • RQ3時間的精錬(ConvLSTM)と局在化(分類ヘッド)の処理順序が、最終的な追跡・局在化精度に与える影響は何か?
  • RQ4再訓練なしで、1fpsから25fpsまでの異なるフレームレートに対してもモデルが一般化可能か?
  • RQ5弱教師ありモデルが生成する局在化ヒートマップは、実際のツールの境界をどれほど正確に再現できるか、あるいはインスタンスセグメンテーションへの応用が可能か?

主な発見

  • 提案手法であるConvLSTMベースのアプローチは、ベースラインと比較してMOTAが12.6%向上し、弱教師あり設定下でもマルチオブジェクト追跡性能に顕著な向上を示した。
  • 局在化精度が13.9%向上し、二値ラベルのみで手術用具の空間的境界をより正確に特定できることを示した。
  • ツール存在検出のmAPが5.0%向上し、フレーム間でのツール存在検出の信頼性が向上した。
  • R+CL+Cアーキテクチャが他の構成を上回り、時間的精錬を局在化の前に行うことで、空間的意味的整合性が保たれ、性能が向上することが確認された。
  • フレームレートの変化に対しても良好な一般化性能を示し、1fpsで学習したモデルが25fps動画でも正常にツールを追跡できた。これは、時間的一般化能力に優れていることを示している。
  • 定性的な結果から、局在化ヒートマップが弱いが妥当なツール先端のセグメンテーションを生成しており、インスタンスセグメンテーションタスクへの応用可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。