Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Task Temporal Convolutional Networks for Joint Recognition of Surgical Phases and Steps in Gastric Bypass Procedures

Sanat Ramesh, Diego Dall’Alba|arXiv (Cornell University)|Feb 24, 2021
Surgical Simulation and Training参考文献 31被引用数 84
ひとこと要約

本稿では、内視鏡動画を用いて腹腔鏡胃バイパス手術における手術フェーズと手順の共同認識を目的として、マルチタスクマルチステージ時系列畳み込みネットワーク(MTMS-TCN)を提案する。共有時系列表現を活用したマルチタスク学習により、モデルは最先端の性能を達成し、フェーズ認識では1–2%、ステップ認識では3–6%の精度、適合率、再現率で単一タスクおよびLSTMベースのモデルを上回った。これは、階層的アノテーションを備えた新しいBypass40データセット上で得られた結果である。

ABSTRACT

Purpose: Automatic segmentation and classification of surgical activity is crucial for providing advanced support in computer-assisted interventions and autonomous functionalities in robot-assisted surgeries. Prior works have focused on recognizing either coarse activities, such as phases, or fine-grained activities, such as gestures. This work aims at jointly recognizing two complementary levels of granularity directly from videos, namely phases and steps. Method: We introduce two correlated surgical activities, phases and steps, for the laparoscopic gastric bypass procedure. We propose a Multi-task Multi-Stage Temporal Convolutional Network (MTMS-TCN) along with a multi-task Convolutional Neural Network (CNN) training setup to jointly predict the phases and steps and benefit from their complementarity to better evaluate the execution of the procedure. We evaluate the proposed method on a large video dataset consisting of 40 surgical procedures (Bypass40). Results: We present experimental results from several baseline models for both phase and step recognition on the Bypass40 dataset. The proposed MTMS-TCN method outperforms in both phase and step recognition by 1-2% in accuracy, precision and recall, compared to single-task methods. Furthermore, for step recognition, MTMS-TCN achieves a superior performance of 3-6% compared to LSTM based models in accuracy, precision, and recall. Conclusion: In this work, we present a multi-task multi-stage temporal convolutional network for surgical activity recognition, which shows improved results compared to single-task models on the Bypass40 gastric bypass dataset with multi-level annotations. The proposed method shows that the joint modeling of phases and steps is beneficial to improve the overall recognition of each type of activity.

研究の動機と目的

  • 腹腔鏡胃バイパス手術における、多段階の手術行動アノテーションの不足に対処すること。
  • 手術フェーズと手順の共同認識フレームワークを構築し、全体のワークフロー理解を向上させること。
  • 時系列畳み込みネットワークを用いたマルチタスク学習の、手術動画理解への有効性を評価すること。
  • 40本のアノテート済み動画と11のフェーズ/44のステップを備えたBypass40データセットを用いて、新たなベンチマークを確立すること。

提案手法

  • エンドスコープ動画から手術フェーズと手順を共同で予測するマルチタスクマルチステージ時系列畳み込みネットワーク(MTMS-TCN)を提案する。
  • 各ステージが前段の予測をドーナツ畳み込みを用いて精緻化するマルチステージアーキテクチャを採用する。
  • 視覚的特徴抽出のための共有CNNバックボーン(ResNet)を用い、その後にフェーズとステップ分類のためのタスク固有ヘッドを接続する。
  • 因果的畳み込みを適用することで、リアルタイム手術モニタリングに適したオンラインで逐次的な予測を可能にする。
  • 共有特徴とタスク固有損失を用いたマルチタスク学習設定を実装し、フェーズとステップの相補的関係を活用する。
  • 4分割交差検証を実施し、Bypass40データセット上で精度、適合率、再現率、F1スコアを用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1フェーズとステップの共同モデリングは、単一タスク学習と比較して認識性能を向上させることができるか?
  • RQ2LSTMベースのモデルと比較して、マルチタスク時系列畳み込みネットワークは、細分化された手術ステップと粗いフェーズを認識する上で優れているか?
  • RQ3マルチタスク学習は、短時間持続のステップや手術的に重要なステップの認識をどの程度向上させるか?
  • RQ4フェーズとステップの階層的関係は、モデルの全体的な一般化性能および時系列推論能力にどのように寄与するか?

主な発見

  • MTMS-TCNはフェーズ認識で91.16%の精度を達成し、次に優れたモデル(TeCNO)を2%上回った。
  • ステップ認識では76.09%の精度を達成し、TeCNOを1%上回り、LSTMベースのモデルを適合率・再現率で3–6%上回った。
  • S25、S30、S39など短時間持続のステップの認識が、他のモデルよりも向上した。
  • MTMS-TCNの共同認識精度(75.14%)は、ステップ認識精度に非常に近い値であり、階層的関係の有効なモデリングを示している。
  • マルチタスク設定により両タスクの性能が向上し、MT-ResNet(バックボーン)は、わずかにフェーズ認識精度が低下したものの、ステップ認識性能がResNetより優れていた。
  • 可視化結果から、MTMS-TCNはTeCNOやResNetLSTMと比較して、フェーズ遷移や小さなフェーズ(例:P5、P7、P9)をよりよく捉えていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。