Skip to main content
QUICK REVIEW

[論文レビュー] Joint Surgical Gesture and Task Classification with Multi-Task and Multimodal Learning

Duygu Sarıkaya, Khurshid A. Guru|arXiv (Cornell University)|May 2, 2018
Human Pose and Action Recognition参考文献 20被引用数 15
ひとこと要約

本論文では、視覚(RGB)および運動(オプティカルフロー)特徴を用いて、ロボット支援外科研修動画において低レベルの外科研術と外科研術を同時に分類する、マルチタスク・マルチモーダルなディープラーニングアーキテクチャを提案する。両モダリティからの畳み込みニューラルネットワーク(CNN)特徴を統合し、時間的ダイナミクスをモデル化するための長短期記憶(LSTM)ネットワークを用いることで、平均平均適合率(MAP)が50.83%に達し、単一モダリティ・単一タスクベースライン比で22%の向上を達成した。

ABSTRACT

We propose a novel multi-modal and multi-task architecture for simultaneous low level gesture and surgical task classification in Robot Assisted Surgery (RAS) videos.Our end-to-end architecture is based on the principles of a long short-term memory network (LSTM) that jointly learns temporal dynamics on rich representations of visual and motion features, while simultaneously classifying activities of low-level gestures and surgical tasks. Our experimental results show that our approach is superior compared to an ar- chitecture that classifies the gestures and surgical tasks separately on visual cues and motion cues respectively. We train our model on a fixed random set of 1200 gesture video segments and use the rest 422 for testing. This results in around 42,000 gesture frames sampled for training and 14,500 for testing. For a 6 split experimentation, while the conventional approach reaches an Average Precision (AP) of only 29% (29.13%), our architecture reaches an AP of 51% (50.83%) for 3 tasks and 14 possible gesture labels, resulting in an improvement of 22% (21.7%). Our architecture learns temporal dynamics on rich representations of visual and motion features that compliment each other for classification of low-level gestures and surgical tasks. Its multi-task learning nature makes use of learned joint re- lationships and combinations of shared and task-specific representations. While benchmark studies focus on recognizing gestures that take place under specific tasks, we focus on recognizing common gestures that reoccur across different tasks and settings and significantly perform better compared to conventional architectures.

研究の動機と目的

  • 特定の外科研術に限定されず、複数の外科研術に共通して繰り返し現れる低レベルの外科研術を認識する課題に対処すること。
  • 視覚的および運動的モダリティを用いて、外科研術とタスクの時間的ダイナミクスを共同でモデル化することで、分類性能を向上させること。
  • 従来のベンチマークが単一タスク内の外科研術でのみ学習・評価を行うという制限を克服し、包括的なフレームワークで全14の外科研術に対する一般化を可能にすること。
  • 外科研術分類とタスク分類の間で共有表現を学習することで、特徴学習を強化し、過学習を低減すること。

提案手法

  • モデルは2つの並列ストリームを用いる:1つは視覚的特徴を抽出するRGBフレーム処理用、もう1つはRGBエンコード済みオプティカルフロー処理用の運動情報抽出用。
  • 両モダリティから高レベル特徴を抽出するために、外科研術分類とタスク分類のタスク別に事前に訓練された畳み込みニューラルネットワーク(CNN)を用いる。
  • 両モダリティのCNN処理済み特徴を連結してマルチモーダル表現を形成し、それを長短期記憶(LSTM)ネットワークに供給する。
  • LSTMは連続する動画フレームの時間的ダイナミクスをモデル化し、外科研術とタスクの遷移における逐次的依存関係を捉える。
  • マルチタスク学習を採用し、共有表現とタスク固有の表現を用いて、外科研術とタスク分類の両方を同時に最適化する。
  • データ拡張にはランダムクロップと水平ミラーが用いられ、入力フレームはトレーニングおよび推論の両方で240×320にリサイズされる。

実験結果

リサーチクエスチョン

  • RQ1マルチモーダル・マルチタスク学習フレームワークは、単一モダリティ・単一タスクアプローチと比較して、低レベルの外科研術と外科研術の共同分類を改善できるか?
  • RQ2視覚的および運動的特徴を統合することで、異なる外科研術に共通する外科研術の認識がどのように向上するか?
  • RQ3外科研術分類とタスク分類の間で共有表現学習を実施することで、一般化性能が向上し、過学習が軽減される程度はどの程度か?
  • RQ4マルチモーダル特徴にLSTMを用いた時間的モデリングが、時間的ダイナミクスを無視するモデルと比較して、性能向上に寄与するか?

主な発見

  • 提案されたマルチタスク・マルチモーダルモデルは、422個の外科研術動画セグメントから成るテストセットで、平均平均適合率(MAP)50.83%を達成し、単一タスク・単一モダリティベースラインの29.13%を著しく上回った。
  • 6回のランダム分割による平均ではMAPが22%向上し、個々の改善度は18%から26%の範囲に収まり、一貫性があり強固な向上が確認された。
  • モデルは3つの外科研術(縫合、結び目結び、ニードルパス)にまたがる14の一般的な低レベル外科研術を認識できることから、タスク固有の外科研術に限定されない強力な一般化性能を示した。
  • 視覚的および運動的モダリティからの補完的情報を効果的に活用しており、特にシーンやオブジェクトの文脈に依存しない一般的な外科研術の認識において、運動情報が極めて重要であることが判明した。
  • マルチタスク学習によりタスク間で共有表現を学習することで過学習が低減され、同時にタスク固有の適応を維持する能力も有している。
  • テスト推論時間は30フレームの動画あたり約7〜8秒(オプティカルフロー計算を除く)であり、リアルタイムデプロイメントのボトルネックとなっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。