Skip to main content
QUICK REVIEW

[論文レビュー] Surgical Gesture Recognition with Optical Flow only

Duygu Sarıkaya, Pierre Jannin|arXiv (Cornell University)|Apr 1, 2019
Human Pose and Action Recognition参考文献 14被引用数 12
ひとこと要約

本稿では、キネマティックセンサーやRGBデータを一切使用しない、コンピュータビジョンのみに依存する手術ジェスチャー認識手法を提案する。ImageNetの重みを用いたクロスモダリティ事前学習で初期化されたResNetベースのモデルを用いることで、低ばらつき(Suturingタスクで91.07% ± 0.67)の競争力ある精度を達成し、最小侵襲手術におけるジェスチャー認識において、キネマティックデータの代わりに光学フローが頑健な代替手段であることを示している。

ABSTRACT

In this paper, we address the open research problem of surgical gesture recognition using motion cues from video data only. We adapt Optical flow ConvNets initially proposed by Simonyan et al.. While Simonyan uses both RGB frames and dense optical flow, we use only dense optical flow representations as input to emphasize the role of motion in surgical gesture recognition, and present it as a robust alternative to kinematic data. We also overcome one of the limitations of Optical flow ConvNets by initializing our model with cross modality pre-training. A large number of promising studies that address surgical gesture recognition highly rely on kinematic data which requires additional recording devices. To our knowledge, this is the first paper that addresses surgical gesture recognition using dense optical flow information only. We achieve competitive results on JIGSAWS dataset, moreover, our model achieves more robust results with less standard deviation, which suggests optical flow information can be used as an alternative to kinematic data for the recognition of surgical gestures.

研究の動機と目的

  • ビデオからの動きの手がかりのみを用いて、追加のキネマティックセンサーに依存しない手術ジェスチャー認識のオープンな問題に取り組む。
  • RGBデータやキネマティックデータと比較して、単独の密集光学フローが、手術ジェスチャー認識で競争力ある性能を達成できるかどうかを評価する。
  • 小規模な手術データセットにおける光学フロー畳み込みネットワークの収束不良という制限を克服するため、ImageNetの重みを用いたクロスモダリティ事前学習を導入する。
  • JIGSAWSベンチマーク上で、1つのスーパー試行を除いて残りのデータで学習・評価するleave-one-supertrial-out交差検証スキームを用いて、汎化性と頑健性を示す。
  • JIGSAWSのような小規模データセットで過学習を回避する、再現可能で計算効率の良い手法を提供する。

提案手法

  • モデルは、連続する動画フレーム間の2チャネル(u,v)ベクトル場として表される密集光学フローのみを入力とする。
  • BN-ResNet101アーキテクチャを採用し、10フレーム分の光学フロー入力を用いることで、20チャネルの入力テンソルを得る。
  • クロスモダリティ事前学習は、ImageNetで事前学習されたRGB畳み込みフィルタの平均値を算出し、それを2つの光学フローチャネルに複製することで、動きストリームの初期化に用いる。
  • データ拡張には、256×256にリサイズしたフレームから224×224のランダムクロップを適用し、30Hzまたは40Hzのフレームサンプリングを用いてデータセットのバランスを取る。
  • 学習にはSGDを用い、基本的な学習率を1e-3、ステップデイエイド(ステップサイズ=10、gamma=0.25)を適用し、80~150エポック程度で早期停止を行う。
  • 推論では20フレームを均等にサンプリングし、フレームレベルの予測の平均値をとることで動画レベルの予測を取得する。

実験結果

リサーチクエスチョン

  • RQ1密集光学フローのみで、RGBデータやキネマティックデータを一切使用せずに、手術ジェスチャー認識で競争力ある性能を達成できるか?
  • RQ2小規模な手術データセットにおける光学フローに基づくモデルの収束性と汎化性を向上させるために、クロスモダリティ事前学習がどのように寄与するか?
  • RQ3動きの手がかりのみを用いることで、JIGSAWSベンチマークにおいて他の手法と比較して、ばらつきが小さくより頑健な結果が得られるか?
  • RQ4leave-one-supertrial-outの検証スキーム下で、光学フローに基づくモデルは、さまざまな手術タスク(例:Suturing、Needle Passing、Knot Tying)にわたって効果的に汎化できるか?
  • RQ5提案手法は計算効率が良く、公開済みのツールを用いて容易に再現可能か?

主な発見

  • 本モデルは、JIGSAWSデータセットのSuturingタスクにおいて、RGBやキネマティックデータを一切使用せず、光学フローのみで91.07% ± 0.67の精度を達成し、多くの先行手法よりも一貫性に優れた性能を示した。
  • Fold間での標準偏差が低く(Suturingで0.67)、性能の頑健性と過学習の低減を示している。
  • Needle Passingでは74.25% ± 3.66、Knot Tyingでは87.78% ± 3.44の精度を達成し、タスク間での強い汎化性を示した。
  • モデルは80~150エポックの間で収束し、ミニバッチあたり約20秒で学習が完了したため、計算効率が非常に高いことが示された。
  • クロスモダリティ事前学習により、小規模なJIGSAWSデータセットにおける収束性が著しく向上し、過学習の抑制にも寄与した。
  • 結果から、光学フローは手術ジェスチャー認識におけるキネマティックデータの信頼できる代替手段である可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。