Skip to main content
QUICK REVIEW

[論文レビュー] Automatic Gesture Recognition in Robot-assisted Surgery with Reinforcement Learning and Tree Search

Xiaojie Gao, Yueming Jin|arXiv (Cornell University)|Feb 20, 2020
Human Pose and Action Recognition参考文献 36被引用数 13
ひとこと要約

本論文は、ロボット支援手術における自動手術ゲージャー認識のための強化学習および木探索フレームワークを提案する。本手法は、高速な意思決定を提供する方策ネットワークと、前方探索を通じた精密な予測を提供する価値ネットワークを組み合わせる。この方法は、JIGSAWSの縫合タスクにおいて最先端の性能を達成し、両ネットワークからの補完的情報を利用することで、精度、編集スコア、F1スコアの面で先行手法を上回った。

ABSTRACT

Automatic surgical gesture recognition is fundamental for improving intelligence in robot-assisted surgery, such as conducting complicated tasks of surgery surveillance and skill evaluation. However, current methods treat each frame individually and produce the outcomes without effective consideration on future information. In this paper, we propose a framework based on reinforcement learning and tree search for joint surgical gesture segmentation and classification. An agent is trained to segment and classify the surgical video in a human-like manner whose direct decisions are re-considered by tree search appropriately. Our proposed tree search algorithm unites the outputs from two designed neural networks, i.e., policy and value network. With the integration of complementary information from distinct models, our framework is able to achieve the better performance than baseline methods using either of the neural networks. For an overall evaluation, our developed approach consistently outperforms the existing methods on the suturing task of JIGSAWS dataset in terms of accuracy, edit score and F1 score. Our study highlights the utilization of tree search to refine actions in reinforcement learning framework for surgical robotic applications.

研究の動機と目的

  • ロボット支援手術におけるフレーム単位のゲージャー認識手法が長期的な依存関係や将来の文脈を無視するという限界を是正すること。
  • 意思決定に将来の情報を統合することで、手術ゲージャー認識におけるセグメントレベルのパフォーマンスを向上させること。
  • 二重ネットワークの強化学習フレームワークにより、レアまたは曖昧なゲージャーに対するネットワークの混乱を低減し、耐性を高めること。
  • ポリシー・ネットワークの意思決定を価値ネットワークのガイダンスと木探索を用いて向上させる汎用的で探索ベースのアプローチを開発すること。
  • スキル評価や自律手術などの応用分野における手術動画解析において、文脈に配慮した人間のような意思決定を可能にすること。

提案手法

  • フレームワークは、動画シーケンス内の手術ゲージャーのセグメンテーションと分類を学習する深層強化学習エージェントを用いる。
  • ポリシー・ネットワークは、現在の観測に基づいて各フレームに対する初期の高速な行動予測を提供する。
  • 価値ネットワークは、行動シーケンスの長期的品質を評価し、意思決定のより包括的な評価を提供する。
  • 木探索は、将来の行動シーケンスを探索するために用いられ、ポリシー・ネットワークの信頼度を事前分布として探索空間をガイドする。
  • 探索プロセスでは両ネットワークの予測を統合する:ポリシー・ネットワークは探索方向を絞り込み、価値ネットワークは最適な結果を得るための行動シーケンスを評価する。
  • 最終的な行動は、木探索によって特定された最良の経路に基づいて選択され、ポリシー・ネットワーク単体による誤った意思決定を是正する。

実験結果

リサーチクエスチョン

  • RQ1前方探索を用いた強化学習フレームワークは、フレーム単位分類と比較して、手術ゲージャー認識におけるセグメントレベルのパフォーマンスを向上させることができるか?
  • RQ2ポリシー・ネットワークに価値ネットワークを統合することで、特に稀または曖昧なゲージャーにおいて意思決定の耐性がどのように向上するか?
  • RQ3木探索による前方推論は、ゲージャー認識におけるネットワークの混乱に起因する誤りをどの程度低減するか?
  • RQ4将来のフレームを考慮する探索ベースの手法は、手術動画セグメンテーションの正確性と編集スコアを向上させることができるか?
  • RQ5ポリシー・ネットワークと価値ネットワークの協調は、単独で使用する場合と比較して、性能をどのように向上させるか?

主な発見

  • 提案手法は、JIGSAWSの縫合タスクにおいて、81.67%の精度、88.53%の編集スコア、92.68%のF1スコア(IoU=10%)を達成し、すべてのベースライン手法を上回った。
  • ポリシー・ネットワーク単体では81.52%の精度と87.87%の編集スコアを、価値ネットワーク単体では80.91%の精度と88.34%の編集スコアを達成し、両者の相補的強みが示された。
  • 木探索により、ポリシー・ネットワーク単体と比較して、精度が0.15%、編集スコアが0.66%、F1スコアが0.46%(IoU=10%)向上した。
  • 本手法は10回の木探索イテレーションで25.4秒で動画を処理でき、3.3倍の遅延を伴うものの、オンライン応用においては実用的と評価された(ベースライン6.2秒)。
  • 図4に視覚的に示されたように、本フレームワークはポリシー・ネットワーク単体が検出に失敗したゲージャーを正常に回復できた。
  • 二重ネットワークと木探索の統合により、従来手法で一般的な過剰セグメンテーションと混乱問題が顕著に低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。