Skip to main content
QUICK REVIEW

[論文レビュー] Temporal Segmentation of Surgical Sub-tasks through Deep Learning with Multiple Data Sources

Yidan Qin, Sahba Aghajani Pedram|arXiv (Cornell University)|Feb 7, 2020
Surgical Simulation and Training参考文献 33被引用数 9
ひとこと要約

本論文では、ロボット支援外科学におけるリアルタイムで細分化された手術状態推定を実現するため、運動学的データ、視覚的データ、システムイベントデータを統合する深層学習モデルFusion-KVEを提案する。複数のデータソースを統合することで、複雑なデータセットにおいて89.4%のフレーム単位の正確性を達成し、先行手法を上回り、短時間持続や頻繁に遷移する状態に対しても頑健であることが示された。

ABSTRACT

Many tasks in robot-assisted surgeries (RAS) can be represented by finite-state machines (FSMs), where each state represents either an action (such as picking up a needle) or an observation (such as bleeding). A crucial step towards the automation of such surgical tasks is the temporal perception of the current surgical scene, which requires a real-time estimation of the states in the FSMs. The objective of this work is to estimate the current state of the surgical task based on the actions performed or events occurred as the task progresses. We propose Fusion-KVE, a unified surgical state estimation model that incorporates multiple data sources including the Kinematics, Vision, and system Events. Additionally, we examine the strengths and weaknesses of different state estimation models in segmenting states with different representative features or levels of granularity. We evaluate our model on the JHU-ISI Gesture and Skill Assessment Working Set (JIGSAWS), as well as a more complex dataset involving robotic intra-operative ultrasound (RIOUS) imaging, created using the da Vinci Xi surgical system. Our model achieves a superior frame-wise state estimation accuracy up to 89.4%, which improves the state-of-the-art surgical state estimation models in both JIGSAWS suturing dataset and our RIOUS dataset.

研究の動機と目的

  • マルチモーダルデータを用いて、ロボット支援外科学(RAS)におけるリアルタイムで細分化された手術サブタスクの時系列セグメンテーションを可能にすること。
  • 単一モダリティのモデルでは捉えにくい、短時間持続や頻繁に遷移する手術状態を正確に推定する課題に対処すること。
  • 運動学的データ、視覚的データ、システムイベントを統合する統一フレームワークを構築し、推定の頑健性を向上させること。
  • 標準的な(JIGSAWS)および複雑で実世界に近い(RIOUS)手術データセットを用いてモデルの汎化性能を評価すること。
  • 特にシステムイベントの相補的利点が、急激な遷移における推定のばらつきを低減する役割を果たすかを調査すること。

提案手法

  • 提案されたFusion-KVEモデルは、da Vinci® Xi手術システムからのロボット運動学的データ、内視鏡映像、システムイベントという3つのデータソースを統合する。
  • 視覚的特徴は空間的畳み込みニューラルネットワーク(CNN)を用いて抽出され、時間的モデリングのために時間的畳み込みネットワーク(TCN)を通過する。
  • 運動学的データに基づく状態推定には、TCNと双方向LSTMアーキテクチャを併用し、状態持続時間に応じた異なる時間的依存性をモデル化する。
  • システムイベントは、環境ノイズに対する耐性を高め、急激な状態遷移における推定のばらつきを低減するために、別個のモダリティとして統合される。
  • 学習された注釈付き重み係数を用いた重み付き統合機構により、各状態ごとに信頼性の高い入力を優先する。
  • モデルはクロスエントロピー損失を用いてエンドツーエンドで学習され、現在および過去のデータのみを用いる因果推論設定で評価され、リアルタイム適用性が保証される。

実験結果

リサーチクエスチョン

  • RQ1運動学的データ、視覚的データ、システムイベントという複数のデータソースを統合することで、単一モダリティのモデルと比較して、細分化された手術状態推定の正確性がどの程度向上するか?
  • RQ2システムイベントの統合が、急激な遷移や短時間持続の状態において推定誤差をどの程度低減するか?
  • RQ3時間的モデリングアーキテクチャ(例:TCN 対 LSTM)は、手術タスクにおける異なる持続時間の状態で、それぞれどのように性能を発揮するか?
  • RQ4統一された統合モデルは、JIGSAWSのような標準データセットを超えて、複雑で実世界に近い手術シナリオへの汎化能力をどの程度有するか?
  • RQ5統合モデルにおける重み係数行列は、モダリティの信頼性やタスク固有の特徴重要度に関するインサイトを明らかにできるか?

主な発見

  • Fusion-KVEは、RIOUSデータセットにおいてフレーム単位の状態推定正確性89.4%を達成し、先行する最先端手法を顕著に上回った。
  • Fusion-KVと比較して、Fusion-KVEにおけるシステムイベントの統合により、急激な遷移や短時間持続の状態で推定誤差が低減された。
  • モデルは環境ノイズやカメラの動きに対しても頑健であり、単一モダリティのモデルと比較して、予測のばらつきが少なかった。
  • 重み係数行列の分析から、TCNは短時間持続の状態で優れた性能を示し、LSTMは長時間持続の状態で優れた性能を示すことが判明し、モデルの適応的統合戦略の妥当性が裏付けられた。
  • RIOUSデータセットは、ドライラボ、シミレーション死体、生体手術を含み、非行動状態も含むため、JIGSAWSに比べてより複雑であるが、Fusion-KVEは依然として高い正確性を維持した。
  • 因果推論設定(現在および過去のデータのみを用いる)においても、Fusion-KVEは優れた性能を維持しており、臨床現場へのリアルタイム導入可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。