Skip to main content
QUICK REVIEW

[論文レビュー] Next-generation Surgical Navigation: Marker-less Multi-view 6DoF Pose Estimation of Surgical Instruments

Jonas Hein, Nicola Cavalcanti|arXiv (Cornell University)|May 5, 2023
Surgical Simulation and Training被引用数 4
ひとこと要約

本論文では、RGB-Dカメラを用いたマーカーレスでマルチビューの6DoFポーズ推定システムを提案し、最適な条件下で1.01 mm(位置)、0.89°(方向)のサブミリメートルの精度を達成した。5台のカメラを用いて、処理外脊椎手術から得た新しいマルチビューRGB-Dデータセットを構築し、単一ビュー手法と比較して、マルチビュー融合が精度と遮蔽耐性を著しく向上させることを示した。これにより、マーカーレス追跡が従来のシステムと比較して実用的であることが示された。

ABSTRACT

State-of-the-art research of traditional computer vision is increasingly leveraged in the surgical domain. A particular focus in computer-assisted surgery is to replace marker-based tracking systems for instrument localization with pure image-based 6DoF pose estimation using deep-learning methods. However, state-of-the-art single-view pose estimation methods do not yet meet the accuracy required for surgical navigation. In this context, we investigate the benefits of multi-view setups for highly accurate and occlusion-robust 6DoF pose estimation of surgical instruments and derive recommendations for an ideal camera system that addresses the challenges in the operating room. The contributions of this work are threefold. First, we present a multi-camera capture setup consisting of static and head-mounted cameras, which allows us to study the performance of pose estimation methods under various camera configurations. Second, we publish a multi-view RGB-D video dataset of ex-vivo spine surgeries, captured in a surgical wet lab and a real operating theatre and including rich annotations for surgeon, instrument, and patient anatomy. Third, we evaluate three state-of-the-art single-view and multi-view methods for the task of 6DoF pose estimation of surgical instruments and analyze the influence of camera configurations, training data, and occlusions on the pose accuracy and generalization ability. The best method utilizes five cameras in a multi-view pose optimization and achieves an average position and orientation error of 1.01 mm and 0.89° for a surgical drill as well as 2.79 mm and 3.33° for a screwdriver under optimal conditions. Our results demonstrate that marker-less tracking of surgical instruments is becoming a feasible alternative to existing marker-based systems.

研究の動機と目的

  • マルチビューコンピュータビジョンを用いたマーカーレスで高精度な6DoFポーズ推定システムの開発。
  • 視線遮断、キャリブレーションの複雑さ、ワークフローの中断といったマーカー付きシステムの限界を克服すること。
  • カメラ構成、トレーニングデータ、遮蔽の影響が手術環境におけるポーズ精度と一般化性能に与える影響の評価。
  • 手術ナビゲーションのためのトレーニングとベンチマークに利用可能な公開可能なマルチビューRGB-Dデータセットの提供。
  • マルチビュー融合が現実の手術条件下でもミリメートルレベルの精度と耐性を実現できることの実証。

提案手法

  • 静的およびヘッドマウントカメラ(例:Azure Kinect、HoloLens 2)を組み合わせたマルチカメラセットアップを採用し、複数の視点から同期されたRGB-D動画を取得。
  • 2D-3D対応点を複数の視点で統合するマルチビューのポーズ最適化フレームワークを開発し、6DoFポーズ推定の精度を向上。
  • 実際の処理外手術データと合成データを併用してトレーニングを行い、遮蔽や照明変化に対する耐性を向上させるためにデータ拡張を適用。
  • 最先端の6DoFポーズ推定ネットワーク(例:BOPベンチマークからのもの)を採用し、マルチビュー環境における手術器具追跡に適応。
  • 実際のテスト時データを用いたドメイン内ファインチューニングを実施し、ポーズ誤差をさらに低減し、一般化性能を向上。
  • 器具、外科医、患者の解剖学的構造の真値ポーズをアノテーションし、正確な評価を可能にした。

実験結果

リサーチクエスチョン

  • RQ1実際の手術室環境下で、マルチビューRGB-D融合は手術器具の6DoFポーズ推定においてサブミリメートルの精度を達成できるか?
  • RQ2カメラ構成(数、配置、種別)の違いがポーズ精度と遮蔽耐性に与える影響は何か?
  • RQ3実際の手術データでトレーニングする際、合成データがモデルの一般化性能にどの程度寄与するか?
  • RQ4マーカーレス追跡システムは、臨床的関連性の高い状況において、既存のマーカー付きナビゲーションシステムと同等またはそれ以上の精度を達成できるか?
  • RQ5リアルタイム手術ナビゲーションにおいて、高精度と耐性を実現するための最適なカメラ構成とデータ戦略は何か?

主な発見

  • 5台のカメラを用いた最良のマルチビュー手法は、最適な条件下で手術ドリルについて平均位置誤差1.01 mm、方向誤差0.89°を達成した。
  • スクリュードライバーについては、位置誤差2.79 mm、方向誤差3.33°を達成し、異なる器具種別に対しても耐性があることが示された。
  • 2台のカメラでのみでもミリメートルレベルの精度を達成したため、マーカーレス追跡がマーカー付きシステムの実用的代替手段として可能であることが証明された。
  • 実際のテスト時データを用いたドメイン内ファインチューニングにより、ポーズ誤差が顕著に低減した。これはドメイン特化適応の価値を示している。
  • 合成データがモデルの耐性を向上させることを実証した。特に手術室で一般的な複雑な遮蔽や照明変化の処理に有効であった。
  • 提案されたマルチビュー構成は、器具が視界外になった場合にマーカー付きシステムが失敗する状況でも機能を維持でき、優れた遮蔽耐性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。