Skip to main content
QUICK REVIEW

[論文レビュー] A Robotic 3D Perception System for Operating Room Environment Awareness

Zhaoshuo Li, Amirreza Shaban|arXiv (Cornell University)|Mar 20, 2020
Surgical Simulation and Training参考文献 17被引用数 8
ひとこと要約

本稿では、da Vinci Xi手術ロボットの患者側キャットに取り付けられた4台の時間飛行(ToF)カメラを用いて、リアルタイムの手術室(OR)シーン理解を可能にする動的マルチビュー3D認識システムを提示する。新規の学習ベースのマルチビュー投影および統合(MVPM)アルゴリズムにより、2D強度画像と3D点群データを統合することで、単一ビュー手法に比べて、特に低周波数クラスのセマンティックセグメンテーションが向上し、麻酔台に対してはmIOU 0.711±0.031、メイオスタンドに対しては0.687±0.060を達成した。

ABSTRACT

Purpose: We describe a 3D multi-view perception system for the da Vinci surgical system to enable Operating room (OR) scene understanding and context awareness. Methods: Our proposed system is comprised of four Time-of-Flight (ToF) cameras rigidly attached to strategic locations on the daVinci Xi patient side cart (PSC). The cameras are registered to the robot's kinematic chain by performing a one-time calibration routine and therefore, information from all cameras can be fused and represented in one common coordinate frame. Based on this architecture, a multi-view 3D scene semantic segmentation algorithm is created to enable recognition of common and salient objects/equipment and surgical activities in a da Vinci OR. Our proposed 3D semantic segmentation method has been trained and validated on a novel densely annotated dataset that has been captured from clinical scenarios. Results: The results show that our proposed architecture has acceptable registration error ($3.3\%\pm1.4\%$ of object-camera distance) and can robustly improve scene segmentation performance (mean Intersection Over Union - mIOU) for less frequently appearing classes ($\ge 0.013$) compared to a single-view method. Conclusion: We present the first dynamic multi-view perception system with a novel segmentation architecture, which can be used as a building block technology for applications such as surgical workflow analysis, automation of surgical sub-tasks and advanced guidance systems.

研究の動機と目的

  • da Vinci手術ロボット上でリアルタイムの手術室(OR)シーン理解を実現する動的でマルチビューの3D認識システムの開発。
  • 単一視点からの視認性が限られる複雑で遮蔽の多いOR環境における、頑健なセマンティックセグメンテーションの課題の解決。
  • da Vinci Xiプラットフォームに統合可能な、一度のキャリブレーションで実現する多カメラシステムのスケーラブルな認識技術の導入。
  • 臨床的OR環境におけるマルチビュー3Dセマンティックセグメンテーションの訓練・検証に適した、新規の高密度アノテーションデータセットの構築。
  • 低頻度オブジェクト(例:メイオスタンド、麻酔台)のセグメンテーション精度を向上させるために、マルチビュー統合を活用し、単一ビューの限界を克服すること。

提案手法

  • 4台の時間飛行(ToF)カメラを、シーンカバレッジを最大化するように、da Vinci Xiの患者側キャット(PSC)に剛体的に取り付ける。
  • 独自の fixtures と剛体固定具を用いた一回限りのキャリブレーション手順により、すべてのカメラをロボットの運動学的チェーンに登録し、統一された座標変換を可能にする。
  • 新規の学習ベースのマルチビュー投影および統合(MVPM)技術を用いて、すべてのカメラからの2D強度画像と3D点群データを、共通のロボットベース座標フレームに統合する。
  • MVPMアルゴリズムは、複数視点間でピクセル単位のセグメンテーションラベルと信頼度スコアを学習的に統合し、予測の一貫性と領域の滑らかさを向上させる。
  • セマンティックセグメンテーションモデルの訓練および検証を目的とした、臨床的da Vinci ORシナリオから収集された新規の高密度アノテーションマルチビューデータセットを構築。
  • フレームワークは、単一ビューのセグメンテーションにDeepLab V3+をバックボーンネットワークとして採用し、MVPMを予測後処理として適用して、マルチビューの一貫性を活用して出力を精緻化する。

実験結果

リサーチクエスチョン

  • RQ1da Vinci手術ロボットに搭載されたマルチビュー3D認識システムは、現実のOR環境において単一ビュー手法に比べて、セマンティックセグメンテーションの精度を向上させることができるか?
  • RQ2提案されたMVPM統合技術は、麻酔台やメイオスタンドのような低頻度または部分的に遮蔽されたオブジェクトのセグメンテーション性能をどのように向上させるか?
  • RQ3一度のキャリブレーション手法により、再キャリブレーションを要せず、異なるda Vinci Xiシステムへの即座の接続・運用が可能になるか、その範囲はどの程度か?
  • RQ42D強度画像に加えて3D点群データを統合することで、2Dのみのアプローチに比べて、より頑健で正確なシーン理解が達成できるか?
  • RQ5利用可能なカメラビュー数が全体のセグメンテーション性能に与える影響は何か?さらにビューを追加することで、明確な性能向上が得られるか?

主な発見

  • 本システムは、オブジェクト-カメラ距離の3.3% ± 1.4%のターゲット登録誤差(TRE)を達成しており、多カメラキャリブレーションの信頼性を示している。
  • MVPM手法は、低頻度クラスのmIOUを顕著に向上させた:人間(+0.013)、メイオスタンド(+0.020)、ステリルテーブル(+0.015)、麻酔台(+0.037)の各々が単一ビューベースラインから向上。
  • MVPM手法により、麻酔台の最終mIOUは0.711 ± 0.031、メイオスタンドは0.687 ± 0.060を達成し、DeepLab V3+およびDense 3D CRFベースラインを上回った。
  • アブレーションスタディの結果、カメラビュー数の増加に伴いセグメンテーション性能が顕著に向上し、1カメラ対4カメラの比較でp値 = 4.11E-9が得られ、マルチビュー統合の有効性が裏付けられた。
  • MVPM手法はピクセルレベルの一貫性と領域の滑らかさを向上させ、単一ビューでうまくセグメンテーションできない部分的に遮蔽されたオブジェクト(例:麻酔台)を効果的に回復した。
  • Dense 3D CRFベースラインは統計的に有意な改善を示さなかったことから、信頼度を考慮した学習ベースのMVPM統合メカニズムの優位性が浮き彫りになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。