[論文レビュー] Relational Graph Learning on Visual and Kinematics Embeddings for Accurate Gesture Recognition in Robotic Surgery
本稿では、視覚的および運動的埋め込みを階層的関係性グラフ学習を用いて動的に統合するマルチモーダル関係性グラフネットワーク、MRG-Netを提案する。時間的畳み込みネットワークとLSTMを用いた特徴抽出および有向グラフによるクロスモーダル関係のモデリングにより、MRG-NetはJIGSAWSのステーニングタスクでSOTAの正確性(91.0%)およびエディットスコア(98.7%)を達成し、自社のdVRKデータセットでも優れた性能を示した。
Automatic surgical gesture recognition is fundamentally important to enable intelligent cognitive assistance in robotic surgery. With recent advancement in robot-assisted minimally invasive surgery, rich information including surgical videos and robotic kinematics can be recorded, which provide complementary knowledge for understanding surgical gestures. However, existing methods either solely adopt uni-modal data or directly concatenate multi-modal representations, which can not sufficiently exploit the informative correlations inherent in visual and kinematics data to boost gesture recognition accuracies. In this regard, we propose a novel online approach of multi-modal relational graph network (i.e., MRG-Net) to dynamically integrate visual and kinematics information through interactive message propagation in the latent feature space. In specific, we first extract embeddings from video and kinematics sequences with temporal convolutional networks and LSTM units. Next, we identify multi-relations in these multi-modal embeddings and leverage them through a hierarchical relational graph learning module. The effectiveness of our method is demonstrated with state-of-the-art results on the public JIGSAWS dataset, outperforming current uni-modal and multi-modal methods on both suturing and knot typing tasks. Furthermore, we validated our method on in-house visual-kinematics datasets collected with da Vinci Research Kit (dVRK) platforms in two centers, with consistent promising performance achieved.
研究の動機と目的
- 既存手法が単一モーダルデータまたは単純なマルチモーダル特徴の連結を用いることによる制限を解消し、ロボット支援外科学における視覚的および運動的データ間の深い相関関係を活用できないこと。
- 視覚的シーンとロボット運動シーケンス間の共同知識および関係的依存性を捉える、動的かつオンラインなマルチモーダル統合フレームワークの開発。
- 階層的関係性グラフ構造による潜在特徴空間における相互依存性のモデリングを通じて、手術ジェスチャー認識の正確性および時間的滑らかさの向上。
- 公開(JIGSAWS)および非公開(自社dVRK)データセットの両方で手法を検証し、異なる外科学的プラットフォームおよびデータ収集条件にわたる一般化能力を示すこと。
提案手法
- 視覚的および運動的シーケンスは、空間的・時間的特徴を捉えるために時間的畳み込みネットワーク(TCN)および長短期記憶(LSTM)ネットワークを用いて埋め込まれる。
- 視覚的および運動的埋め込み間の多様なモーダル間関係をモデル化するため、マルチリレーション表現が特定される。
- 階層的関係性グラフ学習モジュールは、有向グラフ内のノード間でのメッセージパッシングを実行し、潜在空間でマルチモーダル知識を動的に集約する。
- グラフ構造により、アテンションベースの集約が可能となり、ジェスチャー認識の過程で顕著なクロスモーダル相互作用に注目できる。
- 分類の正確性および予測の時間的整合性を最適化するため、交差エントロピー損失およびエディット距離損失を用いてエンドツーエンドで訓練される。
実験結果
リサーチクエスチョン
- RQ1ロボット支援外科学からの視覚的および運動的データを、単純な連結や初期統合を越えて効果的に統合する方法は何か?
- RQ2視覚的および運動的埋め込み間のマルチリレーション依存性をモデル化することで、認識正確性および時間的滑らかさにどのような影響を与えるか?
- RQ3関係性グラフネットワークアーキテクチャは、異なる外科学的プラットフォームおよびデータ収集条件にわたって、マルチモーダル特徴を動的に統合できるか?
- RQ4提案されたMRG-Netは、JIGSAWSおよび自社dVRKデータセットといった標準ベンチマークにおいて、SOTAの単一モーダルおよびマルチモーダル手法と比較してどのように差をつけるか?
主な発見
- JIGSAWSのステーニングタスクにおいて、MRG-Netは91.0%の正確性および98.7%のエディットスコアを達成し、最良のベースライン(ResNet-18)よりも正確性で10.3ポイント、エディットスコアで63.6ポイント優れた。
- JIGSAWSのノットタイイングタスクにおいて、MRG-Netは87.3%の正確性および96.4%のエディットスコアを達成し、単一モーダルおよびマルチモーダルベースラインを一貫して上回った。
- 自社のCUHK dVRKデータセットでは91.0%の正確性および98.7%のエディットスコア、JHU dVRKデータセットでは87.3%の正確性および96.4%のエディットスコアを達成し、異なる外科学センター間での頑健性を確認した。
- アブレーションスタディの結果、関係性グラフモジュールが性能向上に顕著に寄与しており、特徴連結を超えたクロスモーダル依存性の捉え方の重要性を裏付けた。
- 高いエディットスコアから、時間的滑らかさが向上しており、長時間にわたって安定的かつ一貫したジェスチャー予測が可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。