Skip to main content
QUICK REVIEW

[論文レビュー] Endo-VMFuseNet: Deep Visual-Magnetic Sensor Fusion Approach for Uncalibrated, Unsynchronized and Asymmetric Endoscopic Capsule Robot Localization Data

Mehmet Turan, Yasin Almalıoğlu|arXiv (Cornell University)|Sep 18, 2017
Advanced Neural Network Applications参考文献 28被引用数 12
ひとこと要約

本論文では、視覚的および磁気センサデータを用いて、同期化されておらず、キャリブレーションもされていない、非対称な内視鏡カプセルロボットの正確なサブミリメートル級の局所化を可能にする、深層学習ベースのセンサフュージョンフレームワーク、Endo-VMFuseNetを提案する。マルチレートLSTMネットワークを活用することで、同期不要、キャリブレーション不要、6自由度センサデータの完全性を要しない状態で、時間的ダイナミクスを学習し、異種センサストリームをエンドツーエンドで統合する。実際のブタの胃臓データセットにおいて、視覚オドメトリと磁気局所化の単独手法に比べて優れた精度を達成する。

ABSTRACT

In the last decade, researchers and medical device companies have made major advances towards transforming passive capsule endoscopes into active medical robots. One of the major challenges is to endow capsule robots with accurate perception of the environment inside the human body, which will provide necessary information and enable improved medical procedures. We extend the success of deep learning approaches from various research fields to the problem of uncalibrated, asynchronous, and asymmetric sensor fusion for endoscopic capsule robots. The results performed on real pig stomach datasets show that our method achieves sub-millimeter precision for both translational and rotational movements and contains various advantages over traditional sensor fusion techniques.

研究の動機と目的

  • 最小侵襲外科学におけるアンタッグル内視鏡カプセルロボットの正確な局所化という重要な課題に取り組む。
  • 従来のセンサフュージョン手法の制限、すなわち厳密なキャリブレーション、同期、および完全な6自由度センサデータの要件を克服する。
  • 視覚的および磁気センサからのキャリブレーション不要、非同期的、非対称なセンサデータを処理できる深層学習ベースの統合フレームワークを開発する。
  • 複雑で動的な環境、例えば人体の胃臓のような場所におけるカプセルロボットの高精度でリアルタイムなポーズ推定を達成する。
  • 実in-vivoデータを用いた医療ロボット分野におけるセンサフュージョンにおけるエンドツーエンドの深層学習の実現可能性と優位性を実証する。

提案手法

  • 本手法は、非同期なセンサストリーム間の時間的依存性をモデル化するため、長短記憶(LSTM)ユニットに基づくシーケンス・ツー・シーケンスの深層ニューラルネットワークアーキテクチャを採用する。
  • 30 Hzの視覚データと50 Hzの磁気データのそれぞれに特化したマルチレートLSTMを2つ使用することで、異なるサンプリングレートでセンサを処理できる。
  • コアとなる統合メカニズムは、2つのLSTMの隠れ状態を連結することで、不完全で非同期な入力から6自由度ポーズ(並進と回転)を共同で推定する。
  • バックプロパゲーションスルータイムを用いてエンドツーエンドで学習し、初期の学習率は0.001として、Adam最適化により最適化する。
  • 過学習を防ぎ、多様な運動パターンへの一般化を確保するため、ドロップアウトや早期停止といった正則化技術を適用する。
  • トレーニング中に自動的にアインハンドキャリブレーションを実行するため、手動によるセンサキャリブレーションの必要性がなくなる。

実験結果

リサーチクエスチョン

  • RQ1深層学習ベースのセンサフュージョンフレームワークは、同期化やキャリブレーションが不要な入力条件下でも、内視鏡カプセルロボットの高精度な局所化を達成できるか?
  • RQ2本手法は、5自由度の磁気センサと6自由度の視覚オドメトリを組み合わせた非対称なセンサデータをどのように処理するか?
  • RQ3エンドツーエンドの深層学習モデルは、カルマンフィルタのような伝統的なセンサフュージョントレーニング手法に比べて、ポーズ推定精度でどの程度優位性を示せるか?
  • RQ4明示的な同期がなくても、非同期な視覚的および磁気的センサストリームから、ネットワークが運動ダイナミクスを効果的に学習できるか?
  • RQ5本手法は、内視鏡環境に一般的に見られる複雑で高速かつ非線形な運動に対して、どの程度の耐障害性を示すか?

主な発見

  • Endo-VMFuseNetは、実際のブタの胃臓データセットにおいて、並進と回転の両方のポーズ推定でサブミリメートルの精度を達成し、平均並進RMSEは0.3 mm未満、回転RMSEは0.05°未満を記録した。
  • テストされた全トラジェクトリの長さと複雑さに関わらず、本手法は視覚オドメトリ(EVO)と磁気局所化の両方の単独手法を、並進および回転のRMSEにおいて上回った。
  • LSTMユニットが持つ時間的記憶を活用することで、完全な6自由度情報を備えない磁気センサの5自由度データと6自由度の視覚データを、効果的に統合した。
  • 30 Hzの視覚データと50 Hzの磁気データという非同期なデータストリームを、内部記憶を用いて過去のセンサ状態を保持・統合することで、効果的に処理した。
  • 本モデルは、高速回転や複雑なスキャンを含む多様な運動パターンに対しても、Polaris追跡システムからの真値トラジェクトリと密接に一致するよう、良好に一般化した。
  • エンドツーエンドのトレーニングプロセスにより、センサキャリブレーションが自動で学習され、手動によるキャリブレーションや手動で調整されたノイズモデルの必要性がなくなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。