Skip to main content
QUICK REVIEW

[論文レビュー] Deep Global-Relative Networks for End-to-End 6-DoF Visual Localization and Odometry

Yimin Lin, Zhaoxiang Liu|arXiv (Cornell University)|Dec 19, 2018
Robotics and Sensor-Based Localization参考文献 25被引用数 10
ひとこと要約

本論文は、モノクローラル6-DoFビジョローりングおよびオドメトリの精度を向上させるために、相対的およびグローバルなポーズ推定に再帰的畳み込みニューラルネットワーク(RCNN)を統合する、エンドツーエンドの深層学習フレームワーク、Deep Global-Relative Networksを提案する。クロス変換制約(CTC)と平均二乗誤差(MSE)を併用した共同最適化により、トラジェクトリードリフトを顕著に低減し、KITTIおよび7-Scenesデータセットにおいて最先端の精度を達成。DeepVOに比べ、並進精度で71%、回転精度で76%の向上を達成。

ABSTRACT

Although a wide variety of deep neural networks for robust Visual Odometry (VO) can be found in the literature, they are still unable to solve the drift problem in long-term robot navigation. Thus, this paper aims to propose novel deep end-to-end networks for long-term 6-DoF VO task. It mainly fuses relative and global networks based on Recurrent Convolutional Neural Networks (RCNNs) to improve the monocular localization accuracy. Indeed, the relative sub-networks are implemented to smooth the VO trajectory, while global subnetworks are designed to avoid drift problem. All the parameters are jointly optimized using Cross Transformation Constraints (CTC), which represents temporal geometric consistency of the consecutive frames, and Mean Square Error (MSE) between the predicted pose and ground truth. The experimental results on both indoor and outdoor datasets show that our method outperforms other state-of-the-art learning-based VO methods in terms of pose accuracy.

研究の動機と目的

  • 学習ベースの手法における誤差蓄積に起因する長期間にわたるモノクローラルビジョオドメトリにおける恒常的なドリフト問題に対処すること。
  • エンドツーエンドフレームワーク内で相対運動とグローバルな場所認識を同時にモデル化することで、6-DoFビジョローカライゼーションの精度を向上させること。
  • VLocNetのような従来の手法で見られるグローバルネットワークと相対ネットワークの分離最適化の限界を克服すること。
  • 時間的幾何的一致性と3次元構造的制約学習を通じて、困難な環境に対する耐性を高めること。
  • 正確な長距離ポーズ推定を可能にするために、エンドツーエンド学習中に絶対スケールを維持すること。

提案手法

  • アーキテクチャは、畳み込みニューラルネットワークベースの特徴抽出サブネットワーク(CNN1)、相対ポーズRCNN(RCNN1)、グローバルポーズRCNN(RCNN2)、および完全結合統合層(FCFL)を統合し、両ストリームを統合する。
  • 相対ポーズ推定は、連続するRGBフレームを用いてエゴモーションをモデル化し、運動空間を制約するRCNN1によって実行される。
  • グローバルポーズ回帰は、長期間の文脈を用いて環境の3次元構造的制約をモデル化するRCNN2によって達成される。
  • バッチ内の連続フレーム間の時間的幾何的一致性を強制するために、新規のクロス変換制約(CTC)損失が導入される。
  • エンドツーエンド学習のため、予測値と真値ポーズ間のCTCと平均二乗誤差(MSE)を併用した共同最適化が実施される。
  • 時間的シーケンス長Kを用いたエンドツーエンド学習が実施され、多様なシーンにおける安定性と一般化性能を最適化する。

実験結果

リサーチクエスチョン

  • RQ1相対ポーズネットワークとグローバルポーズネットワークの共同最適化は、モノクローラルビジョオドメトリにおけるトラジェクトリードリフトを低減できるか?
  • RQ2CTC損失による時間的幾何的一致性の組み込みは、長時間シーケンスにおけるポーズ推定精度を向上させるか?
  • RQ3相対運動とグローバルな場所認識の統合は、困難な環境下でのローカライゼーションの耐性をどのように向上させるか?
  • RQ4エンドツーエンド学習における精度と一般化性能のバランスをとる最適な時間的シーケンス長Kは何か?
  • RQ5提案手法は絶対スケールを維持でき、最先端の学習ベースのVOアプローチを上回る性能を発揮できるか?

主な発見

  • 提案手法はKITTIデータセットにおいて、DeepVOに比べ並進精度で71%、回転精度で76%の向上を達成した。
  • 本モデルはKITTIおよび7-Scenes両方のデータセットで最先端のパフォーマンスを達成し、長距離ポーズ推定における優れた精度と安定性を示した。
  • アブレーションスタディの結果、グローバルネットワークと相対ネットワークの統合は、単独で使用する場合よりも顕著に優れた結果をもたらすことが確認された。
  • 最適なパフォーマンスはK = 5で達成され、Kをさらに増加させると利得が減少し、過学習のリスクが高まる傾向を示した。
  • CTC損失は時間的一致性を効果的に向上させ、ベースライン手法に比べ滑らかでより正確なトラジェクトリを実現した。
  • モデルはエンドツーエンド学習の全過程で絶対スケールを正確に維持でき、正確な長期間ローカライゼーションを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。