Skip to main content
QUICK REVIEW

[論文レビュー] Local Supports Global: Deep Camera Relocalization with Sequence Enhancement

Fei Xue, Xin Wang|arXiv (Cornell University)|Aug 6, 2019
Robotics and Sensor-Based Localization参考文献 34被引用数 10
ひとこと要約

本論文は、視覚オドメトリ(VO)による局所的運動の一貫性と、再帰的隠れ状態における共可視性を介したコンテンツ拡張特徴表現を統合することで、順序付き画像データを活用してポーズ推定の正確性を向上させる深層学習フレームワークを提案する。本手法は、7-ScenesおよびOxford RobotCarにおいて、テクスチャ不足、過露出、繰り返し出現といった困難な条件下でも、VOから得られる運動制約を用いたポーズグラフを通じてグローバルポーズを共同最適化することで、最先端の手法を上回る性能を発揮する。

ABSTRACT

We propose to leverage the local information in image sequences to support global camera relocalization. In contrast to previous methods that regress global poses from single images, we exploit the spatial-temporal consistency in sequential images to alleviate uncertainty due to visual ambiguities by incorporating a visual odometry (VO) component. Specifically, we introduce two effective steps called content-augmented pose estimation and motion-based refinement. The content-augmentation step focuses on alleviating the uncertainty of pose estimation by augmenting the observation based on the co-visibility in local maps built by the VO stream. Besides, the motion-based refinement is formulated as a pose graph, where the camera poses are further optimized by adopting relative poses provided by the VO component as additional motion constraints. Thus, the global consistency can be guaranteed. Experiments on the public indoor 7-Scenes and outdoor Oxford RobotCar benchmark datasets demonstrate that benefited from local information inherent in the sequence, our approach outperforms state-of-the-art methods, especially in some challenging cases, e.g., insufficient texture, highly repetitive textures, similar appearances, and over-exposure.

研究の動機と目的

  • 繰り返し模様や低テクスチャといった視覚的曖昧性によって引き起こされる、単一画像ベースのカメラ再局所化における不安定さと曖昧性を解消すること。
  • 画像シーケンスにおける空間的・時間的整合性を活用して、グローバルポーズ推定を向上させること。
  • 視覚オドメトリ(VO)を運動制約のソースとして統合し、ポーズグラフ最適化を強化すること。
  • 過露出、動的物体、類似した外観といった困難な状況におけるポーズ推定誤差を低減すること。
  • 順序付き画像から再局所化とVOを共同で学習できるエンドツーエンドの訓練・推論を可能とすること。

提案手法

  • 順次的な画像特徴から連続フレーム間の相対ポーズを推定するため、畳み込みLSTMベースのVOサブネットワークを用いる。
  • 再帰ユニットの隠れ状態を、共可視性に基づく特徴拡張に使用可能な歴史的視覚的コンテンツを保持する局所地図として活用する。
  • 局所地図からの共可視領域を用いてソフトアテンションを適用し、グローバルポーズ回帰のための特徴表現を向上させる。
  • グローバルポーズをノードとし、VOから得られる相対ポーズをエッジとするポーズグラフを構築し、訓練および推論時に整合性最適化を可能にする。
  • ポーズ推定器とVOストリームを共同でエンドツーエンドに訓練し、グラフベースの最適化による精練を実施する。
  • ポーズ回帰の前に特徴品質を向上させるコンテンツ拡張モジュールを用い、時間的整合性を強制するための運動ベースの精練をポーズグラフを通じて実現する。

実験結果

リサーチクエスチョン

  • RQ1画像シーケンスにおける局所的空間的・時間的整合性は、単一画像ベースのカメラ再局所化のロバスト性を向上させ得るか?
  • RQ2VOを運動制約として統合することで、曖昧な視覚的環境下でのグローバルポーズ推定はどの程度向上するか?
  • RQ3局所地図からの共可視性に基づく特徴拡張は、ポーズ予測の不確実性をどの程度低減するか?
  • RQ4過露出や繰り返し模様といった困難な現実世界のシナリオにおいて、本手法は最先端の手法と比較してどの程度優れているか?
  • RQ5統合されたエンドツーエンドフレームワークにより、再局所化と視覚オドメトリを共同最適化することで、より良い一般化性能が得られるか?

主な発見

  • Oxford RobotCarデータセットでは、本手法は平均移動誤差25.84m、回転誤差4.99°を達成し、PoseNet(77.85m、22.56°)およびMapNet(29.83m、8.68°)を上回った。
  • FULL1(9.5km)およびFULL2(11.2km)シーケンスにおいて、本手法はシナリオサイズの増大に対しても誤差の増加が抑制され、MapNetは誤差が急激に増加した。
  • 類似した外観の領域において、特に長時間シーケンスにおいて、PoseNetおよびMapNetと比較して外れ値が顕著に減少した。
  • ポーズグラフの精練ステップにより、過露出や動的物体などの困難な条件下でも安定性と正確性が向上した。
  • 特徴可視化の結果、本手法はPoseNetやMapNetと比較して、曖昧領域においてより識別的なアテンションマップを学習していることが示された。
  • 低テクスチャ、繰り返し模様、照明の変化といった視覚的曖昧性の処理において、本手法はそれまでの手法を上回るロバスト性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。