[論文レビュー] Pose Graph Optimization for Unsupervised Monocular Visual Odometry
本稿では、自己教師付き学習ベースのフロントエンドであるNeuralBundlerと、ドリフトを是正し精度を向上させるポーズグラフ最適化バックエンドを組み合わせたハイブリッド単眼ビジュアルオドメトリーシステムを提案する。新たなポーズサイクル整合性損失を導入し、DBoW2を用いたループクロージャ検出を活用することで、自己教師付き単眼VOにおいて最先端の性能を達成し、KITTIデータセットにおいてORBSLAMよりもトレランス精度で優れている。特にドリフト低減の面で顕著な改善が得られた。
Unsupervised Learning based monocular visual odometry (VO) has lately drawn significant attention for its potential in label-free leaning ability and robustness to camera parameters and environmental variations. However, partially due to the lack of drift correction technique, these methods are still by far less accurate than geometric approaches for large-scale odometry estimation. In this paper, we propose to leverage graph optimization and loop closure detection to overcome limitations of unsupervised learning based monocular visual odometry. To this end, we propose a hybrid VO system which combines an unsupervised monocular VO called NeuralBundler with a pose graph optimization back-end. NeuralBundler is a neural network architecture that uses temporal and spatial photometric loss as main supervision and generates a windowed pose graph consists of multi-view 6DoF constraints. We propose a novel pose cycle consistency loss to relieve the tensions in the windowed pose graph, leading to improved performance and robustness. In the back-end, a global pose graph is built from local and loop 6DoF constraints estimated by NeuralBundler and is optimized over SE(3). Empirical evaluation on the KITTI odometry dataset demonstrates that 1) NeuralBundler achieves state-of-the-art performance on unsupervised monocular VO estimation, and 2) our whole approach can achieve efficient loop closing and show favorable overall translational accuracy compared to established monocular SLAM systems.
研究の動機と目的
- 自己教師付き単眼ビジュアルオドメトリにおける軌跡のドリフトという長年の問題に取り組み、幾何的SLAM手法と比較して精度が劣ることを是正すること。
- 従来、幾何的SLAMで用いられてきた古典的グラフ最適化技術を、ディープラーニングベースのビジュアルオドメトリーパイプラインに統合すること。
- ポーズサイクル整合性損失の導入と効率的なループクロージャの実装により、自己教師付き学習ベースのVOのロバスト性と精度を向上させること。
- エンドツーエンドの学習とグローバル最適化を組み合わせることで、単独の学習ベースまたは幾何的メソッドよりも優れた性能を達成できることを示すこと。
提案手法
- 時間的・空間的フォトメトリック損失を教師として用い、6DoF制約を持つウィンドウドポーズグラフを生成する深層ニューラルネットワークであるNeuralBundlerを提案する。
- ウィンドウドポーズグラフ内の不整合性を低減するため、新たなポーズサイクル整合性損失を導入し、安定性と精度を向上させる。
- 単眼シーケンスにおけるループクロージャ検出のため、DBoW2を用いる。
- NeuralBundlerが推定した局所的およびループの6DoF制約から、グローバルポーズグラフを構築する。
- すべてのカメラポーズのドリフトを是正するために、SE(3)上でのグローバル最適化を実行する。
- スケーリングなしでSE(3)上での剛体変換アライメントを用いて評価し、メトリックスケール回復を保持する。
実験結果
リサーチクエスチョン
- RQ1ポーズグラフ最適化は、ドリフト是正により自己教師付き単眼ビジュアルオドメトリの精度を顕著に向上させることができるか?
- RQ2ポーズサイクル整合性損失は、自己教師付き学習ベースのVOにおけるウィンドウドポーズグラフの性能とロバスト性をどのように向上させるか?
- RQ3自己教師付き学習と古典的グラフ最適化を組み合わせたハイブリッドシステムは、純粋な学習ベースまたは幾何的SLAMシステムよりも優れた性能を達成できるか?
- RQ4DBoW2とSE(3)最適化を用いた提案されたループクロージング機構は、現実世界の単眼シーケンスにおいてどれほど効果的か?
主な発見
- NeuralBundlerはKITTIデータセットにおいて、自己教師付き単眼VO手法の中で最先端の性能を達成し、SfMLeaner や Huangying et al. を上回り、UnDeepVOに近い性能に到達した。
- アブレーションスタディにより、ポーズサイクル整合性損失が性能を顕著に向上させることを確認し、ウィンドウドポーズグラフの安定化に有効であることが示された。
- ループクロージャ後、ほとんどのシーケンスで全体のトレランスRMSEが低下し、ループが検出可能なシーケンス00、02、05、06、07、09で最も優れた性能を示した。
- 11シーケンス中8つにおいて、ORB-SLAMよりも低い全体のトレランスRMSEを達成し、スケールドリフトに対する優れたロバスト性を示した。
- 定性的な結果から、ループクロージャがドリフトを効果的に是正しており、特に00、05、06のようなループ付きシーケンスでは、最適化後の軌跡が真値に非常に近づいていることが確認された。
- 明示的な教師なしでメトリックスケールを回復できており、評価におけるスケーリングなしの設計により、単眼入力からの絶対スケール推定能力がシステムに備わっていることが裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。