Skip to main content
QUICK REVIEW

[論文レビュー] CMRNet++: Map and camera agnostic monocular visual localization in lidar maps

Daniele Cattaneo, Domenico G. Sorrenti|arXiv (Cornell University)|Apr 1, 2020
Robotics and Sensor-Based Localization被引用数 2
ひとこと要約

CMRNet++ は、メトリック推論をディープラーニングから分離することで、再訓練なしに未学習の環境でも正確なローカライゼーションを実現するカメラおよび地図に依存しない単眼視覚的ローカライゼーション手法を導入する。学習された特徴抽出と幾何的キャリブレーションを組み合わせることで、KITTI、Argoverse、Lyft5 データセットにおいて最先端の性能を達成し、さまざまなカメラとシーンにおいて強力な一般化性能を示す。

ABSTRACT

Localization is a critically essential and crucial enabler of autonomous robots. While deep learning has made significant strides in many computer vision tasks, it is still yet to make a sizeable impact on improving capabilities of metric visual localization. One of the major hindrances has been the inability of existing Convolutional Neural Network (CNN)-based pose regression methods to generalize to previously unseen places. Our recently introduced CMRNet effectively addresses this limitation by enabling map independent monocular localization in LiDAR-maps. In this paper, we now take it a step further by introducing CMRNet++, which is a significantly more robust model that not only generalizes to new places effectively, but is also independent of the camera parameters. We enable this capability by combining deep learning with geometric techniques, and by moving the metric reasoning outside the learning process. In this way, the weights of the network are not tied to a specific camera. Extensive evaluations of CMRNet++ on three challenging autonomous driving datasets, i.e., KITTI, Argoverse, and Lyft5, show that CMRNet++ outperforms CMRNet as well as other baselines by a large margin. More importantly, for the first-time, we demonstrate the ability of a deep learning approach to accurately localize without any retraining or fine-tuning in a completely new environment and independent of the camera parameters.

研究の動機と目的

  • 未学習の環境において一般化性能に欠ける CNN を用いた単眼視覚的ローカライゼーション手法の課題を解決すること。
  • 既存のディープラーニングモデルが特定のカメラパラメータや LiDAR マップ構造に依存している問題を克服すること。
  • 再訓練やファインチューニングなしに、新しい環境でゼロショットローカライゼーションを可能にすること。
  • ニューラルネットワークの重みからメトリック推論を分離することでカメラに依存しない性能を実現すること。
  • 異なるカメラ設定やマップタイプを有する多様な自動運転データセットにおいて、強力な性能を示すこと。

提案手法

  • 画像特徴抽出のための深層ニューラルネットワークと、ポーズ推定のための幾何的推論からなる二段階パイプラインを導入する。
  • 特徴抽出後に幾何的キャリブレーションを適用することで、ネットワーク重みからメトリック推論を分離し、カメラに依存しない推論を実現する。
  • 多様なカメラ設定で訓練された、カメラ内部パrametersに不変な学習された特徴エンコーダーを採用する。
  • LiDDR マップを用いて幾何的制約を適用し、マップ固有の特徴に依存せずに画像特徴から絶対的なカメラポーズを推定する。
  • トレーニング中は LiDAR マップを用いてメトリックの監視を実施するが、推論時にはカメラに依存しない性能を維持する。
  • 画像特徴をマップ内の3次元座標にマップする微分可能幾何レイヤーを適用し、幾何的整合性を保ったエンドツーエンド学習を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースの単眼ローカライゼーションシステムは、再訓練なしにまったく未学習の環境でも正確なローカライゼーションを達成できるか?
  • RQ2学習された視覚的ローカライゼーションモデルは、さまざまなカメラパラメータにわたってどれほど一般化可能であり、高い正確性を維持できるか?
  • RQ3ニューラルネットワーク重みからメトリック推論を分離することで、一般化性能とカメラ独立性がどの程度向上するか?
  • RQ4現実の自動運転シナリオにおいて、ディープラーニングと幾何的推論を組み合わせたアプローチが、純粋に学習された手法や純粋に幾何学的アプローチを上回る効果を発揮するか?
  • RQ5異なるマップ構造やカメラ設定を有する多様なデータセットにおいて、モデルは高い性能を維持できるか?

主な発見

  • CMRNet++ は KITTI、Argoverse、Lyft5 データセットにおいて最先端の性能を達成し、CMRNet や他のベースラインを上回っている。
  • モデルは再訓練やファインチューニングなしに新しい環境でゼロショットローカライゼーションを実現しており、ディープラーニングベースの視覚的ローカライゼーションにおいて初の例である。
  • CMRNet++ はカメラに依存しない性能を達成し、モデルの適応なしにさまざまなカメラ内部パラメータでも高い正確性を維持している。
  • メトリック推論をネットワーク重みから分離することで、強力な一般化性能が実現され、高いローカライゼーション正確性が保持されている。
  • 広範な評価から、CMRNet++ はマップやカメラ特性が異なる多様な実世界の自動運転データセットにおいて、効果的に一般化していることが確認された。
  • 特に挑戦的で未学習の環境において、CMRNet よりも顕著な正確性の向上が達成されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。