Skip to main content
QUICK REVIEW

[論文レビュー] BEVPlace: Learning LiDAR-based Place Recognition using Bird's Eye View Images

Luo Lun, Shuhang Zheng|arXiv (Cornell University)|Feb 28, 2023
Robotics and Sensor-Based Localization被引用数 4
ひとこと要約

本論文では、視点の変化やシーンの変化に対してより頑健な性能を発揮するように、ライダーベースの場所認識手法であるBEVPlaceを提案する。ビューアー・エイド(BEV)画像を用いることで、回転不変性を有する特徴抽出とNetVLADによるグローバル特徴の集約を実現し、最先端のリCALL率(ベンチマークデータセットにおける平均AR@1で95.3%)を達成するとともに、強力な一般化性能と学習された特徴から幾何的距離への相関関係を用いた6自由度(6-DoF)位置推定の正確性を実現する。

ABSTRACT

Place recognition is a key module for long-term SLAM systems. Current LiDAR-based place recognition methods usually use representations of point clouds such as unordered points or range images. These methods achieve high recall rates of retrieval, but their performance may degrade in the case of view variation or scene changes. In this work, we explore the potential of a different representation in place recognition, i.e. bird's eye view (BEV) images. We observe that the structural contents of BEV images are less influenced by rotations and translations of point clouds. We validate that, without any delicate design, a simple VGGNet trained on BEV images achieves comparable performance with the state-of-the-art place recognition methods in scenes of slight viewpoint changes. For more robust place recognition, we design a rotation-invariant network called BEVPlace. We use group convolution to extract rotation-equivariant local features from the images and NetVLAD for global feature aggregation. In addition, we observe that the distance between BEV features is correlated with the geometry distance of point clouds. Based on the observation, we develop a method to estimate the position of the query cloud, extending the usage of place recognition. The experiments conducted on large-scale public datasets show that our method 1) achieves state-of-the-art performance in terms of recall rates, 2) is robust to view changes, 3) shows strong generalization ability, and 4) can estimate the positions of query point clouds. Source codes are publicly available at https://github.com/zjuluolun/BEVPlace.

研究の動機と目的

  • 視点の変化やシーンの変化の下で性能が低下する既存のライダーベースの場所認識手法の限界を解消すること。
  • ライダーポイントクラウドのより頑健な表現として、ビューアー・エイド(BEV)画像の可能性を検討すること。
  • 視点の変化やシーンの変化の下でも高い性能を維持できる回転不変ネットワークの開発。
  • リトリーブを超えた位置推定を可能にするために、学習された特徴から幾何的距離への相関関係を用いた正確な6-DoF位置推定の実現。

提案手法

  • ライダーポイントクラウドをBEV画像に投影し、範囲画像や無順序なポイントクラウドと比較して、センサの並進および回転に対してより安定した表現を実現する。
  • 回転等変性特徴を抽出できるグループ畳み込みに基づくネットワークを設計し、視点の変化に対する頑健性を向上させる。
  • ローカル特徴をグローバルで回転不変な記述子に集約するため、NetVLADを用いて場所のリトリーブに適した特徴を生成する。
  • L2距離とポイントクラウド間の幾何的距離との間の相関関係を学習したモデルを用い、位置推定を可能にする。
  • KITTIやオックスフォード・ロボットカーなどの公開データセット上で、エンドツーエンドに学習し、推論時に1クエリあたり約30msのリアルタイム性能を達成する。

実験結果

リサーチクエスチョン

  • RQ1視点の変化の下で、BEV画像が範囲画像や無順序なポイントクラウドよりも、ライダーベースの場所認識においてより頑健な表現として機能するか?
  • RQ2ディープラーニングモデルが、BEV画像に基づく特徴学習において回転不変性をどのように達成できるか?
  • RQ3BEV特徴間の距離が、ポイントクラウド間の幾何的距離と信頼性高く相関づけることができるか? これにより位置推定が可能になるか?
  • RQ4提案されたBEVPlace手法は、多様なデータセットにおいて、リCALL率、頑健性、一般化性能の面で最先端の手法を上回るか?

主な発見

  • BEVPlaceはベンチマークデータセットで平均Top-1リCALL率95.3%を達成し、変換器ベースのモデル(MinkLoc3Dv2など)やResNet34+NetVLADを含む最先端手法を上回る性能を示した。
  • 本手法は強力な一般化性能を示し、KITTIで学習した後、ALITAデータセットでも高い性能を維持したが、他の手法は顕著な性能低下を示した。
  • オックスフォードデータセットでは96.5%のAR@1、米国データセットでは96.9%のAR@1を達成し、視点の変化やシーンの変化に対して優れた頑健性を示した。
  • 特徴から幾何的距離への相関関係により、正確な位置推定が可能となり、回転摂動の下でも累積的変位誤差分布において優れた性能を示した。
  • 実行時間評価では、RTX 3090 GPU上で1クエリあたり約30msの処理時間であり、10Hzのリアルタイムローカライゼーションが可能で、SLAMシステムに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。