Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Graph Based Place Recognition for 3D Point Clouds

Xin Kong, Xuemeng Yang|arXiv (Cornell University)|Aug 26, 2020
Robotics and Sensor-Based Localization参考文献 39被引用数 6
ひとこと要約

本稿では、シーンを意味的オブジェクトとそのトポロジカルな関係でモデル化することで、遮蔽や視点変化に強く、3次元点群の場所認識に適した意味的グラフベースのアプローチを提案する。学習可能なグラフ類似度ネットワークを活用することで、KITTIデータセットにおいて最先端の精度を達成し、特に逆ループクロージャ検出において優れた性能を発揮する。

ABSTRACT

Due to the difficulty in generating the effective descriptors which are robust to occlusion and viewpoint changes, place recognition for 3D point cloud remains an open issue. Unlike most of the existing methods that focus on extracting local, global, and statistical features of raw point clouds, our method aims at the semantic level that can be superior in terms of robustness to environmental changes. Inspired by the perspective of humans, who recognize scenes through identifying semantic objects and capturing their relations, this paper presents a novel semantic graph based approach for place recognition. First, we propose a novel semantic graph representation for the point cloud scenes by reserving the semantic and topological information of the raw point cloud. Thus, place recognition is modeled as a graph matching problem. Then we design a fast and effective graph similarity network to compute the similarity. Exhaustive evaluations on the KITTI dataset show that our approach is robust to the occlusion as well as viewpoint changes and outperforms the state-of-the-art methods with a large margin. Our code is available at: \url{https://github.com/kxhit/SG_PR}.

研究の動機と目的

  • 遮蔽や視点変化などの環境変動にさらされた3次元点群におけるロバストな場所認識の課題に対処すること。
  • ノイズや変換に敏感な低レベルの幾何的または統計的特徴に依存する従来手法の限界を克服すること。
  • オブジェクトの意味的意味とその空間的関係を捉えることで、人間のシーン認識に類似した意味的レベルでのシーンモデル化を行うこと。
  • 手作業で設計された距離メトリクスに依存せずに、シーン間の類似度スコアを計算するための効率的で学習可能なグラフ類似度ネットワークを開発すること。
  • ロボットや自動運転システムへの実装に適したリアルタイム性能を達成すること。

提案手法

  • まず意味セグメンテーションを実行してオブジェクトインスタンスを特定することで、生の点群から意味的グラフ表現を構築する。
  • 各意味的インスタンスをグラフ内のノードとして表現し、その意味ラベルと幾何的特徴(例:重心、サイズ)を符号化する。
  • 空間的近接性と相対的方位に基づいてノード間のトポロジカルな関係を確立し、シーン構造をモデル化する。
  • ノードレベルの埋め込み、グラフレベルの埋め込み、およびグラフ同士の相互作用を実行するグラフ類似度ネットワークを設計し、類似度スコアを計算する。
  • 全結合層とアテンションメカニズムを用いた学習可能なアーキテクチャにより、関連するノードや関係を優先し、欠損またはノイズのあるデータに対しても耐性を高める。
  • 対照的損失を用いて、正例(同じ場所)と負例(異なる場所)のペアの類似度スコアを最適化するように、ネットワークをエンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1意味的オブジェクトとそのトポロジカルな関係を用いた3次元シーンのモデル化が、遮蔽や視点変化に対する場所認識のロバスト性を向上させることができるか?
  • RQ2従来の特徴距離ベースの手法と比較して、学習可能なグラフ類似度ネットワークは、精度と一般化性能においてどのように差をつけるか?
  • RQ3困難な条件下で、局所的またはグローバルな幾何的記述子に基づく手法と比較して、意味的レベルの表現がどの程度優れているか?
  • RQ4提案手法は、視点がほぼ反対方向となる逆ループクロージャ検出においても高い性能を発揮できるか?
  • RQ5ロボット用途におけるリアルタイム応用を想定した場合、このグラフベースのアプローチは推論速度とメモリ使用量の点でどの程度効率的か?

主な発見

  • 提案手法はKITTIオドメトリー・データセットにおいて最先端の性能を達成しており、特に逆ループクロージャ検出において既存手法を上回っている。
  • 30°の遮蔽条件下でも、mAPがわずか2.1%低下するにとどまり、M2DP(14.3%低下)やPointNetVLAD(10.5%低下)を大きく上回る。
  • 視点変化に対しては、グラフ表現における意味的およびトポロジカル関係の回転不変性のおかげで、高い精度を維持している。
  • KITTI00では3mの閾値で平均平均精度(mAP)が94.7%を達成し、10mの閾値でも90%以上のmAPを維持している。
  • 1フレームあたり9msの推論時間、RTX 2080 Tiで2820MBのGPUメモリ使用量であり、ロボットシステムへのリアルタイムデプロイが可能である。
  • 定性的な可視化により、類似度スコアが近接するシーンで最も高くなり、基準フレーム周辺での正確な局所化が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。