Skip to main content
QUICK REVIEW

[論文レビュー] S3LAM: Structured Scene SLAM

Mathieu Gonzalez, Éric Marchand|arXiv (Cornell University)|Sep 15, 2021
Robotics and Sensor-Based Localization参考文献 39被引用数 5
ひとこと要約

S3LAM は、RGB イメージからのセマンティッククラスタリングを統合することで ORB-SLAM2 を強化するモノクローラル SLAM システムを提案する。この手法では、パノプティックセグメンテーションを用いて 3D ポイントのセマンティッククラスタを形成し、バウンドルアジャストメント段階で幾何的制約(平面および二次曲面制約など)を適用することで、カメラポーズ推定とシーン理解を向上させる。本手法は TUM および KITTI データセットで最先端の精度を達成し、ORB-SLAM2 と比較して絶対軌道誤差(ATE)を最大で 15% 減少させた。

ABSTRACT

We propose a new SLAM system that uses the semantic segmentation of objects and structures in the scene. Semantic information is relevant as it contains high level information which may make SLAM more accurate and robust. Our contribution is twofold: i) A new SLAM system based on ORB-SLAM2 that creates a semantic map made of clusters of points corresponding to objects instances and structures in the scene. ii) A modification of the classical Bundle Adjustment formulation to constrain each cluster using geometrical priors, which improves both camera localization and reconstruction and enables a better understanding of the scene. We evaluate our approach on sequences from several public datasets and show that it improves camera pose estimation with respect to state of the art.

研究の動機と目的

  • オブジェクトおよび構造インスタンスを活用することで、より強固で正確なカメラローカライゼーションを実現するセマンティック SLAM システムの開発。
  • シーンをセマンティックラベルを付した 3D ポイントクラスタとして表現することで、SLAM の強度と解釈可能性を向上。
  • バウンドルアジャストメントプロセスに幾何的制約(例:平面、二次曲面)を統合し、カメラポーズと地図構造の最適化を実現。
  • 屋内および大規模な屋外シーンを含む多様な公開データセット上で手法を評価し、汎用性と性能向上を実証。

提案手法

  • 本システムは、RGB イメージの 2D パノプティックセグメンテーションに detectron2 を使用し、画像領域にセマンティックおよびインスタンスラベルを割り当てる。
  • ORB-SLAM2 のキーフレーム特徴量から 3D ポイントを三角測量し、セマンティッククラスおよびインスタンスごとにクラスタリングすることでセマンティッククラスタを形成する。
  • RANSAC を用いてクラスタから平面構造を検出し、平面にフィッティングする。非平面的物体には二次曲面制約を適用する。
  • バウンドルアジャストメントの定式化を変更し、幾何的制約を統合:平面の法線および二次曲面パラメータをカメラポーズと 3D ポイントとともに最適化する。
  • セマンティックおよび幾何的制約を最適化に統合することで、再投影誤差とシーンの一貫性を向上。
  • 本手法はオブジェクトレベルおよび構造レベルの制約をサポートし、物理的に妥当で意味的に明確な地図を生成可能である。

実験結果

リサーチクエスチョン

  • RQ1RGB イメージのセマンティックセグメンテーションを ORB-SLAM2 に効果的に統合することで、カメラポーズ推定の精度が向上するか?
  • RQ2平面または二次曲面制約などの幾何的制約は、複雑な屋内および屋外シーンにおける SLAM の精度と強度にどのように影響するか?
  • RQ3セマンティッククラスタと構造的制約を統合した統一最適化フレームワークは、標準的な ORB-SLAM2 よりも軌道精度において優れているか?
  • RQ4本手法は、大規模な屋外シーンを含む多様な環境にどの程度一般化可能か?

主な発見

  • TUM シーケンス全体で S3LAM は ATE を平均 4.7% 減少させ、ORB-SLAM2 と比較して平均 ATE 12.2 mm(ORB-SLAM2 13.9 mm)を達成した。
  • KITTI raw データセットでは、S3LAM は平均 ATE 34.2 cm を達成し、ORB-SLAM2 の 40.4 cm と比較して 15.3% の改善を示した。
  • fr1_desk シーケンスでは、S3LAM は ATE 13.2 mm を達成し、ORB-SLAM2(13.9 mm)および平面または二次曲面を用いた先行手法を上回った。
  • 本手法はほぼ完全な平面整合性を達成した:統合された本のクラスタでは、法線間の角度が 0.0° であり、高い構造的一致性を示した。
  • fr3_nost_text_near シーケンスでは、S3LAM が ATE を ORB-SLAM2 の 20.3 mm から 15.3 mm に低下させ、複雑でごちゃついたシーンでも有効性を示した。
  • 平面制約の使用により地図品質が顕著に向上した。側面比較図では、S3LAM の地図で床面がより平面的かつ一貫性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。