Skip to main content
QUICK REVIEW

[論文レビュー] ESLAM: Efficient Dense SLAM System Based on Hybrid Representation of Signed Distance Fields

Mohammad Mahdi Johari, Camilla Carta|arXiv (Cornell University)|Nov 21, 2022
Robotics and Sensor-Based Localization被引用数 4
ひとこと要約

ESLAMは、マルチスケール軸方向特徴平面と切り捨て signed distance field (TSDF) を用いたハイブリッドニューラル表現を採用し、事前学習を不要とする高速で高精度な密度型SLAMシステムを提案する。3次元再構築とカメラ局所化に効率的で、最先端の手法よりも50%以上高い精度を達成しながら、最大10倍高速に動作し、2次元特徴平面スケーリングにより立方体のメモリ成長を回避する。

ABSTRACT

We present ESLAM, an efficient implicit neural representation method for Simultaneous Localization and Mapping (SLAM). ESLAM reads RGB-D frames with unknown camera poses in a sequential manner and incrementally reconstructs the scene representation while estimating the current camera position in the scene. We incorporate the latest advances in Neural Radiance Fields (NeRF) into a SLAM system, resulting in an efficient and accurate dense visual SLAM method. Our scene representation consists of multi-scale axis-aligned perpendicular feature planes and shallow decoders that, for each point in the continuous space, decode the interpolated features into Truncated Signed Distance Field (TSDF) and RGB values. Our extensive experiments on three standard datasets, Replica, ScanNet, and TUM RGB-D show that ESLAM improves the accuracy of 3D reconstruction and camera localization of state-of-the-art dense visual SLAM methods by more than 50%, while it runs up to 10 times faster and does not require any pre-training.

研究の動機と目的

  • 事前学習を必要とせず、高精度な再構築と局所化を達成する密度型SLAMシステムの開発。
  • シーンサイズに対して立方体から2次関数的成長に抑えることで、スケーラビリティを向上。
  • ボクセルグリッドの代わりに効率的な特徴平面を導入することで、推論および学習の高速化。
  • 特徴平面表現における暗黙の滑らかさにより、表面品質と耐障害性の向上。
  • Replica、ScanNet、TUM RGB-D データセットにおいて、最先端のパフォーマンスを実証すること。

提案手法

  • マルチスケールの軸方向特徴平面を用いてシーン特徴を表現し、効率的かつスケーラブルな3次元表現を実現。
  • 各3次元点について、平面からの特徴補間と浅いMLPによるデコードを通じてTSDF値およびRGB値を生成。
  • 切り捨て signed distance field (TSDF) を暗黙の幾何表現として用い、収束速度の向上と高品質な再構築を実現。
  • RGB-Dフレームを段階的に処理し、リアルタイムでカメラポーズを推定するとともに、シーン表現を更新。
  • 忘却を軽減するため、キーフレームベースのメモリ機構を採用し、過去の領域を保持して再最適化。
  • すべての表現を生のRGB-D入力からエンドツーエンドで学習することで、事前学習を回避。

実験結果

リサーチクエスチョン

  • RQ1事前学習を不要とする密度型SLAMシステムは、従来のNeRFベースの手法と比較して、優れた精度と速度を達成できるか?
  • RQ2ボクセルグリッドの代わりに軸方向特徴平面を採用することで、メモリ成長を低減し、スケーラビリティを向上できるか?
  • RQ3TSDFに基づく暗黙の表現は、レンダリングベースまたは占有状態ベースの表現を上回る再構築品質と収束速度を実現できるか?
  • RQ4明示的な正則化なしに、特徴平面ベースのアプローチは表面の滑らかさと詳細の保持にどのように影響を与えるか?
  • RQ5多様な実世界の屋内シーンにおいて、システムは精度と耐障害性をどの程度維持できるか?

主な発見

  • ESLAMは、Replica、ScanNet、TUM RGB-D データセットにおいて、最先端の手法と比較して3次元再構築およびカメラ局所化の精度を50%以上向上。
  • 既存のアプローチと比較して最大10倍高速に動作し、RTX 3090 GPUを用いた場合、Replicaでは0.18秒、ScanNetでは0.55秒のフレーム処理時間。
  • シーンサイズに対してメモリ成長が2次関数的であるのに対し、NICE-SLAMの立方体成長と比較して、より大きなシーンへのスケーラビリティが向上。
  • TUM RGB-D データセットでは、fr3/officeでATE RMSEが2.42 cmを達成し、NICE-SLAM(3.02 cm)とiMAP*(5.80 cm)を上回る性能。
  • 定性的な結果から、ESLAMはiMAP* や NICE-SLAM と比較して、複雑な屋内シーンにおいてより細かな幾何的詳細と高品質なテクスチャを再構築している。
  • システムは顕著に低い局所化ドリフトを示し、複数回の実行にわたる一貫性が高く、性能指標の標準偏差も低い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。