Skip to main content
QUICK REVIEW

[論文レビュー] SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM

Nikhil Keetha, Jay Karhade|arXiv (Cornell University)|Dec 4, 2023
Robotics and Sensor-Based Localization被引用数 6
ひとこと要約

SplaTAM は、明示的なボリュメトリックマップ表現として 3D ガウス過程スプラッタリングを用いる、新しい密度の高い RGB-D SLAM システムを提案する。これにより、1cm未満の局所化精度を達成するリアルタイムのトラッキングとマッピングが可能になる。微分可能レンダリングとシルエット誘導最適化を活用することで、カメラポーズ推定、マップ再構築、新規ビュー合成において最先端の性能を達成し、主な指標で先行手法を最大2倍上回り、400 FPS でレンダリングする。

ABSTRACT

Dense simultaneous localization and mapping (SLAM) is crucial for robotics and augmented reality applications. However, current methods are often hampered by the non-volumetric or implicit way they represent a scene. This work introduces SplaTAM, an approach that, for the first time, leverages explicit volumetric representations, i.e., 3D Gaussians, to enable high-fidelity reconstruction from a single unposed RGB-D camera, surpassing the capabilities of existing methods. SplaTAM employs a simple online tracking and mapping system tailored to the underlying Gaussian representation. It utilizes a silhouette mask to elegantly capture the presence of scene density. This combination enables several benefits over prior representations, including fast rendering and dense optimization, quickly determining if areas have been previously mapped, and structured map expansion by adding more Gaussians. Extensive experiments show that SplaTAM achieves up to 2x superior performance in camera pose estimation, map construction, and novel-view synthesis over existing methods, paving the way for more immersive high-fidelity SLAM applications.

研究の動機と目的

  • implicitなニューラル表現が SLAM に及ぼす制限、例えば計算効率の低さ、編集性の欠如、空間的制御の不足を是正すること。
  • 単一の未校正のモノクローラル RGB-D カメラを用いて、高精度な再構築と正確なカメラトラッキングを実現する密度の高いリアルタイム SLAM を可能にすること。
  • 明示的な 3D ガウス過程を活用し、高速レンダリング、直接勾配伝搬、および段階的密度化による構造的マップ拡張を実現すること。
  • 従来の放射場ベースおよび手作業設計された SLAM 手法と比較して、カメラポーズ推定、シーン再構築、新規ビュー合成の面で優れた性能を達成すること。

提案手法

  • 本システムは、3D ガウス過程スプラッタリングをシーン表現の基盤とし、各ガウス過程は 3D 座標、色、スケールで定義される。
  • トラッキングおよびマッピングの両方のための光度誤差を計算するために微分可能レンダリングを採用し、カメラポーズとガウス過程パラメータのエンドツーエンド最適化を可能にする。
  • シルエット誘導最適化戦略により、マップのシルエットをレンダリングすることで未観測領域を特定し、最適化をマッピング済み領域に制限することで、効率性と精度を向上させる。
  • 視点依存の外観を排除し、等方的ガウス過程を用いることで、レンダリングと最適化の高速化を実現し、高解像度入力でも最大 400 FPS を達成する。
  • マップ拡張は、新しく観測された領域にのみ新しいガウス過程を追加することでオンラインで実行され、構造的かつ効率的な密度化を保証する。
  • パイプラインはオンライントラッキングとマッピングを統合し、フル解像度画像上の密な光度誤差を用いた共同最適化を実施する。
Figure 1 : SplaTAM enables precise camera tracking and high-fidelity reconstruction for dense simultaneous localization and mapping (SLAM) in challenging real-world scenarios. SplaTAM achieves this by online optimization of an explicit volumetric representation, $3$ D Gaussian Splatting [ 14 ] , usi
Figure 1 : SplaTAM enables precise camera tracking and high-fidelity reconstruction for dense simultaneous localization and mapping (SLAM) in challenging real-world scenarios. SplaTAM achieves this by online optimization of an explicit volumetric representation, $3$ D Gaussian Splatting [ 14 ] , usi

実験結果

リサーチクエスチョン

  • RQ1明示的な 3D ガウス過程表現は、単一の未校正のモノクローラル RGB-D カメラを用いて、リアルタイムで密度の高い SLAM を実現できるか?
  • RQ2implicitなニューラル表現と比較して、3D ガウス過程スプラッタリングは、最適化速度、マップ制御、編集性の面で SLAM においてどのように優れているか?
  • RQ3シルエット誘導最適化は、テクスチャが乏しいまたは困難な環境におけるトラッキングのロバスト性を向上させられるか?
  • RQ4明示的なボリュメトリック表現を用いた SLAM において、密な光度誤差をどのように効率的に適用できるか?
  • RQ53D ガウス過程の統合は、レンダリング速度、マップ忠実度、トラッキング精度のトレードオフにどのように影響を与えるか?

主な発見

  • SplaTAM は、Replica/Room 0 データセットで 0.27 cm の ATE(絶対軌道誤差)を達成し、最先端手法を 2 倍上回る。
  • 新規ビュー合成においては 32.81 dB の PSNR を達成し、ベースラインを著しく上回り、シルエットベースの密度化における 0.99 サイドの誤差が 5 倍減少した。
  • 1.2 百万ピクセルのフルフレームをレンダリングしても、RTX 3080 Ti ではトラッキングとマッピングの実行時間が 1.00 秒/フレームに保たれ、200~1000 ピクセルのみをサンプリングする手法と同等の性能を示す。
  • アブレーションスタディにより、色と深度の両方の誤差を組み合わせた場合が最良の性能(ATE: 0.27 cm)を示し、いずれかを省略すると著しく性能が低下することが確認された。
  • 軽量バージョンである SplaTAM-S は 5 倍高速に動作し、性能低下もわずか(ATE: 0.39 cm)に抑えられ、スケーラビリティと効率性を実証した。
  • 本システムは 876×584 解像度で 400 FPS でリアルタイムの写真同等のレンダリングを実現し、密度の高い 3D マップの高忠実度可視化を可能にした。
Figure 2 : Overview of SplaTAM . Top-Left: The input to our approach at each timestep is the current RGB-D frame and the 3D Gaussian Map Representation that we have built representing all of the scene seen so far. Top-Right: Step (1) estimates the camera pose for the new image, using silhouette-guid
Figure 2 : Overview of SplaTAM . Top-Left: The input to our approach at each timestep is the current RGB-D frame and the 3D Gaussian Map Representation that we have built representing all of the scene seen so far. Top-Right: Step (1) estimates the camera pose for the new image, using silhouette-guid

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。