Skip to main content
QUICK REVIEW

[论文解读] NICE-SLAM: Neural Implicit Scalable Encoding for SLAM

Zihan Zhu, Songyou Peng|arXiv (Cornell University)|Dec 22, 2021
Robotics and Sensor-Based Localization被引用 7
一句话总结

NICE-SLAM 提出了一种可扩展的、实时的密集 RGB-D SLAM 系统,采用分层特征网格来编码场景几何与颜色的神经隐式表示,支持局部优化并提升重建细节。通过在多分辨率下引入预训练的几何先验,该方法在可扩展性、抗噪声和动态物体能力以及未观测区域的孔洞填充准确性方面,均优于以往的神经隐式 SLAM 方法。

ABSTRACT

Neural implicit representations have recently shown encouraging results in various domains, including promising progress in simultaneous localization and mapping (SLAM). Nevertheless, existing methods produce over-smoothed scene reconstructions and have difficulty scaling up to large scenes. These limitations are mainly due to their simple fully-connected network architecture that does not incorporate local information in the observations. In this paper, we present NICE-SLAM, a dense SLAM system that incorporates multi-level local information by introducing a hierarchical scene representation. Optimizing this representation with pre-trained geometric priors enables detailed reconstruction on large indoor scenes. Compared to recent neural implicit SLAM systems, our approach is more scalable, efficient, and robust. Experiments on five challenging datasets demonstrate competitive results of NICE-SLAM in both mapping and tracking quality. Project page: https://pengsongyou.github.io/nice-slam

研究动机与目标

  • 为解决现有神经隐式 SLAM 系统存在的问题,即重建结果过度平滑且在大场景中可扩展性差。
  • 通过整合多层级的局部场景信息,实现在未观测区域的详细、可预测的重建。
  • 通过允许对场景表示进行局部更新而非全局更新,提升跟踪的鲁棒性与效率。
  • 将神经隐式表示的预测能力与基于网格的场景表示的可扩展性相结合,实现大规模 SLAM。

提出的方法

  • NICE-SLAM 使用分层特征网格表示场景几何与颜色,在粗、中、细三个层级分别设置多分辨率的特征网格。
  • 采用小型、局部的 MLP 从特征网格解码几何与外观信息,实现在相机视锥范围内的高效局部优化。
  • 通过最小化预测与观测的 RGB 图像和深度图像之间的重渲染损失,对特征网格进行优化。
  • 利用来自不同空间分辨率的预训练几何先验指导优化过程,增强细节保留与泛化能力。
  • 在关键帧滑动窗口内应用局部束优化(local bundle adjustment),联合优化相机位姿与场景特征,提升跟踪精度。
  • 使用光度损失优化颜色表示,尽管优化预算有限,仍显著提升了跟踪稳定性。

实验结果

研究问题

  • RQ1与全局 MLP 基础的表示相比,分层神经隐式表示是否能提升密集 RGB-D SLAM 的可扩展性与重建细节?
  • RQ2整合多层级几何先验如何影响对未观测区域场景几何的预测能力?
  • RQ3对特征网格进行局部优化在多大程度上提升了大场景中跟踪的鲁棒性与计算效率?
  • RQ4在存在动态物体和观测缺失等挑战性条件下,该方法的性能表现如何?

主要发现

  • 在 ScanNet 数据集上,NICE-SLAM 的平均 ATE RMSE 达到 9.63 mm,显著优于无局部束优化的基线方法(37.74 mm)和无光度损失的基线(32.02 mm)。
  • 与无局部束优化的基线相比,该方法将 ATE RMSE 降低了 63%,证明了联合优化位姿与场景特征的关键作用。
  • NICE-SLAM 能够成功填补孔洞并外推未观测区域的几何结构,其重建结果比 iMAP* 更平滑、更准确,后者在未见区域产生噪声预测。
  • 即使存在动态物体,系统仍能保持鲁棒的跟踪性能,表现为一致的重投影精度,并在优化过程中有效屏蔽动态像素。
  • 采用 iMAP 的关键帧选择策略导致收敛更慢且跟踪性能更差,凸显了 NICE-SLAM 自适应关键帧选择策略的优势。
  • 消融实验确认,分层架构与光度颜色表示对实现高跟踪精度与稳定优化均至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。