Skip to main content
QUICK REVIEW

[论文解读] Neural Implicit Dense Semantic SLAM

Yasaman Haghighi, Suryansh Kumar|arXiv (Cornell University)|Apr 27, 2023
Robotics and Sensor-Based Localization被引用 6
一句话总结

本文提出了一种新颖的RGBD视觉SLAM系统,将ORB-SLAM 3的追踪与回环检测功能与基于Instant-NGP和NeuS的神经隐式映射网络相结合,实现了从关键帧中在线、内存高效的密集三维几何、RGB、深度和语义分割学习。该方法在25 m²场景下实现了亚厘米级深度精度(<1 cm)和低于25 MB的内存占用,即使在存在噪声或稀疏深度输入的情况下也表现良好。

ABSTRACT

Visual Simultaneous Localization and Mapping (vSLAM) is a widely used technique in robotics and computer vision that enables a robot to create a map of an unfamiliar environment using a camera sensor while simultaneously tracking its position over time. In this paper, we propose a novel RGBD vSLAM algorithm that can learn a memory-efficient, dense 3D geometry, and semantic segmentation of an indoor scene in an online manner. Our pipeline combines classical 3D vision-based tracking and loop closing with neural fields-based mapping. The mapping network learns the SDF of the scene as well as RGB, depth, and semantic maps of any novel view using only a set of keyframes. Additionally, we extend our pipeline to large scenes by using multiple local mapping networks. Extensive experiments on well-known benchmark datasets confirm that our approach provides robust tracking, mapping, and semantic labeling even with noisy, sparse, or no input depth. Overall, our proposed algorithm can greatly enhance scene perception and assist with a range of robot control problems.

研究动机与目标

  • 开发一种鲁棒的在线视觉SLAM系统,能够生成室内场景的密集、内存高效的三维表示,包含几何、RGB、深度和语义信息。
  • 通过将经典追踪与回环检测技术与神经隐式映射相结合,克服传统vSLAM(稀疏地图)和神经SLAM(无回环检测、存在漂移)的局限性。
  • 即使在标注不一致或抖动的情况下,也能利用关键帧的2D语义分割图实现三维空间中的精确语义分割。
  • 通过为每个子空间使用局部映射网络并结合动态关键帧管理机制,实现系统在大规模场景中的可扩展性。
  • 在具有挑战性的条件下(如存在噪声、稀疏或缺失深度输入)展示系统的鲁棒性能。

提出的方法

  • 系统使用ORB-SLAM 3进行实时相机位姿估计与回环检测,关键帧根据几何和摄影测量标准选取。
  • 基于Instant-NGP并扩展自NeuS的神经隐式映射网络,学习连续三维表示中的符号距离函数(SDF)、RGB、深度和语义图。
  • 通过在动态维护的关键帧集合上应用摄影测量、几何(SDF)和语义损失,对映射网络进行优化。
  • 采用多尺度、局部映射策略,将全局空间划分为多个子空间,每个子空间拥有独立的神经网络,从而实现对大规模场景的可扩展性。
  • 采用主动/非活跃网格范式,在追踪失败时通过在隐式神经表示与显式网格重建之间切换来处理。
  • 通过将关键帧的2D语义分割图投影到三维空间,对神经场的语义头施加语义监督。

实验结果

研究问题

  • RQ1能否仅使用动态关键帧集合,在在线、增量式训练中有效训练神经隐式映射网络?
  • RQ2能否在不依赖3D标注数据的情况下,从关键帧的2D语义图中准确学习密集的三维语义分割?
  • RQ3引入语义监督是否能提升神经隐式几何与深度估计的准确性,特别是在平坦或纹理缺失区域?
  • RQ4将经典vSLAM(追踪与回环检测)与神经隐式映射相结合,是否能减少漂移并实现在大规模室内环境中的鲁棒运行?
  • RQ5在输入条件退化(如存在噪声、稀疏或缺失深度)时,系统性能如何?

主要发现

  • 在Replica数据集上,该方法在RGBD输入下实现了0.518 cm的平均L1深度误差,在office0序列中达到0.3336 cm,表现出极高的几何精度。
  • 在仅使用RGB输入时,该方法在office0序列中实现了3.3 cm的L1深度误差,显著低于先前仅使用RGB的方法(例如NICE-SLAM为11.12 cm),表明语义监督具有显著优势。
  • 在office0序列中,加入语义监督后,深度误差从0.46 cm(仅RGBD)降低至0.31 cm,表明语义信息可有效提升几何重建质量。
  • 系统在25 m²场景下保持了小于25 MB的紧凑内存占用,实现了高效的存储与推理。
  • 消融实验证实,语义监督可稳定训练过程并提升几何学习效果,尤其在平坦或低纹理区域表现更优,如定性对比所示。
  • 在office0序列中,该方法实现了40.23 dB的PSNR和0.993的SSIM,表明即使在复杂室内环境中,也能实现高质量的颜色与几何重建。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。