[论文解读] NeRF-SLAM: Real-Time Dense Monocular SLAM with Neural Radiance Fields
NeRF-SLAM 提出了一种实时单目 SLAM 流水线,利用密集单目 SLAM 系统生成的密集深度图和不确定性估计,实时训练分层体积神经辐射场(NeRF)。通过以边际协方差加权深度预测,该方法在光度和几何精度方面达到最先进水平——光信噪比(PSNR)最高提升 179%,L1 深度误差降低 86%,同时在标准 GPU 硬件上实现 10–12 FPS 的运行速度。
We propose a novel geometric and photometric 3D mapping pipeline for accurate and real-time scene reconstruction from monocular images. To achieve this, we leverage recent advances in dense monocular SLAM and real-time hierarchical volumetric neural radiance fields. Our insight is that dense monocular SLAM provides the right information to fit a neural radiance field of the scene in real-time, by providing accurate pose estimates and depth-maps with associated uncertainty. With our proposed uncertainty-based depth loss, we achieve not only good photometric accuracy, but also great geometric accuracy. In fact, our proposed pipeline achieves better geometric and photometric accuracy than competing approaches (up to 179% better PSNR and 86% better L1 depth), while working in real-time and using only monocular images.
研究动机与目标
- 解决从缺乏显式深度测量的单目 RGB 视频中实现实时、高精度 3D 场景重建的挑战。
- 克服传统 NeRF 的局限性,后者需要真实位姿且存在鬼影几何问题并收敛缓慢。
- 将密集单目 SLAM 与分层体积 NeRF 相结合,仅使用单目输入实现实时、度量准确的 3D 地图构建。
- 通过在 NeRF 优化过程中利用不确定性感知的深度监督,提升几何与光度精度。
- 证明不确定性加权的深度先验能显著提升 NeRF 的收敛速度与鲁棒性,即使在深度估计存在噪声或不准确时亦然。
提出的方法
- 利用密集单目 SLAM 系统实时估计相机位姿和带有边际协方差(不确定性)估计的密集深度图。
- 在 NeRF 优化过程中应用一种新颖的基于不确定性的深度损失,其中深度预测按其不确定性加权,以减少偏差并提升收敛性。
- 使用 SLAM 输出作为监督,训练基于哈希的分层体积神经辐射场,实现实时推理,处理 RGB 图像流。
- 并行化跟踪与建图线程,其中跟踪线程运行在约 15 FPS,建图线程运行在约 10 FPS,整体实现 10 FPS 的实时性能。
- 使用自定义 CUDA 内核加速相关体积计算与体积渲染,降低内存与计算瓶颈。
- 基于光流幅值(>2.5 像素)实现关键帧选择策略,以平衡精度与计算负载。

实验结果
研究问题
- RQ1密集单目 SLAM 是否能提供足够的几何与光度先验,实现实时、高精度的 NeRF 重建,而无需真实位姿或深度?
- RQ2与未加权或无深度监督相比,不确定性加权的深度监督如何提升神经辐射场的收敛性与精度?
- RQ3基于单目 SLAM 输出训练的 NeRF 在多大程度上能实现优于现有单目重建方法的光度与几何精度?
- RQ4噪声或不确定的深度估计对 NeRF 优化有何影响?不确定性加权能否缓解这些影响?
- RQ5是否可行仅使用单目 RGB 输入实现实时 NeRF 重建,而无需 RGB-D 或双目传感器?
主要发现
- 在 Replica 数据集上,NeRF-SLAM 的 PSNR 相比竞争性单目方法最高提升 179%,表明光度精度显著更优。
- 与最先进单目方法相比,该方法将 L1 深度误差降低 86%,证明几何精度有显著提升。
- 使用不确定性加权的深度先验可实现更快、更鲁棒的 NeRF 收敛,相比未加权深度,PSNR 下降更少且深度偏差更低。
- 该流水线在标准 GPU 硬件(640×480 分辨率)上实现 10–12 FPS 的运行速度,通过并行化跟踪与建图线程实现实时性能。
- 即使在存在噪声位姿和深度估计的情况下,当深度按其边际协方差加权时,NeRF-SLAM 仍能保持高精度,优于未加权深度与无深度基线方法。
- 该方法在无需真实位姿或深度的情况下实现优异性能,完全依赖 SLAM 系统的不确定性感知输出作为监督信号。
![Figure 2 : The input to our pipeline consists of sequential monocular images (here represented as Img 1 & Img 2). Starting from the top-right, our architecture fits a NeRF using Instant-NGP [ 17 ] , which we supervise using RGB images $\mathbf{I}$ , depths $\mathbf{D}$ , where the depths are weighte](https://ar5iv.labs.arxiv.org/html/2210.13641/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。