[论文解读] Photo-SLAM: Real-time Simultaneous Localization and Photorealistic Mapping for Monocular, Stereo, and RGB-D Cameras
Photo-SLAM 引入了一种超原始图(hyper primitives map),将显式几何特征(ORB、SH 系数)与隐式神经渲染相结合,实现了在单目、双目和 RGB-D 相机上的实时、逼真 SLAM。通过使用 3D 高斯点阵渲染(3D Gaussian splatting)和一种新型基于高斯金字塔(Gaussian-Pyramid)的学习方法,其在 PSNR 指标上达到 SOTA 水平,并实现了 1000 FPS 的渲染速度,可在 Jetson AGX Orin 等嵌入式平台实时运行。
The integration of neural rendering and the SLAM system recently showed promising results in joint localization and photorealistic view reconstruction. However, existing methods, fully relying on implicit representations, are so resource-hungry that they cannot run on portable devices, which deviates from the original intention of SLAM. In this paper, we present Photo-SLAM, a novel SLAM framework with a hyper primitives map. Specifically, we simultaneously exploit explicit geometric features for localization and learn implicit photometric features to represent the texture information of the observed environment. In addition to actively densifying hyper primitives based on geometric features, we further introduce a Gaussian-Pyramid-based training method to progressively learn multi-level features, enhancing photorealistic mapping performance. The extensive experiments with monocular, stereo, and RGB-D datasets prove that our proposed system Photo-SLAM significantly outperforms current state-of-the-art SLAM systems for online photorealistic mapping, e.g., PSNR is 30% higher and rendering speed is hundreds of times faster in the Replica dataset. Moreover, the Photo-SLAM can run at real-time speed using an embedded platform such as Jetson AGX Orin, showing the potential of robotics applications.
研究动机与目标
- 解决现有神经 SLAM 系统因过度依赖隐式表示和神经求解器而导致的高计算成本与部署困难问题。
- 实现在资源受限的便携式与嵌入式平台上的实时、逼真建图与定位。
- 通过将显式几何特征与学习到的光照特征相结合,克服仅使用隐式表示的局限性。
- 开发一种可扩展、高效且高保真度的建图系统,支持在未知环境中进行增量式、在线重建。
- 在不依赖密集深度监督(尤其是单目场景)的前提下,实现高速度与高质量的渲染。
提出的方法
- 维护一个由 3D 点组成的超原始图,存储 ORB 特征、旋转、尺度、密度以及用于光照表示的球谐(Spherical Harmonic, SH)系数。
- 采用 3D 高斯点阵渲染(3D Gaussian splatting)实现快速、可微分的渲染,替代光线采样,降低重建成本并支持实时性能。
- 提出一种基于几何的稠密化策略,通过主动添加基于 2D 几何特征(如 ORB 角点)的超原始图,提升定位精度与地图覆盖范围。
- 提出一种基于高斯金字塔(Gaussian-Pyramid, GP)的学习方法,实现跨多尺度的渐进式多级特征学习,提升纹理细节与建图保真度。
- 通过反向传播优化系统,使用因子图求解器进行定位优化,同时结合可微分渲染损失实现逼真建图。
- 使用 C++ 与 CUDA 实现完整系统,以在 Jetson AGX Orin 等嵌入式平台实现高性能执行。
实验结果
研究问题
- RQ1是否可以通过结合超原始图的显式-隐式混合表示,实现实时逼真 SLAM,而无需依赖昂贵的神经求解器或仅基于隐式的训练方法?
- RQ2在单目与稀疏深度场景下,基于几何的稠密化策略在多大程度上提升了地图质量与定位精度?
- RQ3基于高斯金字塔的学习方法在多尺度下对特征表示与建图性能的提升程度如何?
- RQ4该系统是否能在不牺牲保真度或可扩展性的前提下,在嵌入式硬件上实现高 PSNR 与实时渲染(如 >1000 FPS)?
- RQ5与当前最先进的神经 SLAM 系统相比,该方法在定位精度、渲染速度与模型效率方面表现如何?
主要发现
- Photo-SLAM 在 Replica RGB-D 数据集上实现了 34.958 的 PSNR,相比之前 SOTA 方法提升约 30%。
- 在 Replica 数据集上,系统最高可实现 1084 FPS 的渲染速度,相比之前方法提升数百倍。
- 在单目设置下,Photo-SLAM 实现了 33.302 的 PSNR 与 911.3 FPS 的渲染速度,显著优于缺少基于几何的稠密化或 GP 学习的消融模型。
- 基于高斯金字塔的 GP 学习方法在 3 层时达到质量与效率的最佳平衡,而 4 层则导致过拟合与性能下降。
- 系统可在 Jetson AGX Orin 嵌入式平台上实时运行,证明了其在机器人应用中的可行性。
- 消融实验表明,基于几何的稠密化与 GP 学习均不可或缺:移除任一模块将导致 PSNR 下降超过 1.6 分,且渲染速度降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。