Skip to main content
QUICK REVIEW

[论文解读] PLGSLAM: Progressive Neural Scene Represenation with Local to Global Bundle Adjustment

Tianchen Deng, Guole Shen|arXiv (Cornell University)|Dec 15, 2023
Robotics and Sensor-Based Localization被引用 5
一句话总结

PLGSLAM 提出了一种渐进式的神经 SLAM 系统,通过使用三平面(tri-planes)和多层感知机(MLPs)的动态局部场景表示,实现在大尺寸室内场景中的高保真重建与鲁棒相机追踪。该方法引入了一种结合全局关键帧数据库的局部到全局捆绑调整(bundle adjustment),以缓解累积位姿漂移问题,在小规模与大规模数据集上均实现了重建精度与追踪鲁棒性的最先进性能。

ABSTRACT

Neural implicit scene representations have recently shown encouraging results in dense visual SLAM. However, existing methods produce low-quality scene reconstruction and low-accuracy localization performance when scaling up to large indoor scenes and long sequences. These limitations are mainly due to their single, global radiance field with finite capacity, which does not adapt to large scenarios. Their end-to-end pose networks are also not robust enough with the growth of cumulative errors in large scenes. To this end, we introduce PLGSLAM, a neural visual SLAM system capable of high-fidelity surface reconstruction and robust camera tracking in real-time. To handle large-scale indoor scenes, PLGSLAM proposes a progressive scene representation method which dynamically allocates new local scene representation trained with frames within a local sliding window. This allows us to scale up to larger indoor scenes and improves robustness (even under pose drifts). In local scene representation, PLGSLAM utilizes tri-planes for local high-frequency features with multi-layer perceptron (MLP) networks for the low-frequency feature, achieving smoothness and scene completion in unobserved areas. Moreover, we propose local-to-global bundle adjustment method with a global keyframe database to address the increased pose drifts on long sequences. Experimental results demonstrate that PLGSLAM achieves state-of-the-art scene reconstruction results and tracking performance across various datasets and scenarios (both in small and large-scale indoor environments). The code is open-sourced at https://github.com/dtc111111/plgslam.

研究动机与目标

  • 解决现有神经 SLAM 系统在大尺度室内场景中的局限性,其中全局辐射场受限于有限容量,且在长序列中累积位姿漂移。
  • 通过在相机移动时动态分配滑动窗口内的局部场景表示,提升场景表示的可扩展性与鲁棒性。
  • 通过结合三平面以捕捉高频特征,以及使用 MLP 以实现低频一致性与场景补全,提升重建精度与平滑度。
  • 通过引入一种利用所有历史关键帧进行优化的局部到全局捆绑调整策略,减少长序列中的累积位姿误差。
  • 在保持高精度的同时,实现实时性能,适用于小型室内房间与大型多房间环境。

提出的方法

  • 当相机接近当前局部区域边界时,动态初始化新的局部场景表示,以实现对大场景的可扩展建模。
  • 使用分辨率为 24 cm 和 6 cm 的三平面,以及 32 通道特征图,编码局部高频几何与纹理细节。
  • 将三平面特征与一个两层 MLP(32 个隐藏单元)结合,以建模低频全局特征、平滑度,并填补未观测区域。
  • 维护一个全局关键帧数据库,用于存储所有历史观测数据,支持跨所有历史帧的重投影误差最小化。
  • 通过将局部表示中的光线投射到全局坐标系中,结合局部与全局关键帧,执行局部到全局的捆绑调整。
  • 将端到端位姿估计与传统 SLAM 优化相结合,采用多损失目标函数,包括特征相似性、SDF 一致性、平滑度与深度监督。

实验结果

研究问题

  • RQ1与单一全局辐射场相比,渐进式、局部自适应的神经场景表示是否能提升大尺寸室内场景中的可扩展性与鲁棒性?
  • RQ2与标准 NeRF 或特征网格方法相比,结合三平面与 MLP 的方法在提升重建精度与平滑度的同时,是否能更有效地减少内存增长?
  • RQ3与神经 SLAM 中传统的局部 BA 相比,局部到全局捆绑调整策略在多大程度上能减少长序列中的累积位姿漂移?
  • RQ4将端到端位姿网络与全局优化相结合,是否能提升大规模环境中的追踪精度与鲁棒性?
  • RQ5所提出的系统是否能在保持实时性能的同时,在多样化室内数据集上实现重建与定位的最先进结果?

主要发现

  • 在 Replica 数据集(小规模室内场景)上,PLGSLAM 在重建保真度与位姿估计精度方面均优于 ESLAM 与 Co-SLAM,实现了无伪影、高细节的重建。
  • 在 ScanNet 数据集(大规模室内场景,约 7.5m × 6.6m)上,PLGSLAM 在 NICE-SLAM、ESLAM 与 Co-SLAM 中实现了最低的绝对轨迹误差(ATE),证明了其卓越的追踪鲁棒性。
  • 在 Apartment 数据集(大规模,约 14.5m × 7.5m)上,PLGSLAM 实现了最先进的相机追踪性能,与 Co-SLAM 和 ESLAM 相比,累积误差显著降低。
  • 消融实验表明,三平面与 MLP 的联合表示在重建精度上优于单一组件,尤其在捕捉细节与填补孔洞方面表现更优。
  • 移除局部到全局捆绑调整后,累积误差明显增加,追踪性能下降,验证了其在长序列稳定性中的关键作用。
  • 渐进式场景表示方法降低了全局误估风险,并限制了误差传播,提升了动态环境下的系统鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。