[论文解读] iDF-SLAM: End-to-End RGB-D SLAM with Neural Implicit Mapping and Deep Feature Tracking
iDF-SLAM 提出了一种端到端的 RGB-D SLAM 系统,结合了基于深度特征的神经追踪器与 NeRF 风格的神经隐式映射器以实现场景重建。通过在关键帧处仅联合微调追踪器并更新隐式地图,该方法在无需真实位姿的自监督在线训练中实现了最先进的重建质量与具有竞争力的追踪性能。
We propose a novel end-to-end RGB-D SLAM, iDF-SLAM, which adopts a feature-based deep neural tracker as the front-end and a NeRF-style neural implicit mapper as the back-end. The neural implicit mapper is trained on-the-fly, while though the neural tracker is pretrained on the ScanNet dataset, it is also finetuned along with the training of the neural implicit mapper. Under such a design, our iDF-SLAM is capable of learning to use scene-specific features for camera tracking, thus enabling lifelong learning of the SLAM system. Both the training for the tracker and the mapper are self-supervised without introducing ground truth poses. We test the performance of our iDF-SLAM on the Replica and ScanNet datasets and compare the results to the two recent NeRF-based neural SLAM systems. The proposed iDF-SLAM demonstrates state-of-the-art results in terms of scene reconstruction and competitive performance in camera tracking.
研究动机与目标
- 通过使用神经隐式地图表示来降低密集 SLAM 系统的显存与计算成本。
- 通过仅在关键帧更新地图来减少每帧优化,提升基于 NeRF 的 SLAM 的运行效率。
- 通过在运行时对预训练神经追踪器进行微调以实现场景特定特征的终身学习。
- 在无需真实位姿的情况下,对追踪与建图组件实现自监督训练。
- 通过直接回归截断有符号距离函数(T-SDF)来提升重建精度,而非体积密度或占据率表示。
提出的方法
- 采用预训练且可微调的基于特征的神经追踪器进行实时相机位姿估计,替代传统特征匹配方法。
- 使用单个 MLP 在 3D 查询点处隐式表示场景的截断有符号距离函数(T-SDF)。
- 仅在选择新关键帧时更新神经隐式地图,相比每帧优化显著降低计算负载。
- 执行联合优化:首先基于当前地图优化相机位姿,然后利用关键帧与优化后的位姿更新 MLP 权重。
- 仅使用单目与深度图像序列,在无需真实位姿的情况下,以自监督方式联合训练追踪器与映射器。
- 使用首帧特征初始化 MLP,并在在线运行过程中通过关键帧数据逐步优化。
实验结果
研究问题
- RQ1在 SLAM 运行过程中,基于特征的深度神经追踪器是否能有效微调,以提升在新环境中的追踪鲁棒性?
- RQ2使用 T-SDF 作为神经隐式地图表示是否能带来优于体积密度或占据率表示的重建精度?
- RQ3仅在关键帧更新地图是否能在显著降低计算成本的同时维持高重建质量?
- RQ4在无真实位姿的情况下,自监督端到端训练方案在追踪精度与重建保真度方面表现如何?
- RQ5有限的地图更新频率与基于特征的追踪对长序列中的长期漂移与性能有何影响?
主要发现
- 在 Replica 数据集上,iDF-SLAM 实现了最先进的重建结果,相较于 iMAP 和 NICE-SLAM,完成度提升 2 cm,完成率提高 10%。
- 在 ScanNet 数据集上,iDF-SLAM 展现出具有竞争力的相机追踪性能,在场景 0059 和 0106 中优于 iMAP,与 NICE-SLAM 表现相当或更优。
- 在 Replica 上,系统实现了 0.015 m 的平均 ATE RMSE,在 ScanNet 上为 0.016 m,表明其具有出色的追踪精度。
- 尽管重建质量优异,但在快速运动序列(如 Replica 中的 Room-1 和 Room-2)中,追踪性能因追踪器敏感性与地图更新频率较低而下降。
- 在长序列中观察到长期漂移,尤其由于基于特征的追踪器与较低的地图更新频率,导致其在 ScanNet 上的表现不及 NICE-SLAM。
- 与体积密度或占据率表示相比,使用 T-SDF 能实现更精确的表面预测,尤其在具有复杂几何结构的场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。