Skip to main content
QUICK REVIEW

[论文解读] VOLDOR-SLAM: For the Times When Feature-Based or Direct Methods Are Not Good Enough

Zhixiang Min, Enrique Dunn|arXiv (Cornell University)|Apr 14, 2021
Robotics and Sensor-Based Localization参考文献 37被引用 6
一句话总结

VOLDOR+SLAM 是一种密集间接 SLAM 系统,利用外部密集光流估计,在特征基或直接方法失效的复杂环境中实现鲁棒、精确且全局一致的 3D 地图构建。通过在 VOLDOR 概率视觉里程计框架中引入几何先验、自适应位姿图管理以及点到平面逆深度对齐,该系统在单张 GPU 上实现了约 15 FPS 的实时性能,同时在单目、双目和 RGB-D 输入下,其精度和鲁棒性均优于 ORB-SLAM3 和 DSO。

ABSTRACT

We present a dense-indirect SLAM system using external dense optical flows as input. We extend the recent probabilistic visual odometry model VOLDOR [Min et al. CVPR'20], by incorporating the use of geometric priors to 1) robustly bootstrap estimation from monocular capture, while 2) seamlessly supporting stereo and/or RGB-D input imagery. Our customized back-end tightly couples our intermediate geometric estimates with an adaptive priority scheme managing the connectivity of an incremental pose graph. We leverage recent advances in dense optical flow methods to achieve accurate and robust camera pose estimates, while constructing fine-grain globally-consistent dense environmental maps. Our open source implementation [https://github.com/htkseason/VOLDOR] operates online at around 15 FPS on a single GTX1080Ti GPU.

研究动机与目标

  • 解决特征基与直接 SLAM 方法在低纹理、动态或退化环境中的局限性。
  • 通过将几何先验融入 VOLDOR 推断框架,实现鲁棒的单目 SLAM。
  • 开发一种基于密集光流输入的实时、全局一致的密集映射系统。
  • 通过自适应优先级链接方案改进增量式 SLAM 的位姿图管理。
  • 在不依赖稀疏特征或光度校准的前提下,实现高精度深度估计与 3D 重建。

提出的方法

  • 通过引入显式的几何先验,扩展 VOLDOR 概率视觉里程计模型,以提升单目、双目和 RGB-D 设置下的鲁棒性。
  • 采用点到平面逆深度对齐公式,实现与源无关的帧注册,提升位姿估计精度。
  • 提出一种自适应优先级方案用于增量式位姿图管理,基于几何一致性与连通性动态链接关键帧。
  • 使用预训练网络(如 MaskFlowNet)生成的密集光流作为输入,跳过特征提取步骤,实现密集几何推理。
  • 在光流批次上应用对数-对数逻辑残差模型,实时联合推断相机运动、三维结构与轨迹可靠性。
  • 通过基于概率融合策略聚合关键帧的深度图,构建全局一致的密集 3D 地图。

实验结果

研究问题

  • RQ1能否有效利用密集光流,使单目 SLAM 在特征基方法失效的环境中依然保持鲁棒?
  • RQ2如何将几何先验整合到密集间接 SLAM 流程中,以提升单目、双目和 RGB-D 输入下的精度与鲁棒性?
  • RQ3自适应位姿图管理策略对密集 SLAM 系统的一致性与可扩展性有何影响?
  • RQ4在具有挑战性的、逼真的合成环境中,密集间接方法在多大程度上优于传统特征基与直接 SLAM 方法?
  • RQ5在不同置信度阈值与环境条件下,VOLDOR+SLAM 的深度图质量与最先进方法相比如何?

主要发现

  • 在 TartanAir 数据集的所有序列中,VOLDOR+SLAM 的整体位姿精度均最优,显著优于 ORB-SLAM3 和 DSO,尤其在低纹理和动态环境(如 'ocean' 和 'seasonsforest')中表现突出。
  • 系统在各类环境中均保持高完整性(高于 0.95),表明在快速运动和纹理稀少等挑战性条件下仍具备鲁棒跟踪能力。
  • 对于单目输入,VOLDOR+SLAM 在所有基线方法中旋转精度最高,在 'ocean' 序列上的中位旋转误差仅为 0.88°。
  • VOLDOR+SLAM 生成的深度图显示,约 50% 的像素置信度得分高于 0.99,在高置信度水平下,其内点率与 EPE 均显著优于 GA-Net 和 MaskFlowNet。
  • 与单目输入相比,双目输入仅带来轻微的深度精度提升,表明系统即使在单目序列下,其深度估计能力也已非常出色。
  • 定性结果表明,系统可生成具有精细细节且漂移极小的密集、全局一致 3D 重建,即使在存在运动物体与动态光照的复杂场景中亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。