Skip to main content
QUICK REVIEW

[论文解读] DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras

Zachary Teed, Jia Deng|arXiv (Cornell University)|Aug 24, 2021
Robotics and Sensor-Based Localization参考文献 53被引用 233
一句话总结

DROID-SLAM 引入一个可微分的递归优化 SLAM 系统,联合更新相机位姿和每像素深度,使用一个 Dense Bundle Adjustment layer,在单目、立体和 RGB-D 输入上实现最先进的准确性和鲁棒性,且无需重新训练。

ABSTRACT

We introduce DROID-SLAM, a new deep learning based SLAM system. DROID-SLAM consists of recurrent iterative updates of camera pose and pixelwise depth through a Dense Bundle Adjustment layer. DROID-SLAM is accurate, achieving large improvements over prior work, and robust, suffering from substantially fewer catastrophic failures. Despite training on monocular video, it can leverage stereo or RGB-D video to achieve improved performance at test time. The URL to our open source code is https://github.com/princeton-vl/DROID-SLAM.

研究动机与目标

  • 在单目、立体和 RGB-D 模态下推动鲁棒、准确的视觉 SLAM。
  • 开发一个深度学习 SLAM 框架,联合优化位姿和密集深度。
  • 实现跨模态泛化,使单目训练在立体和 RGB-D 测试中也能受益。
  • 整合一个可微分的 DBA 层,将经典几何与学习更新融合。

提出的方法

  • 使用端到端可微分流水线,对相机位姿和逆深度进行递归更新迭代。
  • 用覆盖可见帧的帧图来表示问题,并通过 3x3 ConvGRU 进行更新。
  • 使用 RAFT 向下的相关金字塔从图像对计算密集对应关系和相关特征。
  • 预测流修改和置信度图,然后应用一个可微分的 Dense Bundle Adjustment 以获得位姿和深度更新。
  • 使用位姿和流监督进行训练,通过在单目训练中锚定前两个位姿来固定刻度自由度。
  • 通过调整 DBA 层并在需要时引入深度测量来扩展到立体和 RGB-D。

实验结果

研究问题

  • RQ1一个深度学习 SLAM 系统是否能够在单目、立体和 RGB-D 输入下同时实现高精度与鲁棒性?
  • RQ2迭代的、可微分的优化(DROID)是否能在多帧上联合细化相机位姿和密集深度?
  • RQ3与先前的 SLAM 方法相比,加入 dense bundle adjustment 层对精度和失败率有何影响?
  • RQ4在不重新训练的情况下,单目训练的模型在立体和 RGB-D 测试中的泛化程度有多大?
  • RQ5在标准基准测试上,实时端到端深度 SLAM 系统的性能特征(速度、内存)是多少?

主要发现

  • 在多个数据集和模态下达到最先进的精度,相对于先前工作有显著的相对提升。
  • 在 ETH-3D、TartanAir、EuRoC 和 TUM-RGBD 等数据集中展示出较高的鲁棒性,灾难性失败显著减少。
  • 展示出强泛化能力:仅在单目数据上训练的模型在测试时无需重新训练即可有效利用立体或 RGB-D 输入。
  • 在 TartanAir 单目数据集上,方法将误差比最佳先前结果降低 62%;在立体上降低 60%。
  • 在 ETH-3D RGB-D 上,在 AUC 上排名第一,并覆盖了 30/32 个 RGB-D 数据集,明显优于第二名。
  • 在 Euroc、TUM-RGBD 和 ETH-3D 基准上,超越了经典 SLAM 基线和许多深度学习对手。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。