[论文解读] Deep Virtual Stereo Odometry: Leveraging Deep Depth Prediction for Monocular Direct Sparse Odometry
本文提出深度虚拟立体里程计(DVSO),一种单目视觉里程计系统,利用深度单目深度预测来克服几何视觉里程计中的尺度漂移和运动视差限制。通过使用半监督深度网络优化视差预测,并将其作为虚拟立体测量值集成到直接稀疏里程计中,DVSO 仅使用单个摄像头即可实现与立体方法相当的度量精度。
Monocular visual odometry approaches that purely rely on geometric cues are prone to scale drift and require sufficient motion parallax in successive frames for motion estimation and 3D reconstruction. In this paper, we propose to leverage deep monocular depth prediction to overcome limitations of geometry-based monocular visual odometry. To this end, we incorporate deep depth predictions into Direct Sparse Odometry (DSO) as direct virtual stereo measurements. For depth prediction, we design a novel deep network that refines predicted depth from a single image in a two-stage process. We train our network in a semi-supervised way on photoconsistency in stereo images and on consistency with accurate sparse depth reconstructions from Stereo DSO. Our deep predictions excel state-of-the-art approaches for monocular depth on the KITTI benchmark. Moreover, our Deep Virtual Stereo Odometry clearly exceeds previous monocular and deep learning based methods in accuracy. It even achieves comparable performance to the state-of-the-art stereo methods, while only relying on a single camera.
研究动机与目标
- 解决单目视觉里程计中固有的尺度模糊性和运动视差依赖性问题。
- 通过引入基于深度学习的深度估计,克服纯几何单目 VO 的局限性。
- 提出一种半监督训练方法以实现深度预测,避免昂贵的 LiDAR 数据采集。
- 将深度学习预测结果集成到直接稀疏里程计框架中,实现度量尺度的轨迹估计。
- 仅使用单个摄像头,实现与基于立体视觉的视觉里程计系统相当的性能。
提出的方法
- 使用自监督的光度一致性与 Stereo DSO 提供的稀疏深度监督,训练一个两阶段堆叠残差网络用于单目深度预测。
- 将预测的深度图作为虚拟立体视差,以在 DSO 优化流程中创建合成的立体约束。
- 将虚拟立体项集成到滑动窗口直接捆绑调整中,以确保预测深度与观测图像亮度之间的一致性。
- 利用立体图像对中的光度一致性损失和左右一致性,监督深度预测,而无需完整的 LiDAR 监督。
- 利用 Stereo DSO 提供的稀疏 3D 重建作为弱监督信号,在训练过程中优化深度预测。
- 调整虚拟立体基线参数以进一步提升性能,实现超越最先进立体方法的效果。
实验结果
研究问题
- RQ1深度单目深度预测能否有效缓解单目视觉里程计中的尺度漂移?
- RQ2仅使用立体图像和稀疏 DSO 重建,半监督深度学习在多大程度上可实现与监督方法相当的性能?
- RQ3从深度预测中提取的虚拟立体约束,能否提升单目设置下直接稀疏里程计的精度?
- RQ4所提出的方法是否能在仅依赖单个摄像头的前提下,实现与基于立体视觉的视觉里程计系统相当的性能?
- RQ5该系统在训练数据分布之外的多样化序列和相机轨迹上,泛化能力如何?
主要发现
- DVSO 在 KITTI 基准测试中的平移和旋转误差与最先进的立体方法(如 Stereo LSD-SLAM 和 Stereo DSO)相当。
- 通过虚拟基线调优,DVSO 超越了所有评估的单目和立体方法,包括未使用回环检测的 Stereo LSD-SLAM 和 ORB-SLAM2。
- 所提出的半监督深度网络在 KITTI 基准测试中优于最先进的单目深度估计方法。
- 在平移和旋转误差方面,DVSO 显著优于端到端深度学习视觉里程计系统,如 DeepVO、UnDeepVO、SfMLearner 和 Yin et al. [46]。
- 该方法在未见序列上表现出良好的泛化能力,如补充材料中展示的 Cityscapes Frankfurt 序列的轨迹估计结果。
- 将深度预测结果作为虚拟立体约束集成,使单目系统能够实现度量尺度估计,有效消除尺度漂移。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。