Skip to main content
QUICK REVIEW

[论文解读] Visual Odometry Revisited: What Should Be Learnt?

Huangying Zhan, Chamara Saroj Weerasekera|arXiv (Cornell University)|Sep 21, 2019
Advanced Vision and Imaging参考文献 62被引用 11
一句话总结

本文提出 DF-VO,一种单目视觉里程计系统,通过使用自监督卷积神经网络(CNN)预测单目深度和光流作为中间输出,将深度学习与几何约束相结合。利用这些预测结果建立 2D-2D 和 3D-2D 对应关系,该方法在纯深度学习与纯几何方法之上实现了更高的精度与鲁棒性,同时通过尺度一致的深度监督消除了尺度漂移。

ABSTRACT

In this work we present a monocular visual odometry (VO) algorithm which leverages geometry-based methods and deep learning. Most existing VO/SLAM systems with superior performance are based on geometry and have to be carefully designed for different application scenarios. Moreover, most monocular systems suffer from scale-drift issue.Some recent deep learning works learn VO in an end-to-end manner but the performance of these deep systems is still not comparable to geometry-based methods. In this work, we revisit the basics of VO and explore the right way for integrating deep learning with epipolar geometry and Perspective-n-Point (PnP) method. Specifically, we train two convolutional neural networks (CNNs) for estimating single-view depths and two-view optical flows as intermediate outputs. With the deep predictions, we design a simple but robust frame-to-frame VO algorithm (DF-VO) which outperforms pure deep learning-based and geometry-based methods. More importantly, our system does not suffer from the scale-drift issue being aided by a scale consistent single-view depth CNN. Extensive experiments on KITTI dataset shows the robustness of our system and a detailed ablation study shows the effect of different factors in our system.

研究动机与目标

  • 解决单目视觉里程计中长期存在的尺度漂移问题,该问题源于几何方法因 6DoF 运动模糊性而引发的困扰。
  • 克服端到端深度学习视觉里程计系统的局限性,这些系统在有利条件下仍缺乏几何方法的可靠性与精度。
  • 探索深度学习预测结果(深度与光流)与经典几何方法(对极几何、PnP)之间最优的融合方式,以实现鲁棒的帧间视觉里程计。
  • 证明通过自监督深度与光流网络进行中间监督,可在无需完整端到端训练的情况下实现尺度一致性并提升性能。

提出的方法

  • 训练两个独立的卷积神经网络:一个用于单目深度预测,采用深度一致性损失以强制实现尺度一致性;另一个用于两视图光流估计。
  • 使用前向-后向光流一致性作为筛选标准,选择高质量的 2D-2D 特征对应关系。
  • 结合预测的深度与光流,从 2D 匹配生成 3D-2D 对应关系,从而实现鲁棒的基于 PnP 的位姿估计。
  • 应用在单目或双目序列上训练的尺度一致深度预测网络,以解决单目系统固有的尺度模糊性问题。
  • 使用经过筛选的 2D-2D 与 3D-2D 匹配,结合帧间 PnP 算法估计相机相对位姿,从而在长序列中最小化漂移。
  • 采用光度扭曲损失进行自监督训练,避免依赖真实位姿或深度监督。

实验结果

研究问题

  • RQ1深度学习预测结果(深度与光流)能否与经典几何方法有效结合,以提升单目视觉里程计的性能?
  • RQ2与标准几何方法相比,使用尺度一致的深度预测网络是否能显著减少单目视觉里程计中的平移漂移?
  • RQ3混合式深度-几何视觉里程计系统在标准基准测试中的表现,与纯深度学习和纯几何方法基线相比如何?
  • RQ4不同的训练方案(单目 vs. 双目,自监督 vs. 有监督)对最终视觉里程计系统鲁棒性与精度的影响是什么?

主要发现

  • 在 KITTI 数据集上,DF-VO 的性能优于纯深度学习方法与纯几何方法,所有序列的相对位姿误差(RPE)均最低。
  • 采用尺度一致深度模型的系统(Mono-SC Train.)性能可与双目训练模型相媲美,同时保持单目特性,有效消除了尺度漂移。
  • 在长序列中,ORB-SLAM2 因尺度模糊性导致显著的平移漂移,而 DF-VO 保持低漂移,证明了尺度一致深度监督的有效性。
  • 消融实验证实,光流一致性过滤与高分辨率输入可提升位姿估计精度,且分辨率提升带来了可测量的性能增益。
  • 尽管在序列 01 上失败,深度学习方法在该具有挑战性的子序列中仍优于几何方法,表明混合系统具有互补潜力。
  • 同时使用深度与光流预测的完整算法显著优于仅使用 PnP 的变体,证明了多模态深度监督的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。