Skip to main content
QUICK REVIEW

[论文解读] CNN-SVO: Improving the Mapping in Semi-Direct Visual Odometry Using Single-Image Depth Prediction

Shing Yan Loo, Ali Amiri|arXiv (Cornell University)|Oct 1, 2018
Robotics and Sensor-Based Localization参考文献 14被引用 8
一句话总结

本文提出 CNN-SVO,作为半直接视觉里程计(SVO)的改进方法,通过利用深度神经网络的单图像深度预测来提升地图点初始化质量。通过使用预测深度作为均值并设定较小的方差以表示低深度不确定性,该方法减少了错误的特征匹配,并加速了向真实深度的收敛,从而在光照条件复杂的情况下实现了更鲁棒和精确的相机跟踪。

ABSTRACT

Reliable feature correspondence between frames is a critical step in visual odometry (VO) and visual simultaneous localization and mapping (V-SLAM) algorithms. In comparison with existing VO and V-SLAM algorithms, semi-direct visual odometry (SVO) has two main advantages that lead to state-of-the-art frame rate camera motion estimation: direct pixel correspondence and efficient implementation of probabilistic mapping method. This paper improves the SVO mapping by initializing the mean and the variance of the depth at a feature location according to the depth prediction from a single-image depth prediction network. By significantly reducing the depth uncertainty of the initialized map point (i.e., small variance centred about the depth prediction), the benefits are twofold: reliable feature correspondence between views and fast convergence to the true depth in order to create new map points. We evaluate our method with two outdoor datasets: KITTI dataset and Oxford Robotcar dataset. The experimental results indicate that the improved SVO mapping results in increased robustness and camera tracking accuracy.

研究动机与目标

  • 解决 SVO 中地图点初始化时深度不确定性较高的问题,避免不可靠的特征对应关系。
  • 在光照条件多变的情况下,提升半直接视觉里程计中相机运动估计的鲁棒性与准确性。
  • 利用基于深度学习的单图像深度预测,为地图点初始化提供精确的深度先验。
  • 通过限制深度不确定性,缩小特征匹配的搜索范围,从而提升匹配的可靠性。
  • 在保持高精度的同时,实现实时性能,适用于 KITTI 和 Oxford Robotcar 等具有挑战性的室外数据集。

提出的方法

  • 集成一个预训练的单图像深度预测网络(例如,在立体图像数据集上训练的网络),用于为关键帧生成深度图。
  • 将预测的深度作为地图点初始化的均值,并设定较小的方差以表示低深度不确定性。
  • 在映射线程中应用概率深度滤波器,基于多视角观测结果更新深度估计。
  • 将特征匹配沿对极线的搜索范围限制在以预测深度为中心的深度区间内,从而减少误匹配。
  • 在新增关键帧时,使用局部束调整(BA)优化相机位姿与地图点。
  • 当有真实位姿可用时(特别是 Oxford Robotcar 数据集),利用真实位姿对深度预测结果进行尺度校正。

实验结果

研究问题

  • RQ1单图像深度预测是否能降低 SVO 中地图点初始化阶段的深度不确定性,从而提升特征对应关系的可靠性?
  • RQ2基于深度神经网络的深度先验如何影响地图点深度估计的收敛速度与准确性?
  • RQ3所提出的方法在过曝或欠曝等复杂光照条件下,能在多大程度上提升相机跟踪的鲁棒性?
  • RQ4深度预测的不确定性对真实室外数据集中视觉里程计整体性能有何影响?
  • RQ5深度先验的引入是否能在保持高精度的同时实现实时运行,特别是在高帧率序列上?

主要发现

  • 与标准 SVO 相比,CNN-SVO 在 KITTI 和 Oxford Robotcar 数据集上均实现了更高的鲁棒性与相机跟踪精度。
  • 该方法在地图点初始化阶段显著降低了深度不确定性,从而加快了向真实深度值的收敛速度。
  • 在 KITTI 数据集上,里程计输出的尺度接近绝对尺度,各序列的尺度值在 0.921 至 1.1876 之间。
  • 在 Oxford Robotcar 数据集上,经过尺度校正后,里程计的尺度范围为 0.8953 至 0.9737,表明与真实值具有合理的对齐。
  • 尽管局部 BA 和深度预测的计算开销较高(分别约为 29ms 和 37ms),CNN-SVO 在 Oxford Robotcar 上仍能达到 16 FPS,在 KITTI 上达到 10 FPS,证明了其具备实时可行性。
  • 深度预测网络具备光照不变性,使 CNN-SVO 在 HDR 条件下仍能保持性能,克服了原始 SVO 的一个关键局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。