Skip to main content
QUICK REVIEW

[论文解读] Learning monocular visual odometry with dense 3D mapping from dense 3D flow

Cheng Zhao, Li Sun|arXiv (Cornell University)|Mar 6, 2018
Robotics and Sensor-Based Localization参考文献 2被引用 8
一句话总结

该论文提出了一种用于单目视觉里程计(L-VO)的端到端深度学习框架,结合密集3D映射,通过3D流关联层将2D光流与预测深度融合为密集3D流,以提升6-DOF位姿估计性能。该方法在KITTI基准测试中实现了2.68%的平均平移误差和0.0143°/m的平均旋转误差,优于大多数单目基线方法,并通过双变量高斯损失函数建模运动相关性,接近双目SLAM性能。

ABSTRACT

This paper introduces a fully deep learning approach to monocular SLAM, which can perform simultaneous localization using a neural network for learning visual odometry (L-VO) and dense 3D mapping. Dense 2D flow and a depth image are generated from monocular images by sub-networks, which are then used by a 3D flow associated layer in the L-VO network to generate dense 3D flow. Given this 3D flow, the dual-stream L-VO network can then predict the 6DOF relative pose and furthermore reconstruct the vehicle trajectory. In order to learn the correlation between motion directions, the Bivariate Gaussian modelling is employed in the loss function. The L-VO network achieves an overall performance of 2.68% for average translational error and 0.0143 deg/m for average rotational error on the KITTI odometry benchmark. Moreover, the learned depth is fully leveraged to generate a dense 3D map. As a result, an entire visual SLAM system, that is, learning monocular odometry combined with dense 3D mapping, is achieved.

研究动机与目标

  • 开发一种完全端到端的深度学习系统,用于单目SLAM,联合执行视觉里程计与密集3D映射。
  • 通过学习到的深度与运动先验,而非几何约束,克服单目SLAM中的绝对尺度漂移问题。
  • 通过将2D光流与预测深度融合为密集3D流,提升6-DOF位姿估计精度。
  • 通过可微分损失函数学习运动相关性,减少对手工设计几何约束和领域特定调参的依赖。
  • 利用深度融合与OctoMap表示,在实时条件下生成高质量、密集的3D地图。

提出的方法

  • 训练一个双流L-VO网络,以密集3D流作为输入,预测6-DOF相机运动,该3D流由2D光流与预测深度推导而来。
  • 引入3D流关联层,将2D光流图与深度图融合,生成密集3D流,实现在三维空间中的几何推理。
  • 提出双变量高斯损失函数,用于建模平移分量(x, z)之间的相关性,提升运动一致性。
  • 采用监督方式训练网络,使用KITTI数据集提供的真值位姿作为监督信号,深度监督由子网络提供。
  • 通过多帧间深度融合与基于OctoMap的体素表示,实现密集3D映射,支持高效在线建图。
  • 系统基于ROS实现,使用TensorFlow训练,部署于NVIDIA Titan GPU,支持实时推理。

实验结果

研究问题

  • RQ1是否能够通过完全端到端的深度学习系统,在不依赖相机高度等几何先验的情况下,实现具有竞争力的单目视觉里程计性能?
  • RQ2将2D光流与预测深度融合为3D流,相比仅使用2D光流,如何提升6-DOF位姿估计性能?
  • RQ3学习到的双变量高斯损失函数在多大程度上能提升运动一致性与轨迹精度?
  • RQ4学习到的单目SLAM系统能否生成与双目SLAM系统相当的密集、高保真度3D地图?
  • RQ5当运动物体主导光流时,该方法在动态场景与高速运动下的鲁棒性如何?

主要发现

  • 所提出的L-VO(3D)模型在KITTI视觉里程计基准测试中实现了2.68%的平均平移误差与0.0143°/m的平均旋转误差,优于大多数单目SLAM方法。
  • 在低速场景中,3D流中引入深度信息可显著提升性能,尤其当2D光流幅值较弱时。
  • 双变量高斯损失函数增强了运动一致性,尤其在直线与弯道轨迹中,有效减少漂移。
  • L-VO(3D)模型的性能更接近双目SLAM,证明了3D几何推理的优势。
  • 系统通过深度融合与OctoMap技术,生成了密集、清晰的3D地图,具有锐利的物体边界与较低噪声。
  • 尽管计算成本较高且存在数据集偏差,该模型仍能泛化至未见序列(如KITTI 11–21),生成定性合理的轨迹。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。