Skip to main content
QUICK REVIEW

[论文解读] WGANVO: Monocular Visual Odometry based on Generative Adversarial Networks

Javier Cremona, Lucas C. Uzal|arXiv (Cornell University)|Jul 27, 2020
Robotics and Sensor-Based Localization参考文献 31被引用 5
一句话总结

WGANVO 提出了一种基于 Wasserstein GAN 与梯度惩罚(WGAN-GP)的单目视觉里程计方法,通过端到端方式从图像对回归相机位姿。通过结合无监督对抗训练与有监督位姿回归,该方法在无需先验知识的情况下恢复了绝对尺度,在 KITTI 数据集上实现了实时性能与具有竞争力的精度。

ABSTRACT

In this work we present WGANVO, a Deep Learning based monocular Visual Odometry method. In particular, a neural network is trained to regress a pose estimate from an image pair. The training is performed using a semi-supervised approach. Unlike geometry based monocular methods, the proposed method can recover the absolute scale of the scene without neither prior knowledge nor extra information. The evaluation of the system is carried out on the well-known KITTI dataset where it is shown to work in real time and the accuracy obtained is encouraging to continue the development of Deep Learning based methods.

研究动机与目标

  • 开发一种基于深度学习的单目视觉里程计系统,以克服基于几何方法固有的尺度模糊问题。
  • 利用生成对抗网络实现无监督特征学习,同时支持有监督位姿回归以恢复绝对尺度。
  • 实现实时推理并在标准基准(如 KITTI)上实现鲁棒性能,无需外部传感器或先验标定知识。
  • 探索 WGAN-GP 作为视觉里程计稳定训练框架的有效性,结合对抗信号与有监督信号。
  • 通过未来工作中研究相机参数整合,提升模型在不同相机上的泛化能力。

提出的方法

  • 该方法采用 WGAN-GP 架构,其中判别器被训练以区分真实图像对与生成图像对,学习高层视觉表征。
  • 同一判别器被重新用于从图像对回归相对相机位姿(旋转与平移),实现端到端训练。
  • 采用半监督训练方案,结合对抗损失(WGAN-GP)与使用 KITTI 数据集真实位姿的有监督位姿回归损失。
  • 位姿回归损失采用 Huber 损失($L_{\beta}$)或平滑 L1 损失($L_p$)实现,超参数经调优以获得最佳性能。
  • 网络在 KITTI 序列的图像对上进行训练,特征通过 SIFT 从立体对中提取,三维点通过三角测量与 DLT 算法重建。
  • 训练分为两个阶段:先进行 10,000 次对抗预训练,随后使用 Adam 优化器以 $10^{-4}$ 学习率进行 40,000 次有监督微调。

实验结果

研究问题

  • RQ1基于 GAN 的架构是否能学习到足够的视觉表征,以在无显式几何先验的情况下实现精确的单目视觉里程计?
  • RQ2使用对抗信号与有监督信号的半监督训练是否能提升单目 VO 中的位姿估计精度与尺度恢复能力?
  • RQ3损失函数选择(Huber 与平滑 L1)如何影响模型在真实序列上的性能与鲁棒性?
  • RQ4所提方法是否能在保持标准基准(如 KITTI)上竞争力精度的同时实现实时推理?
  • RQ5模型在不同相机设置下的泛化能力如何?相机标定是否可集成以进一步提升泛化性能?

主要发现

  • 所提方法在 KITTI 数据集上实现实时推理,所有序列的帧处理时间均稳定低于 100ms。
  • 模型在无需先验知识或额外传感器的情况下成功恢复了绝对尺度,克服了传统单目 VO 的关键局限。
  • 两种损失函数 $L_{\beta}$ 与 $L_p$ 表现相当,其中 $L_{\beta}$ 需要超参数调优($\beta=100$),而 $L_p$ 由于无需调优更具鲁棒性。
  • 在序列 00 上,方法实现每 100 米 10.54% 的平移误差与 3.22° 的旋转误差,其他序列表现相似。
  • 半监督训练方案通过对抗预训练有效利用了未标注数据,增强了特征表征与泛化能力。
  • 结果表明,基于 GAN 的架构可有效适配视觉里程计任务,为未来端到端深度学习方法展现出广阔前景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。