Skip to main content
QUICK REVIEW

[论文解读] Sequential Adversarial Learning for Self-Supervised Deep Visual Odometry

Shunkai Li, Fei Xue|arXiv (Cornell University)|Aug 23, 2019
Advanced Vision and Imaging参考文献 43被引用 13
一句话总结

本文提出了一种自监督深度视觉里程计框架,通过序列对抗性学习提升深度和位姿估计性能,方法利用紧凑的代码表示建模帧间相关性,并结合长短期记忆(LSTM)网络。通过将图像合成视为生成任务,并采用基于生成对抗网络(GAN)的判别器进行结构感知,该方法在KITTI和Cityscapes数据集上达到最先进性能,显著减少了深度模糊性和位姿漂移。

ABSTRACT

We propose a self-supervised learning framework for visual odometry (VO) that incorporates correlation of consecutive frames and takes advantage of adversarial learning. Previous methods tackle self-supervised VO as a local structure from motion (SfM) problem that recovers depth from single image and relative poses from image pairs by minimizing photometric loss between warped and captured images. As single-view depth estimation is an ill-posed problem, and photometric loss is incapable of discriminating distortion artifacts of warped images, the estimated depth is vague and pose is inaccurate. In contrast to previous methods, our framework learns a compact representation of frame-to-frame correlation, which is updated by incorporating sequential information. The updated representation is used for depth estimation. Besides, we tackle VO as a self-supervised image generation task and take advantage of Generative Adversarial Networks (GAN). The generator learns to estimate depth and pose to generate a warped target image. The discriminator evaluates the quality of generated image with high-level structural perception that overcomes the problem of pixel-wise loss in previous methods. Experiments on KITTI and Cityscapes datasets show that our method obtains more accurate depth with details preserved and predicted pose outperforms state-of-the-art self-supervised methods significantly.

研究动机与目标

  • 解决依赖单目深度估计的自监督视觉里程计方法存在的局限性,后者存在病态问题且易出错。
  • 通过利用连续帧之间的时空相关性,减少长序列中累积的估计误差和尺度漂移。
  • 通过用捕获高层结构一致性的对抗性学习替代像素级光度损失,提升深度和位姿估计精度。
  • 通过利用图像合成和轨迹一致性作为监督信号,实现无需标注数据的鲁棒自监督学习。
  • 构建统一的生成框架,通过对抗训练联合优化深度和位姿,其中判别器用于评估结构真实感。

提出的方法

  • 学习连续帧之间光流的紧凑代码表示,以编码帧间相关性。
  • 使用LSTM网络对序列中的代码表示进行聚合与优化,捕捉长期时间依赖性。
  • 将深度和位姿估计建模为条件图像生成任务,其中生成器利用估计的深度和位姿合成变形目标图像。
  • 采用生成对抗网络(GAN),其判别器通过高层结构感知评估合成图像的真实性。
  • 通过轨迹一致性(TC)损失强制实现时空一致性,以正则化序列中的位姿预测。
  • 端到端训练整个网络,使用光度损失进行图像合成,使用对抗损失提升图像真实感,无需真实标签。

实验结果

研究问题

  • RQ1通过紧凑代码表示建模序列帧相关性,是否能提升自监督视觉里程计中的深度估计性能?
  • RQ2用基于结构感知的对抗性学习替代像素级光度损失,是否能带来更准确的深度和位姿估计?
  • RQ3通过LSTM引入长期时间上下文,能在多大程度上减少长序列中的尺度漂移和估计误差?
  • RQ4与标准自监督VO方法相比,基于GAN的图像生成与图像合成相结合,性能提升程度如何?
  • RQ5结合对抗性训练与轨迹一致性的自监督框架,能否实现与监督方法相当的性能?

主要发现

  • 所提方法在KITTI和Cityscapes数据集上达到最先进性能,在深度和位姿估计方面均优于现有自监督方法。
  • 在完整模型(代码 + GAN + LSTM + TC)下,KITTI 50m序列的深度估计平均绝对误差(MAE)降低至0.146,相比基线提升59%。
  • 序列09的位姿估计误差降低至0.0030,序列10降低至0.0029,显著优于先前的自监督基线方法。
  • 消融实验表明,每个组件(代码、LSTM、GAN、轨迹一致性)均对性能提升有贡献,其中GAN和LSTM带来的提升最大。
  • 该方法生成的深度图更清晰,能更好保留细粒度细节(如电线杆、边缘),并避免在无纹理或颜色相似区域产生错误的深度预测。
  • 尽管仅使用未标注图像序列,该模型性能仍可与监督方法相媲美,证明了对抗性自监督的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。