Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Deep Visual Odometry with Online Adaptation

Shunkai Li, Xin Wang|arXiv (Cornell University)|May 13, 2020
Robotics and Sensor-Based Localization参考文献 42被引用 5
一句话总结

本文提出了一种结合在线元学习与特征对齐的自监督深度视觉里程计方法,以实现实时适应未见环境。通过利用convLSTM实现时间记忆并进行动态特征分布对齐,该网络在无需真实标签的情况下实现了快速、连续的适应,在未见的室外、室内及合成数据集上,相对位姿误差相比SOTA方法最高降低30%,同时以32 FPS的帧率运行。

ABSTRACT

Self-supervised VO methods have shown great success in jointly estimating camera pose and depth from videos. However, like most data-driven methods, existing VO networks suffer from a notable decrease in performance when confronted with scenes different from the training data, which makes them unsuitable for practical applications. In this paper, we propose an online meta-learning algorithm to enable VO networks to continuously adapt to new environments in a self-supervised manner. The proposed method utilizes convolutional long short-term memory (convLSTM) to aggregate rich spatial-temporal information in the past. The network is able to memorize and learn from its past experience for better estimation and fast adaptation to the current frame. When running VO in the open world, in order to deal with the changing environment, we propose an online feature alignment method by aligning feature distributions at different time. Our VO network is able to seamlessly adapt to different environments. Extensive experiments on unseen outdoor scenes, virtual to real world and outdoor to indoor environments demonstrate that our method consistently outperforms state-of-the-art self-supervised VO baselines considerably.

研究动机与目标

  • 为解决自监督视觉里程计中的领域偏移问题,即模型在未见环境中的性能显著下降。
  • 实现在无真实标签数据访问条件下的视觉里程计网络对变化环境的持续、实时适应。
  • 通过利用过往经验与动态特征对齐,提升在线适应过程中的估计精度与收敛速度。
  • 开发一种元学习框架,将在线适应整合进训练目标,以在多样化场景中实现稳健性能。

提出的方法

  • 该方法采用卷积循环神经网络(convLSTM)对过去帧的滑动窗口内空间-时间依赖关系进行编码,使网络能够保留并利用长期经验,从而提升位姿与深度估计性能。
  • 提出一种新颖的在线元学习方案,模型通过基于当前及历史数据优化未来帧性能,实现对新环境的快速适应。
  • 在时间维度上应用特征对齐,以减少因光照、纹理或场景动态变化导致的特征分布偏移,从而提升开放世界环境下的泛化能力。
  • 网络采用自监督方式训练,利用光度一致性损失,避免在推理过程中依赖真实位姿或深度标签。
  • 系统在单张GPU上以32 FPS的帧率实时运行,支持部署过程中的在线优化。
  • 采用大小为N=15的滑动窗口,在适应速度与精度之间实现平衡,性能在此窗口大小下达到峰值。

实验结果

研究问题

  • RQ1自监督视觉里程计网络是否能在无真实标签数据的情况下,实现对未见环境的快速且稳定的适应?
  • RQ2通过convLSTM引入过往经验,能否提升开放世界环境中估计精度与适应速度?
  • RQ3在线特征分布对齐在多大程度上可缓解视觉里程计因领域偏移导致的性能下降?
  • RQ4与朴素的在线微调相比,在线元学习在收敛速度与最终精度方面表现如何?

主要发现

  • 所提方法在TUM-RGBD fr3/str_ntex_near序列上实现了0.128 m/s的相对位姿误差(RPE),优于SAVO(0.204 m/s)与GeoNet(0.198 m/s),展现出更优的泛化能力。
  • 在KITTI数据集上,当测试于未见序列时,该方法将平移误差从基线的11.65 m/s降低至4.79 m/s,表现出强大的零样本泛化能力。
  • 消融实验证实,结合convLSTM、特征对齐与元学习可获得最佳性能,相比基线误差降低58%。
  • 该方法在GeForce 1080Ti上以32 FPS运行,支持实时在线适应,适用于实际部署。
  • 适应性能最优的滑动窗口大小为N=15,窗口过大将导致收敛变慢且精度下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。