Skip to main content
QUICK REVIEW

[论文解读] SelfVIO: Self-Supervised Deep Monocular Visual-Inertial Odometry and Depth Estimation

Yasin Almalıoğlu, Mehmet Turan|arXiv (Cornell University)|Nov 22, 2019
Advanced Vision and Imaging被引用 12
一句话总结

SelfVIO 提出了一种用于单目视觉-惯性里程计和深度估计的自监督深度学习框架,能够从无标签的 RGB 序列和 IMU 数据中联合预测 6-DoF 相机运动与密集深度图。通过利用对抗性训练和自适应传感器融合,该方法在 KITTI、EuRoC 和 Cityscapes 数据集上实现了最先进性能,且无需真实标签、IMU 内在参数或传感器间的外部标定。

ABSTRACT

In the last decade, numerous supervised deep learning approaches requiring large amounts of labeled data have been proposed for visual-inertial odometry (VIO) and depth map estimation. To overcome the data limitation, self-supervised learning has emerged as a promising alternative, exploiting constraints such as geometric and photometric consistency in the scene. In this study, we introduce a novel self-supervised deep learning-based VIO and depth map recovery approach (SelfVIO) using adversarial training and self-adaptive visual-inertial sensor fusion. SelfVIO learns to jointly estimate 6 degrees-of-freedom (6-DoF) ego-motion and a depth map of the scene from unlabeled monocular RGB image sequences and inertial measurement unit (IMU) readings. The proposed approach is able to perform VIO without the need for IMU intrinsic parameters and/or the extrinsic calibration between the IMU and the camera. estimation and single-view depth recovery network. We provide comprehensive quantitative and qualitative evaluations of the proposed framework comparing its performance with state-of-the-art VIO, VO, and visual simultaneous localization and mapping (VSLAM) approaches on the KITTI, EuRoC and Cityscapes datasets. Detailed comparisons prove that SelfVIO outperforms state-of-the-art VIO approaches in terms of pose estimation and depth recovery, making it a promising approach among existing methods in the literature.

研究动机与目标

  • 为解决监督式视觉-惯性里程计(VIO)和深度估计中的数据稀缺问题,消除对大规模标注数据集的依赖。
  • 开发一种自监督学习框架,能够从单目 RGB 序列和原始 IMU 读数中联合估计 6-DoF 自运动和密集深度图。
  • 通过端到端训练隐式学习 IMU 内在参数和相机与 IMU 之间的外部标定,从而消除对精确参数的依赖。
  • 提升对传感器标定错误、时间偏移以及低纹理和光照变化等挑战性视觉条件的鲁棒性。
  • 在无需回环检测或监督信号的情况下,于多个基准数据集上实现姿态估计和深度恢复的最先进性能。

提出的方法

  • 该框架采用端到端可训练的架构,集成了深度估计、视觉里程计、惯性里程计和视觉-惯性融合模块,并通过空间变换器实现特征对齐。
  • 采用对抗性训练以提升预测深度图的真实感,并增强帧间特征的一致性。
  • 自适应视觉-惯性融合模块根据运动动态动态加权视觉与惯性特征,从而在不同运动条件下提升鲁棒性。
  • 在训练过程中利用光度一致性和几何一致性作为监督信号,通过图像重建和姿态一致性来监督深度与运动预测。
  • 引入目标判别模块以区分真实图像与生成图像,通过对抗性反馈提升深度与姿态预测的质量。
  • 网络仅使用无标签的单目图像序列和原始 IMU 测量值进行训练,无需真实姿态或深度图。

实验结果

研究问题

  • RQ1自监督深度学习框架是否能在不依赖标注数据的情况下实现具有竞争力的 6-DoF 自运动与深度估计性能?
  • RQ2所提出方法对传感器标定错误(包括视觉与惯性传感器间的时间偏移和空间错位)的鲁棒性如何?
  • RQ3在自监督设置下,对抗性训练在多大程度上能提升单目深度估计与运动预测的质量?
  • RQ4是否能够无需 IMU 内在参数或外部标定先验知识,通过端到端训练有效学习视觉-惯性融合?
  • RQ5所提出方法在姿态精度和深度重建质量方面是否优于最先进监督式与无监督 VIO、VO 和 VSLAM 系统?

主要发现

  • SelfVIO 在 KITTI、EuRoC 和 Cityscapes 数据集上的姿态估计与深度恢复精度方面,均优于最先进 VIO、VO 和 VSLAM 方法。
  • 该方法在视觉与惯性传感器间存在各种时间偏移和位移偏移时,实现了最低的相对平移与旋转误差,表现出对松散标定的强鲁棒性。
  • 即使在高达 30 度的朝向偏移下,SelfVIO 仍能保持低误差率,表明其有效学习了传感器错位。
  • 在低纹理和挑战性光照条件下,SelfVIO 保持了稳定性能,优于在类似条件下会发散的滤波方法(如 OKVIS 和 VINS-Mono)。
  • 即使在未提供 IMU 数据的情况下,该模型仍能实现优越性能,超越现有单目深度学习方法在深度与运动估计方面的表现。
  • 消融实验证实,对抗性训练与自适应融合显著提升了深度图质量与运动估计精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。