Skip to main content
QUICK REVIEW

[論文レビュー] SelfVIO: Self-Supervised Deep Monocular Visual-Inertial Odometry and Depth Estimation

Yasin Almalıoğlu, Mehmet Turan|arXiv (Cornell University)|Nov 22, 2019
Advanced Vision and Imaging被引用数 12
ひとこと要約

SelfVIOは、ラベルなしのRGBシーケンスとIMUデータから、6自由度カメラの運動と密な深度マップを同時に予測する自己教師付き深層学習フレームワークを提案する。敵対的学習と自己適応センサーフュージョンを活用することで、KITT、EuRoC、Cityscapesデータセットで最先端の性能を達成し、真値ラベル、IMUの内部パラメータ、センサ間の外部キャリブレーションを一切必要としない。

ABSTRACT

In the last decade, numerous supervised deep learning approaches requiring large amounts of labeled data have been proposed for visual-inertial odometry (VIO) and depth map estimation. To overcome the data limitation, self-supervised learning has emerged as a promising alternative, exploiting constraints such as geometric and photometric consistency in the scene. In this study, we introduce a novel self-supervised deep learning-based VIO and depth map recovery approach (SelfVIO) using adversarial training and self-adaptive visual-inertial sensor fusion. SelfVIO learns to jointly estimate 6 degrees-of-freedom (6-DoF) ego-motion and a depth map of the scene from unlabeled monocular RGB image sequences and inertial measurement unit (IMU) readings. The proposed approach is able to perform VIO without the need for IMU intrinsic parameters and/or the extrinsic calibration between the IMU and the camera. estimation and single-view depth recovery network. We provide comprehensive quantitative and qualitative evaluations of the proposed framework comparing its performance with state-of-the-art VIO, VO, and visual simultaneous localization and mapping (VSLAM) approaches on the KITTI, EuRoC and Cityscapes datasets. Detailed comparisons prove that SelfVIO outperforms state-of-the-art VIO approaches in terms of pose estimation and depth recovery, making it a promising approach among existing methods in the literature.

研究の動機と目的

  • 教師付きビジュアルインertリアルオドメトリ(VIO)および深度推定におけるデータ不足問題に対処し、大規模なラベル付きデータセットの必要性を排除すること。
  • モノクローラルRGBシーケンスと生のIMU測定値から、6自由度の自己運動と密な深度マップを同時に推定する自己教師付き学習フレームワークの開発。
  • IMUの内部パラメータやカメラとIMU間の外部キャリブレーションに依存しないようにし、これらをエンドツーエンド学習によって暗黙的に学習すること。
  • 低テクスチャや照明の変動といった困難な視覚状況、センサの不整合、時間遅延に対して高いロバストネスを実現すること。
  • ループクロージャーや教師付き監視を一切用いずに、複数のベンチマークデータセットで、ポーズ推定および深度回復の両面で最先端の性能を示すこと。

提案手法

  • 空間変換器を用いた特徴アライメントを統合した、エンドツーエンドで学習可能なアーキテクチャを採用し、深度推定、ビジュアルオドメトリ、インertリアルオドメトリ、ビジュアルインエントリアルフュージョンモジュールを統合。
  • 予測された深度マップの現実性を向上させ、フレーム間の特徴一貫性を強化するために、敵対的学習を採用。
  • 自己適応的ビジュアルインエントリアルフュージョンは、運動ダイナミクスに応じて視覚的およびインエントリアル特徴の重みを動的に調整し、異なる運動状態下でもロバストネスを向上。
  • 訓練中に光度的および幾何的整合性を監視信号として活用し、画像再構成とポーズ一貫性を用いて深度および運動予測を監視。
  • 生成画像と実画像を区別するためのターゲット識別モジュールを導入し、敵対的フィードバックにより深度およびポーズ予測の品質を向上。
  • ネットワークは、真値ポーズや深度マップを一切必要とせず、ラベルなしのモノクローラル画像シーケンスと生のIMU測定値のみで学習される。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしデータに依存しない自己教師付き深層学習フレームワークは、競争力のある6自由度自己運動および深度推定性能を達成できるか?
  • RQ2本手法は、時間的遅延やカメラとIMU間の空間的ずれを含むセンサの不整合に対して、どの程度ロバストか?
  • RQ3敵対的学習は、自己教師付き設定下でモノクローラル深度推定および運動予測の品質をどの程度向上できるか?
  • RQ4IMUの内部パラメータや外部キャリブレーションの事前知識なしに、エンドツーエンドでビジュアルインエントリアルフュージョンを有効に学習できるか?
  • RQ5本手法は、ポーズ精度および深度再構成品質の両面で、最先端の教師ありおよび非教師ありVIO、VO、VSLAMシステムを上回るか?

主な発見

  • SelfVIOは、KITTI、EuRoC、Cityscapesデータセットにおいて、ポーズ推定および深度回復の両面で、最先端のVIO、VO、VSLAM手法を上回る性能を達成した。
  • 視覚的およびインエントリアルセンサ間の時間的・空間的オフセットが異なる条件下でも、相対的並進誤差および回転誤差が最小であり、緩いキャリブレーションにも強いロバストネスを示した。
  • 方向のオフセットが最大30度まででも、誤差率が低く保たれ、センサの不整合を効果的に学習していることが示された。
  • 低テクスチャや困難な照明状況のシーケンスにおいても、SelfVIOは安定した性能を維持し、このような条件下で発散するフィルタベース手法(OKVIS や VINS-Mono)を上回った。
  • IMUデータが提供されない状況でも、既存のモノクローラル深層学習アプローチを上回る優れた性能を発揮した。
  • アブレーションスタディにより、敵対的学習と自己適応的フュージョンが、深度マップ品質および運動推定精度を顕著に向上させていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。