[論文レビュー] DeepVIO: Self-supervised Deep Learning of Monocular Visual Inertial Odometry using 3D Geometric Constraints
DeepVIOは、ステレオシーケンスから得られる3次元幾何的制約(3次元オプティカルフローおよび6自由度ポーズ)を活用して、2次元オプティカルフロー、IMUプリ統合、トラジェクトリーフュージョンを自己教師付きで監視する、エンドツーエンドのモノクローラルビジュアルインertリアルオドメトリ(VIO)ネットワークを提案する。KITTIおよびEuRoCデータセットにおいて、キャリブレーション誤差、非同期データ、フレーム欠落といった困難な条件下でも、学習ベースおよび伝統的なVIO手法を上回る最先端の精度と耐性を達成している。
This paper presents an self-supervised deep learning network for monocular visual inertial odometry (named DeepVIO). DeepVIO provides absolute trajectory estimation by directly merging 2D optical flow feature (OFF) and Inertial Measurement Unit (IMU) data. Specifically, it firstly estimates the depth and dense 3D point cloud of each scene by using stereo sequences, and then obtains 3D geometric constraints including 3D optical flow and 6-DoF pose as supervisory signals. Note that such 3D optical flow shows robustness and accuracy to dynamic objects and textureless environments. In DeepVIO training, 2D optical flow network is constrained by the projection of its corresponding 3D optical flow, and LSTM-style IMU preintegration network and the fusion network are learned by minimizing the loss functions from ego-motion constraints. Furthermore, we employ an IMU status update scheme to improve IMU pose estimation through updating the additional gyroscope and accelerometer bias. The experimental results on KITTI and EuRoC datasets show that DeepVIO outperforms state-of-the-art learning based methods in terms of accuracy and data adaptability. Compared to the traditional methods, DeepVIO reduces the impacts of inaccurate Camera-IMU calibrations, unsynchronized and missing data.
研究の動機と目的
- 真のトラジェクトリデータに依存しない自己教師付きディープラーニングフレームワークを用いたモノクローラルビジュアルインエータリアルオドメトリの開発。
- ステレオシーケンスからの3次元幾何的制約を活用することで、テクスチャが乏しく、動的で困難な環境における耐性の向上。
- 正確なカメラ-IMUキャリブレーションへの依存を低減し、非同期または欠落したセンサデータに対処する。
- 密結合VIOにインspiredされたフィードバックベースのバイアス更新メカニズムにより、IMUポーズ推定を向上。
- 明示的なループクロージャーやリロケーションパイプラインを必要としない絶対的トラジェクトリ推定の達成。
提案手法
- ステレオシーケンスを用いて、2次元オプティカルフロー、IMUプリ統合、トラジェクトリーフュージョンの自己教師付き監視信号として、合成された3次元オプティカルフローと6自由度エゴモーションを生成する。
- 2次元オプティカルフローは3次元オプティカルフローの投影によって制約され、アペルチャ問題が軽減され、動的・テクスチャが乏しい領域での精度が向上する。
- LSTMベースのIMUプリ統合ネットワークは、エゴモーション整合性損失を用いて訓練され、IMUポーズ推定の精度が向上する。
- 視覚的およびIMU特徴を統合するフュージョンネットワークでは、ポーズフィードバックを用いてジャイロスコープおよび加速度計バイアスをリアルタイムで更新する。
- センサノイズおよびバイアスドリフトに対して耐性を高めるために、動的にバイアスを補正する新しいIMUステータス更新スキームを採用する。
- 全ネットワークは、光度的および幾何的整合性損失を用いて、自己教師付きでエンドツーエンドに訓練される。
実験結果
リサーチクエスチョン
- RQ1ステレオシーケンスからの3次元幾何的制約は、自己教師付きモノクローラルVIOシステムにおける2次元オプティカルフロー推定に効果的に監視信号として機能するか?
- RQ23次元オプティカルフローおよび6自由度ポーズを組み込むことで、動的物体およびテクスチャが乏しい環境への耐性がどの程度向上するか?
- RQ3提案されたIMUバイアス更新メカニズムは、ノイズが多いまたは非同期なIMUデータ下でもポーズ推定精度をどの程度向上させるか?
- RQ4自己教師付きディープラーニングアプローチは、真のトラジェクトリ監視なしにモノクローラルVIOで最先端のパフォーマンスを達成できるか?
- RQ5不正確なキャリブレーション、フレーム欠落、センサ非同期といった現実世界の課題に対して、システムはどの程度の性能を示すか?
主な発見
- KITTIデータセットにおいて、10°のカメラ-IMUキャリブレーション誤差下で、DeepVIOは相対的移動誤差0.77%、回転誤差1.11%を達成し、VINS(1.38%および2.88%)を上回った。
- 20msのIMUタイムスタンプオフセット下でも、DeepVIOは相対的移動誤差0.59%、回転誤差1.02%を維持したのに対し、VINSは0.65%および2.93%であった。
- 90%のIMUフレーム欠落下では、DeepVIOは移動誤差0.75%、回転誤差0.93%を達成し、VINS(0.88%および2.94%)を著しく上回った。
- 50%の画像フレーム欠落下でも、DeepVIOは移動誤差0.89%、回転誤差1.06%を維持したが、VINSはそれぞれ0.37%および3.02%に低下した。
- 合成された3次元オプティカルフローにより、動的物体における2次元フロー誤差はFlownet2と比較して13.62ピクセルから6.31ピクセルに低下し、耐性の向上が示された。
- IMUバイアス更新メカニズムにより、特に高速回転時におけるドリフトが顕著に低減され、ベースラインVIO-Nよりも精度が向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。