Skip to main content
QUICK REVIEW

[論文レビュー] TartanVO: A Generalizable Learning-based VO

Wenshan Wang, Yaoyu Hu|arXiv (Cornell University)|Oct 31, 2020
Robotics and Sensor-Based Localization参考文献 44被引用数 6
ひとこと要約

TartanVO は、微調整を必要とせず、TartanAir からの合成データと、スケールアップ損失や内部パrameterレイヤーといった新しいアーキテクチャ的要素を活用することで、多様なデータセットおよび実世界のシナリオに一般化する学習ベースのビジョウオドメトリ(VO)モデルである。KITTI、EuRoC、および実世界のRealSenseデータにおいて、挑戦的な軌道で幾何学ベースの手法を上回り、特徴が乏しくかつ動的な環境でも最先端の耐障害性を示している。

ABSTRACT

We present the first learning-based visual odometry (VO) model, which generalizes to multiple datasets and real-world scenarios and outperforms geometry-based methods in challenging scenes. We achieve this by leveraging the SLAM dataset TartanAir, which provides a large amount of diverse synthetic data in challenging environments. Furthermore, to make our VO model generalize across datasets, we propose an up-to-scale loss function and incorporate the camera intrinsic parameters into the model. Experiments show that a single model, TartanVO, trained only on synthetic data, without any finetuning, can be generalized to real-world datasets such as KITTI and EuRoC, demonstrating significant advantages over the geometry-based methods on challenging trajectories. Our code is available at https://github.com/castacks/tartanvo.

研究の動機と目的

  • 微調整を必要とせず、多様な実世界および合成データセットに一般化する学習ベースのビジョウオドメトリモデルの開発。
  • 既存の学習ベースのVOモデルの限界、特にデータの多様性が不十分でスケールおよび内部パrameterの曖昧さを適切に処理できない点を是正すること。
  • 低テクスチャ、動的、高運動環境などの挑戦的なビジョウオドメトリ状況における耐障害性の向上。
  • 合成データのみで訓練された1つのモデルが、KITTI や EuRoC のような実世界ベンチマークで競争力のある性能を達成できることの実証。
  • 単眼スケールの曖昧さと、異なるデータセット間でのカメラ内部パramータの変動を明示的に処理するアーキテクチャ的革新の導入。

提案手法

  • 多様で高精細かつ挑戦的な単眼シーケンスを提供する、TartanAir という合成データセットを活用。カメラの運動とシーンの変化が正確に記録されている。
  • 絶対的スケールの監視を不要とする、スケールアップ損失関数を採用。モデルが未知のスケールでの相対的カメラ運動を予測するように訓練される。
  • カメラ内部パramータをネットワークに明示的に埋め込む「内部パラメータレイヤー(IL)」を導入。これにより、異なるカメラやセンサーセットアップ間での一般化が可能になる。
  • 光-flow を中間表現として用い、モデルが変形された光-flow 特徴からカメラ運動を予測することで、運動および外観の変化に対する耐障害性が向上。
  • バックエンドの最適化や反復的精錬を一切不要としない、エンドツーエンドの教師あり学習でモデルを訓練。カメラ運動の監視を用いる。
  • 訓練中にデータオーグメンテーションとドメインランダマイゼーションを適用し、照明、テクスチャ、運動パターンの実世界の変動に対する耐障害性を強化。

実験結果

リサーチクエスチョン

  • RQ1合成データのみで訓練された学習ベースのビジョウオドメトリモデルが、微調整なしに実世界のデータセットに効果的に一般化できるか?
  • RQ2訓練データの多様性が、異なる環境や運動パターンにおける学習ベースのVOモデルの一般化性能にどのように影響するか?
  • RQ3スケールアップ損失関数が、単眼ビジョウオドメトリモデルの耐障害性と一般化性能をどの程度向上できるか?
  • RQ4カメラパラメータをネットワークに埋め込む内部パラメータレイヤーが、異なるカメラモデルや内部パラメータ設定のデータセット間での一般化を可能にするか?
  • RQ5低テクスチャ、動的、または高運動シーケンスといった挑戦的な実世界シナリオにおいて、学習ベースのVOモデルの性能は幾何学ベースの手法と比べてどの程度優れているか?

主な発見

  • TartanVO は、挑戦的な EuRoC シーケンス VR1-03 および VR2-03 で最先端の性能を達成し、それぞれ ATE が 0.64 および 1.04 であった。ORBSLAM や DSO といった幾何学ベースの手法を上回った。
  • KITTI データセットでは、MH-04 で ATE 0.74、MH-05 で ATE 0.68 を達成。SVO や ORB-SLAM を上回り、困難なシーケンスでも優れた耐障害性を示した。
  • TartanAir テストセットでは、全8シーケンスで競争力のある ATE を達成。MH004 で 1.07、MH005 で 3.19 を記録し、合成だが挑戦的なシーンへの強い一般化能力を示した。
  • 実世界の RealSense D345i IR データでは、訓練中に実際の IR データを一切見なかったにもかかわらず、3つのループ状のトラジェクトリ(運動難易度が上昇)において、T265 トラッキングカメラ出力と密接に一致するオドメトリ推定値を生成した。
  • スケールアップ損失のおかげで、訓練損失とテスト損失の差が最小限に抑えられ、訓練分布への過剰適合が抑えられ、強い一般化性能が示された。
  • 内部パラメータレイヤーのおかげで、再訓練や適応なしに、異なるカメラ内部パラメータを持つデータセット間での一般化が効果的に可能となり、同じモデルが多様な設定で良好な性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。