Skip to main content
QUICK REVIEW

[論文レビュー] Towards Scale Consistent Monocular Visual Odometry by Learning from the Virtual World

Sen Zhang, Jing Zhang|arXiv (Cornell University)|Mar 10, 2022
Advanced Vision and Imaging被引用数 4
ひとこと要約

本稿では、学習時および推論時に完全に実画像に依存するが、合成仮想データを用いてスケールの整合性を保つモノクローラルビジョオドメトリフレームワークであるVRVOを提案する。敵対的ドメイン適応、仮想ステレオ最適化目的関数、学習と最適化の間の相互強化パイプラインを組み合わせることで、KITTIおよびvKITTI2で最先端の精度を達成し、スケールドリフトを顕著に低減する。

ABSTRACT

Monocular visual odometry (VO) has attracted extensive research attention by providing real-time vehicle motion from cost-effective camera images. However, state-of-the-art optimization-based monocular VO methods suffer from the scale inconsistency problem for long-term predictions. Deep learning has recently been introduced to address this issue by leveraging stereo sequences or ground-truth motions in the training dataset. However, it comes at an additional cost for data collection, and such training data may not be available in all datasets. In this work, we propose VRVO, a novel framework for retrieving the absolute scale from virtual data that can be easily obtained from modern simulation environments, whereas in the real domain no stereo or ground-truth data are required in either the training or inference phases. Specifically, we first train a scale-aware disparity network using both monocular real images and stereo virtual data. The virtual-to-real domain gap is bridged by using an adversarial training strategy to map images from both domains into a shared feature space. The resulting scale-consistent disparities are then integrated with a direct VO system by constructing a virtual stereo objective that ensures the scale consistency over long trajectories. Additionally, to address the suboptimality issue caused by the separate optimization backend and the learning process, we further propose a mutual reinforcement pipeline that allows bidirectional information flow between learning and optimization, which boosts the robustness and accuracy of each other. We demonstrate the effectiveness of our framework on the KITTI and vKITTI2 datasets.

研究の動機と目的

  • 長距離トラジェクトリでドリフトを引き起こす最適化ベースのモノクローラルビジョオドメトリにおけるスケール不整合問題に対処すること。
  • 学習時に高価な真値ラベルやステレオデータを必要とする従来手法の制限を克服すること。
  • 容易に入手可能な仮想データから絶対的スケールを回復可能にしつつ、実世界での推論時にモノクローラル実画像に依存することを維持すること。
  • 学習と最適化の間の一方通行の情報フローによる部分最適性を解消するために、双方向フィードバックを導入すること。
  • 外部センサーやラベル付きデータに依存せずに、実世界の展開においても強固で正確なビジョオドメトリを実現すること。

提案手法

  • 基準基準距離と真値の視差が既知のステレオ仮想データとモノクローラル実画像の両方を用いて、スケールに敏感な視差ネットワークを学習する。
  • 実画像と仮想画像の特徴分布を一致させるために敵対的ドメイン適応を適用し、仮想から実へのドメインギャップを埋める。
  • 予測された視差を直接VOシステムに統合して深度を初期化し、長距離トラジェクトリにわたるスケール整合性を強制する仮想ステレオ目的関数を構築する。
  • 最適化バックエンドからのフィードバックを学習プロセスに反映できる相互強化パイプラインを提案し、耐障害性と精度を向上させる。
  • 相互強化損失のバランスをとるために、学習可能な重みハイパーパrameter $\lambda^{*}_{p}$ を導入し、最適化誤差に過剰に適合するのを防ぐ。
  • 仮想環境を活用して、低コストで大規模かつ写真的にリアルなトレーニングシーケンスを生成し、正確な幾何的ラベルを付与する。

実験結果

リサーチクエスチョン

  • RQ1実世界のステレオデータや真値ラベルを一切必要としない条件下で、仮想データを効果的に活用してモノクローラルビジョオドメトリにおける絶対的スケールを学習できるか?
  • RQ2合成仮想データと実世界の画像との間のドメインギャップをどのように最小化し、スケールに敏感な表現を転送できるか?
  • RQ3学習と最適化の間の双方向情報フローが、モノクローラルVOの精度と耐障害性をどの程度向上させるか?
  • RQ4提案手法が、推論時に完全にモノクローラル実画像のみを用いる条件下でも、KITTIのような実世界ベンチマークで最先端の性能を達成できるか?
  • RQ5仮想データから学習したスケール感度が、カメラ内部パrameterが異なる未観測の実世界データセットへどの程度一般化可能か?

主な発見

  • VRVOはKITTI Seq.09およびSeq.10で最高の回転誤差 ($r_{err}$) を達成し、Seq.10では $r_{err} = 0.280^\circ/100m$ を記録。光流やオンライン微調整を用いる手法を上回る性能を示す。
  • 相互強化モジュールを導入することで、Seq.09における並進誤差 ($t_{err}$) は $1.546\% \pm 0.021$ まで低下し、ベースライン手法を著しく上回る。
  • 相互強化パイプラインを統合することで、$t_{err}$ の標準誤差は $0.368$ から $0.021$ に低下し、耐障害性の向上が明確に示された。
  • KITTI Seq.09およびSeq.10における予測深度と真値深度の中央値スケーリング比は $1.011$ であり、優れたスケール精度を示している。
  • Make3Dのような未観測データセットへも一般化可能で、スケーリング比は $1.594$ を示したが、カメラ内部パrameterの違いにより性能が低下した。
  • アブレーションスタディにより、相互強化モジュールが不可欠であることが確認された。$\lambda^{*}_{p} = 0.01$ に設定した場合が最適性能を示し、$0.1$ などの高い値は最適化誤差に過剰適合を引き起こした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。