Skip to main content
QUICK REVIEW

[論文レビュー] WGANVO: Monocular Visual Odometry based on Generative Adversarial Networks

Javier Cremona, Lucas C. Uzal|arXiv (Cornell University)|Jul 27, 2020
Robotics and Sensor-Based Localization参考文献 31被引用数 5
ひとこと要約

WGANVOは、勾配ペナルティ付きワサーラインGAN(WGAN-GP)を用いたモノクローラルビジョウドメトリ(VO)手法であり、画像ペアからカメラポーズをエンド・ツー・エンドに回帰する。教師ありの敵対的訓練と教師ありのポーズ回帰を組み合わせることで、事前の知識がなくても絶対的スケールを回復可能であり、KITTIデータセットでリアルタイム性能と競争力のある精度を達成した。

ABSTRACT

In this work we present WGANVO, a Deep Learning based monocular Visual Odometry method. In particular, a neural network is trained to regress a pose estimate from an image pair. The training is performed using a semi-supervised approach. Unlike geometry based monocular methods, the proposed method can recover the absolute scale of the scene without neither prior knowledge nor extra information. The evaluation of the system is carried out on the well-known KITTI dataset where it is shown to work in real time and the accuracy obtained is encouraging to continue the development of Deep Learning based methods.

研究の動機と目的

  • 幾何学的アプローチに内在するスケールのあいまいさを克服する深層学習ベースのモノクローラルビジョウドメトリシステムの開発。
  • 生成的敵対的ネットワークを活用して、幾何的事前知識なしに教師なし特徴学習を実現するとともに、教師ありポーズ回帰により絶対的スケールの回復を可能にする。
  • 外部センサーや事前のキャリブレーション知識を必要とせず、KITTIなどの標準ベンチマークでリアルタイム推論と高い耐障害性を達成すること。
  • WGAN-GPが視覚オドメトリの安定した訓練フレームワークとして、敵対的信号と教師あり信号を統合する有効性を検証すること。
  • 今後の研究においてカメラパラメータの統合を検討し、異なるカメラ間でのモデル一般化を可能にすること。

提案手法

  • 本手法は、実際の画像ペアと生成されたペアを区別するように訓練されるWGAN-GPアーキテクチャを採用し、高レベルの視覚的表現を学習する。
  • 同じディスクラミネーターを、画像ペアから相対的カメラポーズ(回転と並進)を回帰するために再利用し、エンド・ツー・エンドの訓練を可能にする。
  • 教師ありポーズ回帰損失(KITTIデータセットの真値ポーズを用いて)とWGAN-GPの敵対的損失を組み合わせたセミ教師付き訓練スキームを採用する。
  • ポーズ回帰損失は、Huber損失($L_{\beta}$)またはスムーズL1損失($L_p$)のいずれかで実装され、最適な性能を得るためにハイパーパrameterが調整されている。
  • ネットワークはKITTIシーケンスの画像ペアで訓練され、SIFTを用いたステレオペアからの特徴抽出と、三角測量およびDLTアルゴリズムによる3次元点の再構成が行われる。
  • 訓練は2段階に分かれて実施される:10,000イテレーションの敵対的事前訓練の後、Adamオプティマイザを用いた40,000イテレーションの教師ありファインチューニング(学習率$10^{-4}$)が実施される。

実験結果

リサーチクエスチョン

  • RQ1GANベースのアーキテクチャは、明示的な幾何的事前知識なしに、十分な視覚的表現を学習し、正確なモノクローラルビジョウドメトリを可能にするか?
  • RQ2敵対的信号と教師あり信号を組み合わせたセミ教師付き訓練は、モノクローラルVOにおけるポーズ推定精度とスケール回復に寄与するか?
  • RQ3損失関数の選択(Huber vs. スムーズL1)が、実世界のシーケンスにおけるモデルの性能と耐障害性に与える影響は何か?
  • RQ4提案手法は、KITTIなどの標準ベンチマークで競争力のある精度を維持しながら、リアルタイム推論を達成できるか?
  • RQ5モデルはどの程度異なるカメラ設定に一般化可能であり、キャリブレーション情報を統合することでその性能が向上するか?

主な発見

  • 提案手法はKITTIデータセットでリアルタイム推論を達成し、全シーケンスでフレーム処理時間が100ms未満で安定している。
  • 事前の知識や追加センサーを必要とせず、絶対的スケールを正常に回復しており、従来のモノクローラルVOの主な制限要因を克服した。
  • $L_{\beta}$と$L_p$の両損失関数が同等の性能を示し、$L_{\beta}$はハイパーパrameter($\beta=100$)の調整が必要である一方、$L_p$は調整が不要なためより耐障害性に優れている。
  • シーケンス00において、100mあたりの並進誤差は10.54%、回転誤差は3.22°であり、他のシーケンスに対しても同様の性能を示した。
  • セミ教師付き訓練スキームは、敵対的事前訓練により未ラベルデータを有効活用し、特徴表現の向上と一般化性能の向上に寄与した。
  • 結果から、GANベースのアーキテクチャが視覚オドメトリに効果的に適応可能であり、今後のエンド・ツー・エンドの深層学習アプローチに期待が持てる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。