Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Photometric Loss for Self-Supervised Ego-Motion Estimation

Tianwei Shen, Zixin Luo|arXiv (Cornell University)|Feb 25, 2019
Advanced Vision and Imaging参考文献 51被引用数 6
ひとこと要約

本稿では、画像のコントラスト損失に幾何的制約を組み込むことで、自己教師付き学習フレームワークを用いた単眼自己走行推定の性能を向上させる手法を提案する。特徴マッチングと視差幾何学を用いて、写真的損失の限界を補完し、KITTIデータセットにおいて最先端の性能を達成した。特に、ループクロージャーを用いない単眼 ORB-SLAM2 よりも、シーケンス 09 で優れた性能を示した。

ABSTRACT

Accurate relative pose is one of the key components in visual odometry (VO) and simultaneous localization and mapping (SLAM). Recently, the self-supervised learning framework that jointly optimizes the relative pose and target image depth has attracted the attention of the community. Previous works rely on the photometric error generated from depths and poses between adjacent frames, which contains large systematic error under realistic scenes due to reflective surfaces and occlusions. In this paper, we bridge the gap between geometric loss and photometric loss by introducing the matching loss constrained by epipolar geometry in a self-supervised framework. Evaluated on the KITTI dataset, our method outperforms the state-of-the-art unsupervised ego-motion estimation methods by a large margin. The code and data are available at https://github.com/hlzz/DeepMatchVO.

研究の動機と目的

  • 反射面、オクルージョン、非ラムベールト面の影響により、写真的損失の誤差が蓄積されるという自己教師付き自己走行推定の限界を解消すること。
  • 特徴マッチと視差幾何学からの暗黙の幾何的教師信号を統合することで、深度推定とポーズ推定のロバスト性と精度を向上させること。
  • ピクセル単位の写真的誤差とは異なり、中間的な幾何的表現(例:ペアワイズマッチング)が写真的アーティファクトに対してより耐性があることを示すこと。
  • ループクロージャーや複雑な補助教師信号を用いなくても、最先端の自己教師付き手法を上回る視覚オドメトリの性能を達成すること。
  • シンプルでスケーラブルなアーキテクチャを用いてエンドツーエンド学習を可能とし、実世界のシーケンスにおいて、複雑なベースラインを上回ること。

提案手法

  • 予測された特徴マッチと視差幾何学的制約の整合性を強制する幾何的マッチング損失を導入すること。
  • 隣接フレームから特徴を抽出するためのシアンプル・CNNを用い、それらの間でペアワイズマッチングを計算すること。
  • 予測された相対ポーズから導出される基本行列を用いて、マッチングされた点が対応する視差線上に位置するように視差幾何学を強制すること。
  • 幾何的マッチング損失を標準的な写真的再構成損失と組み合わせ、マルチタスク学習フレームワークを構築すること。
  • パーセンタイルベースのマスクを適用して、写真的損失における外れ値の影響を低減し、学習の安定性を向上させること。
  • 予測された相対ポーズを連結し、運動平均を適用して全軌道を再構築し、評価に用いること。

実験結果

リサーチクエスチョン

  • RQ1特徴マッチングから導出される幾何的制約は、写真的損失のみに依存する手法と比較して、自己教師付き自己走行推定のロバスト性を向上させることができるか?
  • RQ2オクルージョンや反射面を含む困難な実世界シーケンスにおいて、損失関数に視差幾何学を組み込むことで性能にどのような影響を与えるか?
  • RQ3明示的な幾何的教師信号を必要としない中間的な幾何的表現(例:ペアワイズマッチング)が、深度推定とポーズ推定にどれほど寄与するか?
  • RQ4KITTI のような標準ベンチマークにおいて、提案手法は最先端の自己教師付き手法を上回る性能を示すか、特に全軌道推定において?
  • RQ5幾何的教師信号を備えたシンプルなエンドツーエンドネットワークは、ループクロージャーを備えない従来の手法(例:ORB-SLAM2)を上回ることができるか?

主な発見

  • 提案手法は、KITTI シーケンス 09 において、中央値絶対軌道誤差(ATE)が 18.36 メートルを達成し、ループクロージャーを用いない単眼 ORB-SLAM2(38.56 メートル)を上回った。
  • シーケンス 10 では、ATE が 16.15 メートルを達成し、ベースライン手法 [50] の 23.78 メートルを上回り、より複雑な手法と同等の性能を示した。
  • マッチング損失は、ベースライン自己教師付き手法 [50] を大幅に改善し、光流や ICP を用いた教師信号を用いる手法でさえも上回った。
  • 短いスニペット評価(例:3 フレームまたは 5 フレームのウィンドウ)においても優れた性能を示し、シーケンス 09 のスニペット ATE は 0.0089 ± 0.0054 を記録した。
  • 大きな回転運動の処理には限界を示しており、KITTI のトレーニングセットに回転データが不足していることが原因とされる。
  • 入力解像度を小さく(128×416)し、シンプルなアーキテクチャを採用しているにもかかわらず、最先端の性能を達成しており、今後の向上の可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。