Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Learning of Depth and Ego-motion with Differentiable Bundle Adjustment

Yunxiao Shi, Jing Zhu|arXiv (Cornell University)|Sep 28, 2019
Advanced Vision and Imaging参考文献 61被引用数 9
ひとこと要約

本論文では、特徴量-計測誤差の最小化によりマルチビュー幾何制約を強制する微分可能Bundle Adjustment(BA)層を用いた自己教師付き手法を提案し、単眼深度と自己運動推定を実現する。写真的一致性損失で訓練されたエンドツーエンドネットワークに微分可能BAを統合することで、KITTIおよびCityscapesで最先端の性能を達成し、自己教師付き単眼手法およびステレオベースの教師あり手法を上回る。

ABSTRACT

Learning to predict scene depth and camera motion from RGB inputs only is a challenging task. Most existing learning based methods deal with this task in a supervised manner which require ground-truth data that is expensive to acquire. More recent approaches explore the possibility of estimating scene depth and camera pose in a self-supervised learning framework. Despite encouraging results are shown, current methods either learn from monocular videos for depth and pose and typically do so without enforcing multi-view geometry constraints between scene structure and camera motion, or require stereo sequences as input where the ground-truth between-frame motion parameters need to be known. In this paper we propose to jointly optimize the scene depth and camera motion via incorporating differentiable Bundle Adjustment (BA) layer by minimizing the feature-metric error, and then form the photometric consistency loss with view synthesis as the final supervisory signal. The proposed approach only needs unlabeled monocular videos as input, and extensive experiments on the KITTI and Cityscapes dataset show that our method achieves state-of-the-art results in self-supervised approaches using monocular videos as input, and even gains advantage to the line of methods that learns from calibrated stereo sequences (i.e. with pose supervision).

研究の動機と目的

  • ラベルなし単眼動画から教師なしで深度と自己運動を学習する課題に対処すること。
  • 自己教師付きフレームワーク内で、3次元シーン構造とカメラ運動の間のマルチビュー幾何的一致性を強制すること。
  • シーン構造と運動からの誤差を逆伝播可能にする微分可能BAを組み込むことで、構造からモーション(SfM)タスクの特徴量学習を向上させること。
  • 真値ポーズの教師付きステレオ手法に匹敵する性能を達成すること。

提案手法

  • 本手法は、マルチビュー画像特徴量間の特徴量-計測誤差を最小化することで、深度とカメラポーズを同時に最適化する微分可能Bundle Adjustment(BA)層を用いる。
  • Levenberg-Marquardtアルゴリズムにおける非微分可能論理を置き換えるために、反復回数を固定し、ドレイン係数λを予測するマルチレイヤーパーセプトロン(MLP)を用いることで、BA層を微分可能にしている。
  • 画像特徴量は共有エンコーダから抽出され、微分可能BA層の入力として使用され、各画素の最適化済み深度およびカメラ運動の4×4変換行列が出力される。
  • 最適化済み深度とポーズを用いた微分可能画像ワープを介して写真的一致性損失が構築され、エンドツーエンド学習が可能になる。
  • ネットワークは、真値深度やポーズが不要なラベルなしデータのみを用いて、単眼動画シーケンスで学習される。
  • フレームワークはカメラ内部パrameterを既知と仮定しているが、ラベル付き深度やポーズデータは必要とせず、完全に自己教師付き学習が可能である。

実験結果

リサーチクエスチョン

  • RQ1微分可能バndlge Adjustmentを用いることで、マルチビュー幾何制約を強制することにより、単眼動画からの自己教師付き深度および自己運動推定が向上するか?
  • RQ2特徴量-計測誤差に基づくBAと、写真的一致性または幾何的BAとを比較した場合、特徴量学習および性能にどのような差が生じるか?
  • RQ3自己教師付き単眼手法が、真値ポーズの教師付きステレオ手法に匹敵する性能を達成できるか?
  • RQ4微分可能BA層が、3次元シーン構造および運動推定のための特徴表現をどの程度向上させるか?

主な発見

  • 提案手法は、KITTI 2015およびCityscapesベンチマークにおいて、自己教師付き単眼手法の中で最先端の性能を達成した。
  • KITTIオドメトリスプリットにおいて、シーケンス09では0.012 ± 0.007、シーケンス10では0.011 ± 0.007の絶対軌道誤差(ATE)を達成し、ORB-SLAM(短縮版)を上回り、フルORBSLAMと同等の性能を示した。
  • 本手法は、従来の非教師あり単眼アプローチを一貫して上回り、真値ポーズの教師付きステレオ手法ですら上回る性能を示した。
  • 定性的な結果では、動く物体がある動的シーンにおいても、杭や街頭看板のような細い構造物の予測が堅牢に行われた。
  • Cityscapesで学習したモデルをKITTIでファインチューニングすることで性能が向上し、ドメイン間での優れた一般化能力を示した。
  • 微分可能BA層により、幾何的制約の誤差が効果的に逆伝播され、特徴量学習が向上し、深度およびポーズ推定の性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。