Skip to main content
QUICK REVIEW

[論文レビュー] ENG: End-to-end Neural Geometry for Robust Depth and Pose Estimation using CNNs

Thanuja Dharmasiri, Andrew Spek|arXiv (Cornell University)|Jul 16, 2018
Advanced Vision and Imaging参考文献 36被引用数 10
ひとこと要約

本論文では、モノクロナルまたはステレオ画像ペアから深度、オプティカルフロー、カメラポーズを同時に予測するエンドツーエンドのディープラーニングフレームワークを提案する。幾何的制約と信頼性推定を統合することで、深度予測においてNYUv2およびKITTIデータセットで最先端の性能を達成し、ポーズおよびフロー推定においても先行手法を上回る。また、オプティカルフロー予測のための学習された信頼性行列の導入が特徴である。

ABSTRACT

Recovering structure and motion parameters given a image pair or a sequence of images is a well studied problem in computer vision. This is often achieved by employing Structure from Motion (SfM) or Simultaneous Localization and Mapping (SLAM) algorithms based on the real-time requirements. Recently, with the advent of Convolutional Neural Networks (CNNs) researchers have explored the possibility of using machine learning techniques to reconstruct the 3D structure of a scene and jointly predict the camera pose. In this work, we present a framework that achieves state-of-the-art performance on single image depth prediction for both indoor and outdoor scenes. The depth prediction system is then extended to predict optical flow and ultimately the camera pose and trained end-to-end. Our motion estimation framework outperforms the previous motion prediction systems and we also demonstrate that the state-of-the-art metric depths can be further improved using the knowledge of pose.

研究の動機と目的

  • RGB画像から深度、オプティカルフロー、カメラポーズをエンドツーエンドで予測する統合的ディープラーニングフレームワークの開発を目的とする。
  • 幾何的学習を用いることで、屋内(NYUv2)および屋外(KITTI)の両データセットにおける単一画像深度予測性能の向上を目的とする。
  • 予測された深度とフローを中間の監視信号として活用することで、動き予測の精度を向上させることを目的とする。
  • オプティカルフロー予測における不確実性を表す完全な情報行列を予測する新しいニューラルネットワークモジュールの導入を目的とする。

提案手法

  • フレームワークは段階的に訓練される:まず、スキップ接続を備えた密度型CNNアーキテクチャを用いて単一画像から深度を予測する。
  • 次に、ステレオ画像ペアとその予測深度マップを入力として、オプティカルフローを生成するフローモデルが動作し、ピクセルごとの信頼性スコアを出力する。
  • ポーズ推定ブロックは、フローと深度の予測結果を用いて、相対的カメラ運動の対数表現(SE(3)変換)を回帰する。
  • 特徴の再利用と勾配の流れの改善を可能にするために、連結スキップ接続を備えた密度型ブロックアーキテクチャが全体に採用される。
  • 各タスクの重みを適切に設定したマルチタスク損失関数を用いて、エンドツーエンドで訓練される。
  • オプティカルフロー予測における不確実性を推定するための、ピクセルごとの2×2共分散行列を出力する信頼性行列予測ヘッドが導入される。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドのディープラーニングフレームワークは、段階的アプローチと比較して、深度、オプティカルフロー、カメラポーズの同時予測において、より高い精度を達成できるか?
  • RQ2予測された深度を中間の監視信号として組み込むことで、下流の動き推定タスクの性能が向上するか?
  • RQ3ニューラルネットワークが、オプティカルフロー予測のための完全な2×2情報行列を効果的に学習でき、困難な領域でのロバストネスを向上させられるか?
  • RQ4標準的なベンチマークにおいて、本手法は深度および動き推定の最先端モデルと比較してどのように評価されるか?

主な発見

  • 本モデルは、単一画像深度予測において最先端の性能を達成し、屋内(NYUv2)および屋外(KITTI)の両データセットで先行手法を上回った。
  • TUMおよびKITTIベンチマークにおいて、本フレームワークは、以前のディープラーニングベースの手法と比較して、顕著にカメラポーズ推定の精度を向上させた。
  • 予測された深度を補助的監視信号として組み込むことで、メトリック深度推定の性能に明確な向上が見られた。これは、幾何的整合性の価値を示している。
  • 本手法は、オプティカルフローの信頼性を表す完全な2×2情報行列を学習する最初の手法であり、スカラ値の信頼性スコアよりもよりロバストな不確実性推定を可能にした。
  • マルチタスク学習を用いたエンドツーエンドの訓練方式により、個別に訓練する場合と比較して、すべてのタスクにおいて一般化性能と性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。