Skip to main content
QUICK REVIEW

[論文レビュー] Deep Virtual Stereo Odometry: Leveraging Deep Depth Prediction for Monocular Direct Sparse Odometry

Nan Yang, Rui Wang|arXiv (Cornell University)|Jul 6, 2018
Advanced Vision and Imaging参考文献 36被引用数 8
ひとこと要約

本稿では、スケールの曖昧さと運動パララックスの依存性を克服するため、深層モノクローラル深度推定を活用した単眼視覚オドメトリであるDeep Virtual Stereo Odometry (DVSO)を提案する。半教師付きの深層ネットワークを用いて視差推定を精緻化し、それをDirect Sparse Odometryに仮想ステレオ測定値として統合することで、単一カメラでのみステレオ法と同等の計量的精度を達成する。

ABSTRACT

Monocular visual odometry approaches that purely rely on geometric cues are prone to scale drift and require sufficient motion parallax in successive frames for motion estimation and 3D reconstruction. In this paper, we propose to leverage deep monocular depth prediction to overcome limitations of geometry-based monocular visual odometry. To this end, we incorporate deep depth predictions into Direct Sparse Odometry (DSO) as direct virtual stereo measurements. For depth prediction, we design a novel deep network that refines predicted depth from a single image in a two-stage process. We train our network in a semi-supervised way on photoconsistency in stereo images and on consistency with accurate sparse depth reconstructions from Stereo DSO. Our deep predictions excel state-of-the-art approaches for monocular depth on the KITTI benchmark. Moreover, our Deep Virtual Stereo Odometry clearly exceeds previous monocular and deep learning based methods in accuracy. It even achieves comparable performance to the state-of-the-art stereo methods, while only relying on a single camera.

研究の動機と目的

  • 単眼視覚オドメトリに内在するスケールの曖昧さと運動パララックス依存性に対処すること。
  • 純粋に幾何学的な単眼VOの限界を、深層学習に基づく深度推定を組み込むことで克服すること。
  • 高価なLiDARデータ収集を回避するため、半教師付きのトレーニングアプローチを考案すること。
  • 深層深度推定を直接スパースオドメトリフレームワークに統合し、計量スケールのトラジェクトリ推定を可能にすること。
  • 単一カメラに依存しながらも、ステレオベースの視覚オドメトリシステムと同等の性能を達成すること。

提案手法

  • 自己教師付きの光度一貫性とStereo DSOからのスパース深度監督を用いて、2段階のスタックド残差ネットワークを単眼深度推定用にトレーニングする。
  • 予測された深度マップを仮想ステレオ視差として使用し、DSO最適化パイプラインに合成ステレオ制約を導入する。
  • ウィンドウド直接バンドル調整に仮想ステレオ項を統合し、予測深度と観測画像強度の整合性を強制する。
  • ステレオ画像ペアにおける写真的一致性損失と左右一貫性を活用し、完全なLiDAR監督なしに深度推定を監督する。
  • Stereo DSOからのスパース3D再構築を弱い監督として活用し、トレーニング中に深度推定を精緻化する。
  • 仮想ステレオ基準距離パラメータをチューニングすることで性能をさらに向上させ、最先端のステレオ手法を上回ることを可能にする。

実験結果

リサーチクエスチョン

  • RQ1深層モノクローラル深度推定は、単眼視覚オドメトリにおけるスケールドリフトを効果的に軽減できるか?
  • RQ2ステレオ画像とスパースDSO再構築のみを用いた半教師付き深度学習は、教師あり手法と同等の性能を達成できるか、その程度はいかほどか?
  • RQ3深層深度推定から導出される仮想ステレオ制約は、単眼設定における直接スパースオドメトリの精度を向上させられるか?
  • RQ4提案手法は、単一カメラに依存しながらも、ステレオベースの視覚オドメトリシステムと同等の性能を達成できるか?
  • RQ5本手法は、トレーニングドメイン外の多様なシーケンスやカメラトラジェクトリにどのように一般化するか?

主な発見

  • DVSOはKITTIベンチマークにおいて、Stereo LSD-SLAM や Stereo DSO といった最先端のステレオ手法と同等の並進誤差および回転誤差を達成する。
  • 仮想基準距離のチューニングにより、DVSOは評価されたすべての単眼およびステレオ手法(Stereo LSD-SLAM やループクロージャーなしのORB-SLAM2を含む)を上回る性能を示す。
  • 提案された半教師付き深度ネットワークは、KITTIベンチマークにおいて最先端の単眼深度推定手法を上回る性能を発揮する。
  • DVSOは、DeepVO、UnDeepVO、SfMLearner、Yinら[46]といったエンドツーエンドの深層学習ベースのVOシステムと比較して、並進誤差および回転誤差の両面で顕著に優れている。
  • 補足資料に示されたフランクフルトシーケンス(Cityscapes)におけるトラジェクトリ推定結果から、未学習のシーケンスに対しても良好な一般化性能を示す。
  • 深層深度推定を仮想ステレオ制約として統合することで、計量スケール推定が単眼システムで可能となり、スケールドリフトが効果的に解消される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。