Skip to main content
QUICK REVIEW

[論文レビュー] Single View Stereo Matching

Yue Luo, Jimmy Ren|arXiv (Cornell University)|Mar 7, 2018
Advanced Vision and Imaging参考文献 34被引用数 15
ひとこと要約

本論文は、単眼深度推定を視覚合成とステレオマッチングに分解することで、推論中に明示的な幾何制約を導入できる、新しい1枚画像ステレオマッチングフレームワークを提案する。最小限の実際のラベル付きデータでエンド・ツー・エンドに訓練された本手法は、KITTIで最先端の性能を達成し、伝統的なステレオブロックマッチングアルゴリズムでさえも上回る。

ABSTRACT

Previous monocular depth estimation methods take a single view and directly regress the expected results. Though recent advances are made by applying geometrically inspired loss functions during training, the inference procedure does not explicitly impose any geometrical constraint. Therefore these models purely rely on the quality of data and the effectiveness of learning to generalize. This either leads to suboptimal results or the demand of huge amount of expensive ground truth labelled data to generate reasonable results. In this paper, we show for the first time that the monocular depth estimation problem can be reformulated as two sub-problems, a view synthesis procedure followed by stereo matching, with two intriguing properties, namely i) geometrical constraints can be explicitly imposed during inference; ii) demand on labelled depth data can be greatly alleviated. We show that the whole pipeline can still be trained in an end-to-end fashion and this new formulation plays a critical role in advancing the performance. The resulting model outperforms all the previous monocular depth estimation methods as well as the stereo block matching method in the challenging KITTI dataset by only using a small number of real training data. The model also generalizes well to other monocular depth estimation benchmarks. We also discuss the implications and the advantages of solving monocular depth estimation using stereo methods.

研究の動機と目的

  • 単眼深度推定の限界、特に高価な実際の深度データに依存し、明示的な幾何制約が欠如している点を解決すること。
  • 視覚合成とステレオマッチングの2段階問題に単眼深度推定を再定式化することで、一般化性能と性能を向上させること。
  • 変換の明示的モデリングを通じて幾何的正確性を保ちながら、最小限の実際のラベル付きデータでエンド・ツー・エンドの訓練を可能にすること。
  • 単眼手法が、精度において伝統的なステレオマッチングアルゴリズムを上回ることを示すこと。

提案手法

  • 本手法は、単眼深度推定を2つの部分問題に分解する:視覚合成(合成された右視点の生成)とステレオマッチング(左視点と合成された右視点間の視差推定)。
  • 視覚合成ネットワークは、微分可能レンダリングプロセスと確率的視差マップを教師として用い、1枚の入力画像から写真的リアリズムのある右視点を生成するように訓練される。
  • ステレオマッチングネットワークは、元の視点と合成された視点からの特徴量を用いてコストボリューム集約と視差レジラッションを実行し、幾何的一致性を強制する。
  • 合成データと少量の実際のラベル付きデータを組み合わせて、パイプライン全体をエンド・ツー・エンドで訓練する。
  • 微分可能レンダリングとステレオマッチング損失関数を通じて、両ネットワークに明示的な幾何制約を埋め込む。
  • 視覚合成とステレオマッチングの両方が本質的に幾何的原則を尊重するという事実を活用することで、耐障害性と正確性が向上する。

実験結果

リサーチクエスチョン

  • RQ1合成された視点を用いたステレオマッチング問題に単眼深度推定を効果的に再定式化できるか?
  • RQ2大規模な実際の深度アノテーションに依存せずに、推論中に明示的な幾何制約を強制できるか?
  • RQ3視覚合成とステレオマッチングの2段階パイプラインは、エンド・ツー・エンドの単眼深度推定手法を上回れるか?
  • RQ4わずかな実際の深度ラベルのみで、性能をどの程度向上できるか?
  • RQ5単眼手法は、ブロックマッチングのような伝統的なステレオマッチングアルゴリズムを精度で上回れるか?

主な発見

  • 提案手法はKITTI 2015テストセットでD1-all誤差24.44%を達成し、これまでのすべての単眼深度推定手法を上回った。
  • これは、KITTIでステレオブロックマッチング手法(OCV-BM)を全体的な精度で超える最初の単眼手法であり、D1-allは24.44%(OCV-BMは25.27%)を記録した。
  • KITTIの実際の視差ラベルを一切使用しない状態でも、D1-allは25.18%を達成し、優れたゼロショット一般化性能を示した。
  • わずか700枚の実際のKITTIサンプルでのファインチューニングにより、顕著な性能向上が得られ、最小限の実データで最先端の手法を上回った。
  • KITTIでファインチューニングした後、CityscapesやMake3Dデータセットでも他のベンチマークで高品質な結果を生成し、良好な一般化性能を示した。
  • 視覚合成ネットワークから得られる原始的視差マップは性能が低く(D1-all ≈ 30%)、最終段階でのステレオマッチングによる精錬が不可欠であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。