Skip to main content
QUICK REVIEW

[論文レビュー] A Compromise Principle in Deep Monocular Depth Estimation

Huan Fu, Mingming Gong|arXiv (Cornell University)|Aug 28, 2017
Advanced Vision and Imaging参考文献 51被引用数 11
ひとこと要約

本稿では、最適化を容易にするために空間分解能と深度分解能のバランスを取る「妥協原理」を適用することで、単眼深度推定を向上させる回帰・分類連鎖ネットワーク(RCCN)を提案する。低分解能の連続的深度ブランチと高分解能の離散的深度ブランチを同時に学習させることで、NYU Depth V2、KITTI、Make3Dベンチマークで最先端の性能を達成し、主な指標において従来手法を上回った。

ABSTRACT

Monocular depth estimation, which plays a key role in understanding 3D scene geometry, is fundamentally an ill-posed problem. Existing methods based on deep convolutional neural networks (DCNNs) have examined this problem by learning convolutional networks to estimate continuous depth maps from monocular images. However, we find that training a network to predict a high spatial resolution continuous depth map often suffers from poor local solutions. In this paper, we hypothesize that achieving a compromise between spatial and depth resolutions can improve network training. Based on this "compromise principle", we propose a regression-classification cascaded network (RCCN), which consists of a regression branch predicting a low spatial resolution continuous depth map and a classification branch predicting a high spatial resolution discrete depth map. The two branches form a cascaded structure allowing the classification and regression branches to benefit from each other. By leveraging large-scale raw training datasets and some data augmentation strategies, our network achieves top or state-of-the-art results on the NYU Depth V2, KITTI, and Make3D benchmarks.

研究の動機と目的

  • 高分解能の連続的深度予測がトレーニング中に悪い局所最適解に陥りやすい、単眼深度推定の不適切な性質に対処するため。
  • 空間分解能と深度分解能の妥協を仮定することで、深層ネットワークの最適化安定性を向上させるため。
  • より良い汎化性能と性能を達成するため、連続的および離散的深度の教師信号を併用する共同学習フレームワークを開発するため。
  • 標準ベンチマーク上で変種との比較とアブレーションスタディを通じて、妥協原理の有効性を検証するため。

提案手法

  • 低空間分解能の連続的深度用の回帰ブランチと、高空間分解能の離散的深度用の分類ブランチを備えた連鎖型深層ネットワークアーキテクチャを提案する。
  • 離散化された深度区間に対する分類損失を用いることで、直接的な回帰と比較してトレーニングの安定性を向上させるとともに、RMSEを低減する。
  • 分類ブランチが畳み込み層の特徴量と低分解像の連続的深度マップの両方の入力を用いる連鎖構造を採用する。
  • 一般化および耐障害性を向上させるために、データ拡張および大規模な生データセットを活用する。
  • トレーニング後、離散的深度マップを高分解像にアップサンプリングするとともに空間的詳細を保持するための精練および統合ネットワークを導入する。
  • 両ブランチのバランスを取る組み合わせ損失関数を用いて、エンド・トゥ・エンドでネットワーク全体を訓練する。

実験結果

リサーチクエスチョン

  • RQ1空間分解能と深度分解能の妥協が、単眼深度推定におけるトレーニング安定性と性能向上に寄与するか?
  • RQ2離散的深度区間への変換を伴う回帰問題の分類化が、最適化の改善とRMSEの低減に寄与するか?
  • RQ3回帰ブランチが分類ブランチを支援する連鎖構造が、深度推定精度にどの程度向上効果をもたらすか?
  • RQ4低分解像の連続的深度ブランチを削除するか、分類ブランチのみを用いた変種と比較して、提案されたRCCNアーキテクチャはどの程度優れているか?
  • RQ5KITTIで学習したモデルが、トレーニング時に見られなかったドメイン(例:Cityscapes)に対しても、良好に一般化できるか?

主な発見

  • 提案されたRCCNは、NYU Depth V2ベンチマークで最先端の性能を達成し、高分解像の離散的深度予測が従来手法を顕著に上回った。
  • KITTIでは、異なるデータセットで学習されたにもかかわらず、屋外走行シーンへの強い一般化性能を示し、競争力のある結果を達成した。
  • Make3Dでは、C1およびC2誤差を含むすべての誤差指標で最先端の性能を達成し、屋外シーンにおける強靭性を確認した。
  • アブレーションスタディの結果、低分解像の連続的深度ブランチ(D0)を削除すると、両ブランチの性能が低下し、回帰ブランチと分類ブランチの相互利益が裏付けられた。
  • RCCNと分類・分類連鎖(CCCN)の比較から、連続的および離散的教師信号を併用することで、単一の離散的教師信号よりも優れた結果が得られることを示した。
  • KITTIで学習したモデルは、Cityscapesへの一般化が良好であり、シーンのレイアウトと物体の深度を正確に予測できた。これは、強力なドメイン一般化能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。