Skip to main content
QUICK REVIEW

[論文レビュー] Monocular Depth Estimation with Augmented Ordinal Depth Relationships

Yuanzhouhan Cao, Tianqi Zhao|arXiv (Cornell University)|Jun 2, 2018
Advanced Vision and Imaging参考文献 44被引用数 5
ひとこと要約

本論文は、ステレオ映像から得られる相対的深度関係を活用することで、単眼深度推定のための新規手法を提案する。相対的深度が密にアノテートされたRDISデータセットを提供する。RDISでResNetを事前学習し、情報利得損失を用いた分類ベースの深度推定により、RGB-Dデータセットで微調整することで、マルチスケールアーキテクチャやCRF後処理を用いずに、NYUD2およびKITTIベンチマークで最先端の性能を達成した。

ABSTRACT

Most existing algorithms for depth estimation from single monocular images need large quantities of metric groundtruth depths for supervised learning. We show that relative depth can be an informative cue for metric depth estimation and can be easily obtained from vast stereo videos. Acquiring metric depths from stereo videos is sometimes impracticable due to the absence of camera parameters. In this paper, we propose to improve the performance of metric depth estimation with relative depths collected from stereo movie videos using existing stereo matching algorithm. We introduce a new "Relative Depth in Stereo" (RDIS) dataset densely labelled with relative depths. We first pretrain a ResNet model on our RDIS dataset. Then we finetune the model on RGB-D datasets with metric ground-truth depths. During our finetuning, we formulate depth estimation as a classification task. This re-formulation scheme enables us to obtain the confidence of a depth prediction in the form of probability distribution. With this confidence, we propose an information gain loss to make use of the predictions that are close to ground-truth. We evaluate our approach on both indoor and outdoor benchmark RGB-D datasets and achieve state-of-the-art performance.

研究の動機と目的

  • ステレオ映像から容易に入手可能な豊富な相対的深度の監視信号を活用して、単眼深度推定の性能を向上させること。
  • 従来のRGB-Dデータセットにおけるメトリック深度の監視信号の不足と多様性の欠如を解決すること。
  • メトリック深度予測に強いインダクティブバイアスとして相対的深度を活用する学習スキームを開発すること。
  • ステレオ映像から得た密な相対的深度アノテーションを備えた新しいデータセットRDISを作成すること。
  • トランスファーラーニングを用いて、相対的深度監視信号とメトリック監視信号を組み合わせることで、メトリック深度推定の性能を顕著に向上させられることを示すこと。

提案手法

  • 連続的な深度値を対数空間における離散的なビンに分割することで、深度推定をピクセル単位の分類タスクとして定式化する。
  • ステレオマッチングアルゴリズムと手動による後処理により生成された相対的深度アノテーションを含むRDISデータセットで、深層残差ネットワーク(ResNet)を事前学習する。
  • 事前学習済みモデルを、標準的なRGB-Dデータセット(NYUD2、KITTI)のメトリック真値深度を用いて微調整する。
  • 分類ヘッドが出力する確率分布からの予測の信頼性を活用するため、情報利得損失を導入する。この損失関数は、真値に近い予測に注目する。
  • 微調整段階では、ステレオペアの左画像のみを用いるため、推論時にステレオ入力を必要としない。
  • マルチスケールアーキテクチャやCRF後処理に依存せず、最先端の性能を達成している。

実験結果

リサーチクエスチョン

  • RQ1ステレオ映像から抽出した相対的深度関係は、単眼深度推定の性能を顕著に向上させることができるか?
  • RQ2信頼度を考慮した損失関数を備えた分類ベースの深度推定アプローチは、標準的な回帰ベースの手法を上回る性能を示せるか?
  • RQ3大規模な相対的深度データセット(RDIS)で事前学習することで、メトリック深度推定ベンチマークでの一般化性能が向上するか?
  • RQ4RDISで学習したモデルは、DIWデータセット(微調整なし)に対しても良好な一般化性能を示せるか?
  • RQ5実世界のシーンにおいて、メトリック深度監視信号が不足している場合、相対的深度監視信号がどの程度補完的役割を果たせるか?

主な発見

  • 本手法は、マルチスケールネットワークやCRF後処理を一切使用せずに、NYUD2およびKITTIベンチマークの全4評価指標で最先端の性能を達成した。
  • NYUD2では、情報利得損失のパラメータα = 2.0を用いた場合、全4指標(例:Abs Rel、Sq Rel、RMSE、δ<1.25)で最高の結果を達成した。
  • KITTIでは、最大深度を80mおよび50mに制限した場合、すべての先行研究を上回った。α = 0.2を用いたことで、屋外シーンにおける強い一般化性能を示した。
  • RDISでの微調整のみで学習したモデル(Ours-RDIS)は、DIWデータセットにおける相対的深度推定でも最先端の性能を達成した。DIWの学習セットで微調整を行わずとも同様の性能を示した。
  • 定性的な結果から、特に細かい深度変化を示す複雑なシーンにおいて、視覚的に優れた深度予測が得られていることが明らかになった。
  • DIWにおける失敗事例は、距離がほぼ等しいため曖昧な真値ペアに起因しており、残りのケースではほぼ完璧な性能を示していることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。