Skip to main content
QUICK REVIEW

[論文レビュー] Monocular Depth Estimation with Hierarchical Fusion of Dilated CNNs and Soft-Weighted-Sum Inference

Bo Li, Yuchao Dai|arXiv (Cornell University)|Aug 2, 2017
Advanced Vision and Imaging参考文献 24被引用数 8
ひとこと要約

本論文は、膨張畳み込みと階層的特徴統合を用いて、多スケールの深度ヒントを捉えるために、深さ予測を多クラス密度分類タスクに再定式化するエンドツーエンドの単眼深度推定フレームワークを提案する。ハードマックスに代えてソフト重み和推論を採用することで、量子化誤差を低減し、連続的な深さ確率分布を学習し、NYU Depth V2およびKITTIデータセットで最先端の性能を達成した。82.0%の精度と0.139の相対誤差を達成した。

ABSTRACT

Monocular depth estimation is a challenging task in complex compositions depicting multiple objects of diverse scales. Albeit the recent great progress thanks to the deep convolutional neural networks (CNNs), the state-of-the-art monocular depth estimation methods still fall short to handle such real-world challenging scenarios. In this paper, we propose a deep end-to-end learning framework to tackle these challenges, which learns the direct mapping from a color image to the corresponding depth map. First, we represent monocular depth estimation as a multi-category dense labeling task by contrast to the regression based formulation. In this way, we could build upon the recent progress in dense labeling such as semantic segmentation. Second, we fuse different side-outputs from our front-end dilated convolutional neural network in a hierarchical way to exploit the multi-scale depth cues for depth estimation, which is critical to achieve scale-aware depth estimation. Third, we propose to utilize soft-weighted-sum inference instead of the hard-max inference, transforming the discretized depth score to continuous depth value. Thus, we reduce the influence of quantization error and improve the robustness of our method. Extensive experiments on the NYU Depth V2 and KITTI datasets show the superiority of our method compared with current state-of-the-art methods. Furthermore, experiments on the NYU V2 dataset reveal that our model is able to learn the probability distribution of depth.

研究の動機と目的

  • 複雑なシーンにおける多スケールの深さ推定の課題に対処すること。
  • 回帰ベースの手法の限界、特にデータの不均衡と深さの量子化に対する感受性を克服すること。
  • 学習可能な確率分布を用いて深さを分類タスクとしてモデル化することで、耐性と精度を向上させること。
  • ソフト重み和推論により量子化誤差を低減し、一般化性能を向上させること。

提案手法

  • 回帰ではなく、多クラス密度ラベル付け問題に単眼深度推定を再定式化することで、セグメンテーション風の深層学習技術を活用可能にする。
  • 受容 field を拡大し、多スケールのコンテキストを捉えるために、残差ネットワークのバックボーンで膨張畳み込みを採用する。
  • 異なるネットワーク段階からの多スケール特徴を統合する階層的特徴統合を用いて、スケールに敏感な深さ表現を実現する。
  • 離散的な深さカテゴリスコアを連続的な深さ予測に変換するために、ソフト重み和推論を適用し、量子化誤差を最小化する。
  • 多項ロジスティック損失を用いてネットワークを訓練することで、隣接する深さカテゴリ間の類似性をモデルが暗黙的に学習可能にする。
  • 出力確率分布を活用して深さ予測をガイドすることで、耐性と連続性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1単眼深度推定を効果的に多クラス分類タスクに再定式化することで、多スケールの深さ推定を向上させることができるか?
  • RQ2膨張特徴の階層的統合は、深さ推定におけるスケールに敏感な認識をどのように向上させるか?
  • RQ3ハードマックス推論と比較して、ソフト重み和推論は量子化誤差を低減し、予測の連続性を向上させるか?
  • RQ4分類ベースのネットワークは、空間的および深さ的関係を反映する意味のある深さ確率分布を学習できるか?

主な発見

  • 提案手法は、NYU Depth V2データセットで82.0%のピクセル精度と0.139の相対誤差(Rel)を達成し、最先端の手法を上回った。
  • ソフト重み和推論により、誤差は0.139 Relに低下し、精度は82.0%に向上した。一方、ハードマックス推論では0.142 Relと81.82%の精度にとどまった。
  • 部品のアブレーション実験では、膨張畳み込みとスキップ接続の両方が重要であり、それらを削除すると精度が3%以上低下した。
  • ネットワークは深さカテゴリ上に対称的でガウス型の確率分布を学習しており、深さの類似性と近接性を捉えていることが示された。
  • 深さビンの数を50から1000に増やすと、ピクセル精度は67%から7%に低下したが、Relは安定して約0.14を維持した。これは、細粒度での深さ認識が限界に達していることを示している。
  • 混同行列の結果、対角優勢と対称性が確認され、誤差が主に隣接する深さクラス間で発生していることが示された。これにより、ソフト推論の必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。