Skip to main content
QUICK REVIEW

[論文レビュー] Deep attention-based classification network for robust depth prediction

Ruibo Li, Ke Xian|arXiv (Cornell University)|Jul 11, 2018
Advanced Vision and Imaging参考文献 22被引用数 17
ひとこと要約

本論文は、多様な屋内および屋外シーンにわたり、ロバストな1枚画像深度推定を実現するための深層アテンションベースの分類ネットワーク(DABC)を提案する。深度推定をソフトマックス出力を持つ多クラス分類タスクとして定式化し、チャネル別アテンション機構を統合することで、特徴量の判別能を適応的に強化する。この手法により、SOTA性能を達成し、ROB 2018の1枚画像深度推定コンテストで2位を獲得した。

ABSTRACT

In this paper, we present our deep attention-based classification (DABC) network for robust single image depth prediction, in the context of the Robust Vision Challenge 2018 (ROB 2018). Unlike conventional depth prediction, our goal is to design a model that can perform well in both indoor and outdoor scenes with a single parameter set. However, robust depth prediction suffers from two challenging problems: a) How to extract more discriminative features for different scenes (compared to a single scene)? b) How to handle the large differences of depth ranges between indoor and outdoor datasets? To address these two problems, we first formulate depth prediction as a multi-class classification task and apply a softmax classifier to classify the depth label of each pixel. We then introduce a global pooling layer and a channel-wise attention mechanism to adaptively select the discriminative channels of features and to update the original features by assigning important channels with higher weights. Further, to reduce the influence of quantization errors, we employ a soft-weighted sum inference strategy for the final prediction. Experimental results on both indoor and outdoor datasets demonstrate the effectiveness of our method. It is worth mentioning that we won the 2-nd place in single image depth prediction entry of ROB 2018, in conjunction with IEEE Conference on Computer Vision and Pattern Recognition (CVPR) 2018.

研究の動機と目的

  • 屋内および屋外シーンの両方で一般化性能に優れる1つのモデルを訓練する課題に対処すること。
  • ScanNet(0–10 m)とKITTI(2.5–80 m)のようなデータセット間で顕著な深度範囲の差を克服すること。
  • アテンション機構を用いて、シーン固有の表現を学習することで、異種シーンにおける特徴量の判別能を向上させること。
  • 分類出力からの連続的深度再構成にソフトウェイトド和推論戦略を採用し、量子化誤差を低減すること。
  • 異なるドメインに対して再トレーニングなしでロバストに動作する普遍的なRGBから深度へのマッピングを開発すること。

提案手法

  • 連続的な深度値を離散的な区間に分割することで、深度推定を多クラス分類問題として定式化する。
  • スコア付きの特徴量を高分解能深度マップに集約するため、スキップ接続を備えたU-Net風のエンコーダデコーダアーキテクチャを用いる。
  • シーンレベルのグローバルコンテキストを表すチャネル別統計量を抽出するために、グローバル平均プーリング層を導入する。
  • シーン固有の表現に寄与する特徴量チャネルの重要度に基づき、重みを再調整するチャネル別アテンション機構を適用する。
  • 学習されたアテンション重みを用いてマルチスケール特徴量を統合するアテンション特徴量統合(AFA)モジュールを統合する。
  • 離散的分類出力から連続的深度予測を再構成するため、量子化誤差を最小限に抑えるソフトウェイトド和推論戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ11つのディープラーニングモデルが、統一されたパrameterセットで屋内および屋外シーンの両方でロバストな深度推定性能を達成できるか?
  • RQ2統一フレームワーク内で、多様なシーンレイアウトや視覚的パターンに対応して、効果的に判別能の高い特徴量を抽出できるか?
  • RQ3チャネル別アテンション機構が、シーン固有のチャネルに注目することで、特徴量表現をどの程度向上できるか?
  • RQ4離散化された深度とソフトウェイトド和推論戦略を組み合わせることで、回帰タスクにおける量子化誤差はどの程度軽減できるか?
  • RQ5回帰ベースの手法と比較して、分類ベースのアプローチが、異なる深度範囲を持つデータセット間での一般化性およびロバスト性において優位性を示せるか?

主な発見

  • DABCモデルは、ROB 2018の1枚画像深度推定トラックで2位を獲得し、複数のデータセットにわたる強力な一般化性能を示した。
  • ScanNetの検証セットでは、分類ベースのDABCモデルがsqRel 4.34、absRel 12.67、irmse 15.93、imae 8.71を達成し、回帰ベースのベースラインを上回った。
  • KITTIの検証セットでは、DABCモデルがSILog 13.34、sqRel 1.95、absRel 8.01、irmse 9.58を達成し、回帰ベースラインより優れた性能を示した。
  • アブレーションスタディの結果、アテンション機構がScanNetでの性能を顕著に向上させた(アテンションなし:sqRel 4.93、アテンションあり:sqRel 4.34)が、KITTIでは同等の結果を維持した。
  • アテンションマップの可視化から、高レベル特徴量が明確なシーン固有の活性化パターンを示しており、アテンション機構が屋内と屋外シーンを区別できる能力を有していることが確認された。
  • 混同行列の結果、特に重複範囲(2.5–10 m)において、屋内と屋外データの干渉が低減されており、深度区間全体で低誤差率を維持していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。