Skip to main content
QUICK REVIEW

[論文レビュー] DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation

Zhenyu Li, Zehui Chen|arXiv (Cornell University)|Mar 27, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

DepthFormerは、自己注意を用いた長距離相関の活用と畳み込みブランチによる局所的詳細の保持を組み合わせた、モノクローラル深度推定のためのハイブリッドTransformer-CNNエンコーダーを提案する。特徴抽出の強化を図る、階層的集約と異種相互作用(HAHI)モジュールを新たに導入し、KITTI、NYU、SUN RGB-Dベンチマークで最先端性能を達成した。特にKITTIでは、精度と効率性の両面で新たなSOTAを樹立した。

ABSTRACT

This paper aims to address the problem of supervised monocular depth estimation. We start with a meticulous pilot study to demonstrate that the long-range correlation is essential for accurate depth estimation. Therefore, we propose to leverage the Transformer to model this global context with an effective attention mechanism. We also adopt an additional convolution branch to preserve the local information as the Transformer lacks the spatial inductive bias in modeling such contents. However, independent branches lead to a shortage of connections between features. To bridge this gap, we design a hierarchical aggregation and heterogeneous interaction module to enhance the Transformer features via element-wise interaction and model the affinity between the Transformer and the CNN features in a set-to-set translation manner. Due to the unbearable memory cost caused by global attention on high-resolution feature maps, we introduce the deformable scheme to reduce the complexity. Extensive experiments on the KITTI, NYU, and SUN RGB-D datasets demonstrate that our proposed model, termed DepthFormer, surpasses state-of-the-art monocular depth estimation methods with prominent margins. Notably, it achieves the most competitive result on the highly competitive KITTI depth estimation benchmark. Our codes and models are available at https://github.com/zhyever/Monocular-Depth-Estimation-Toolbox.

研究の動機と目的

  • モノクローラル深度推定におけるCNNの長距離相関モデリングの限界と、Transformerの局所的詳細に欠ける空間的インダクティブバイアスの問題を解消すること。
  • Transformer(グローバルコンテキスト)とCNN(局所的構造)の強みを併用することで、深度推定の精度を向上させること。
  • 独立したブランチの後期融合による特徴統合のボトルネックを、専用の相互作用メカニズムで克服すること。
  • 高解像度特徴マップにおけるグローバル自己注意のメモリコストを、可変的注意スキームを用いて低減すること。
  • 主な深度推定ベンチマークで、特にKITTIにおいて新たな最先端性能を確立すること。

提案手法

  • モデルは二重ブランチエンコーダーを採用:ビジョンTransformerブランチは長距離依存関係をモデル化し、CNNブランチは局所的空間的詳細を保持する。
  • 階層的集約と異種相互作用(HAHI)モジュールを導入し、複数レベルの自己注意と、Transformer特徴とCNN特徴間のクロス注意を用いて特徴を強化する。
  • HAHIモジュールは、全ピクセルではなく学習可能なキーポintsのサブセットに注目する可変的自己注意(DSA)機構を採用し、計算コストを低減する。
  • 可変的クロス注意(DCA)モジュールは、セット対セットの変換様式で異種特徴間の類似性をモデル化し、構造的な特徴相互作用を可能にする。
  • 深度予測には標準のデコーダーヘッドを用い、教師あり損失関数を用いてエンドツーエンドで訓練する。
  • 可変的注意機構は、すべての階層的段階に適用され、高解像度特徴表現を維持しつつ、メモリ使用量を削減する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドTransformer-CNNエンコーダーは、標準のCNNや純粋なTransformerエンコーダーに比べ、モノクローラル深度推定で優れた性能を示せるか?
  • RQ2HAHIのような専用の特徴相互作用モジュールは、長距離特徴と局所特徴の統合をどれほど効果的に改善できるか?
  • RQ3可変的注意の使用は、高解像度特徴マップにおいて性能を維持したまま、メモリコストを低減できるか?
  • RQ4提案手法は、KITTI、NYU、SUN RGB-Dといった標準ベンチマークで最先端性能を達成できるか?
  • RQ5長距離モデリングと局所的詳細の保持の両者が、深度推定精度に与える相対的寄与度はどの程度か?

主な発見

  • DepthFormerは、非常に競争の激しいKITTI深度推定ベンチマークで新たな最先端性能を達成し、優れた精度を示した。
  • 多段階可変的自己注意(DSA)を用いることで、単一段階の注意と比較してRMS誤差が4.9%改善された。
  • 可変的クロス注意(DCA)の追加により、RMS誤差が2.2%改善され、異種特徴間相互作用の有効性が裏付けられた。
  • HAHIモジュールは、特に局所的整合性が重要な近距離物体の深度推定において顕著な性能向上をもたらした。
  • DepthFormerは高い推論速度を維持しており、KITTIバリデーションセットにおいて、精度(δ₁)と速度の両面で先行SOTA手法を上回った。
  • アブレーションスタディの結果、多段階DSAとDCAの併用が最適な性能を発揮するために不可欠であることが確認され、いずれかを省いた場合、性能が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。