Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Normalization for Robust Monocular Depth Estimation

Chi Zhang, Wei Yin|arXiv (Cornell University)|Oct 18, 2022
Advanced Vision and Imaging被引用数 8
ひとこと要約

本稿では、空間的および深度ドメインにおける文脈グループ化を通じて微細な深度ディティールを保持することで、モノクローラル深度推定を向上させる多スケール正規化戦略である階層的深度正規化(HDN)を提案する。複数の階層的レベルで深度表現を正規化することで、インスタンスレベルの正規化を上回り、5つのゼロショット転送ベンチマークで顕著な精度およびエッジのシャープネス向上を達成し、新たな最先端性能を実現した。

ABSTRACT

In this paper, we address monocular depth estimation with deep neural networks. To enable training of deep monocular estimation models with various sources of datasets, state-of-the-art methods adopt image-level normalization strategies to generate affine-invariant depth representations. However, learning with image-level normalization mainly emphasizes the relations of pixel representations with the global statistic in the images, such as the structure of the scene, while the fine-grained depth difference may be overlooked. In this paper, we propose a novel multi-scale depth normalization method that hierarchically normalizes the depth representations based on spatial information and depth distributions. Compared with previous normalization strategies applied only at the holistic image level, the proposed hierarchical normalization can effectively preserve the fine-grained details and improve accuracy. We present two strategies that define the hierarchical normalization contexts in the depth domain and the spatial domain, respectively. Our extensive experiments show that the proposed normalization strategy remarkably outperforms previous normalization methods, and we set new state-of-the-art on five zero-shot transfer benchmark datasets.

研究の動機と目的

  • インスタンスレベルの正規化の限界に対処すること。これは、全体的なシーン構造に注目するが、微細な深度差を無視する。
  • トレーニング中に全体的なシーン構造と局所的な深度ディティールの両方を適切に保つ正規化戦略を設計すること。
  • スケールおよびシフトの不一致を伴う多様な深度アノテーションを含むミックスデータセット学習を効果的に行えるようにすること。
  • モデルの野生の画像変動に対するロバスト性を高めることで、ゼロショット一般化を向上させること。
  • 空間的および深度ドメインで動作し、設定可能な文脈レベルを備えた柔軟な正規化メカニズムを開発すること。

提案手法

  • 空間的および深度ドメインの両方で多スケールの文脈を用いて深度表現を正規化する階層的深度正規化(HDN)を提案する。
  • 空間ドメインでは、画像をグリッドに分割し、各セル単位で正規化することで、局所的な深度差を強調する。
  • 深度ドメインでは、ピクセルを真値の深度値に基づいてボックスにグループ化し、深度の大きさに応じた文脈に配慮した正規化を可能にする。
  • トレーニング中に複数の正規化レベルを組み合わせることで、局所的ディティールと全体的構造のバランスを取る。
  • 異なる文脈スケール間での相対的深度差を保持するための学習可能な正規化損失を用いる。
  • 標準的なモノクローラル深度推定ネットワークに統合可能であり、アーキテクチャの変更は不要である。

実験結果

リサーチクエスチョン

  • RQ1階層的正規化は、インスタンスレベルの正規化と比較して微細な深度ディティールの保持を改善できるか?
  • RQ2空間的および深度ドメインにおける多スケール正規化は、多様なベンチマークでのゼロショット一般化を向上させるか?
  • RQ3階層的文脈レベルの数がモデルのパフォーマンスおよびロバスト性に与える影響は何か?
  • RQ4HDNは、スケールの不一致を伴うミックスデータセット学習におけるドメインシフトを効果的に処理できるか?
  • RQ5提案手法はゼロショット転送設定下で最先端モデルを上回る性能を示すか?

主な発見

  • HDN-S(空間ドメイン)はKITTIベンチマークでAbsRelを8.58に低下させ、インスタンスレベル正規化(9.81)を上回った。
  • HDN-DR(深度および空間ドメイン)はNYUで6.9のAbsRelを達成し、前回の最先端(9.0)と比較して24.3%の改善を達成した。
  • ETH3Dでは、HDN-DRが8.0のAbsRelおよび83.3%のδ1を達成し、両指標で新たな最先端性能を樹立した。
  • DIODE、KITTI、NYU、ScanNet、ETH3Dを含む5つのゼロショット転送ベンチマークにおいて、本手法は一貫してベースラインを上回った。
  • アブレーションスタディの結果、複数の文脈レベルを用いることで性能向上が見られ、最低レベルのみに依存すると精度が低下した。
  • 定性的な結果では、インスタンスレベル正規化と比較して滑らかな表面、シャープなエッジ、より詳細な予測が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。