Skip to main content
QUICK REVIEW

[論文レビュー] Deep Surface Normal Estimation with Hierarchical RGB-D Fusion

Jin Zeng, Yanfeng Tong|arXiv (Cornell University)|Apr 6, 2019
Advanced Vision and Imaging参考文献 34被引用数 4
ひとこと要約

本稿では、単一のRGB-D画像から正確な表面法線推定を実現するため、適応的特徴再重み付けを備えた階層的RGB-D融合ネットワークを提案する。RGBおよび深度ブランチからのマルチスケール特徴を統合する一方で、ノイズの多い深度入力を抑制するための信頼度マップと、不完全な真値データに対応するハイブリッドマルチスケール損失を用いることで、より鋭いディテールと深度劣化に対する高いロバストネスを実現し、最先端の性能を達成した。

ABSTRACT

The growing availability of commodity RGB-D cameras has boosted the applications in the field of scene understanding. However, as a fundamental scene understanding task, surface normal estimation from RGB-D data lacks thorough investigation. In this paper, a hierarchical fusion network with adaptive feature re-weighting is proposed for surface normal estimation from a single RGB-D image. Specifically, the features from color image and depth are successively integrated at multiple scales to ensure global surface smoothness while preserving visually salient details. Meanwhile, the depth features are re-weighted with a confidence map estimated from depth before merging into the color branch to avoid artifacts caused by input depth corruption. Additionally, a hybrid multi-scale loss function is designed to learn accurate normal estimation given noisy ground-truth dataset. Extensive experimental results validate the effectiveness of the fusion strategy and the loss design, outperforming state-of-the-art normal estimation schemes.

研究の動機と目的

  • 表面法線推定におけるRGBと深度特徴を効果的に統合する戦略の不足に対処すること。
  • 深度センサのノイズおよび深度マップの欠損ピクセルによって生じるアーティファクトを低減すること。
  • 多視点再構成から得られるノイズや不完全な真値法線マップがある状況でも、法線推定の正確性を向上させること。
  • 不完全な教師信号下でも、グローバルな滑らかさとローカルなディテールの保持の両立を図る損失関数の設計。

提案手法

  • 階層的統合機構により、複数のデコーダースケールでRGBおよび深度ブランチからの特徴を統合し、グローバルな滑らかさとローカルなシャープネスの両方を保持する。
  • 入力深度から信頼度マップを推定し、統合の前に深度特徴を再重み付けすることで、エッジや穴領域などの低信頼度領域の影響を低減する。
  • 空間解像度と特徴の忠実性を維持するため、スキップ接続を備えたマルチブランチエンコーダ-デコーダアーキテクチャを採用する。
  • ハイブリッドマルチスケール損失は、異なる解像度でL1およびL2損失を組み合わせる:高解像度では細かいディテールに、低解像度では粗い正確性に寄与する。
  • 信頼度マップは、高不確実性領域を特に評価するための軽量サブネットワークによって計算される。
  • モデルは、多視点再構成から得た真値法線を用いて、Matterport3DおよびScanNetデータセットで訓練され、再構成ノイズを緩和するように損失関数が設計されている。

実験結果

リサーチクエスチョン

  • RQ1複数スケールにわたるRGBと深度特徴を効果的に統合することで、表面法線推定をどのように向上させられるか?
  • RQ2深度特徴の信頼度ベース再重み付けは、深度センサのノイズおよび欠損データに起因するアーティファクトを低減できるか?
  • RQ3ノイズの多い真値法線マップで訓練する場合、ハイブリッドマルチスケール損失関数は性能向上に寄与するか?
  • RQ4階層的統合は、ディテール保持性と正確性の観点から、早期統合や後期統合戦略に比べて優れているか?

主な発見

  • 提案された階層的統合と信頼度再重み付けは、特に深度の穴領域において、早期および後期統合ベースラインを上回ることを、定性的比較で示した。
  • Matterport3Dデータセットでは、平均誤差が13.062°、30°閾値での中央誤差が6.090°を達成し、最先端手法を上回った。
  • ScanNetデータセットでは、平均誤差が14.590°、30°閾値での中央誤差が7.468°を達成し、異なるデータセットへの汎用性が強く示された。
  • アブレーションスタディにより、ハイブリッド損失関数はL1またはL2損失単独よりも、より鋭い結果と優れたディテール保持性を実現することが確認された。
  • 信頼度マップは、二値マスクを用いる場合と比較して、深度の穴周辺で顕著に性能を向上させ、境界アーティファクトを低減した。
  • GTX TITAN X GPU上での1枚あたりの推論時間が34.2 msという合理的な時間で、最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。