Skip to main content
QUICK REVIEW

[論文レビュー] RigNet: Repetitive Image Guided Network for Depth Completion

Zhiqiang Yan, Kun Wang|arXiv (Cornell University)|Jul 29, 2021
Advanced Vision and Imaging参考文献 63被引用数 5
ひとこと要約

RigNetは、垂直に積み重ねられた時計回りのネットワークと、動的畳み込みに基づく繰り返し誘導モジュールを用いて、画像誘導と深度構造回復の両方を向上させる繰り返し的な画像誘導型ネットワークを提案する。特徴量を段階的に精錬し、適応的融合機構を用いることで、KITTおよびNYUv2ベンチマークで最先端の性能を達成し、スパarsity、照明、天候の変動に対して優れた耐性を示す。

ABSTRACT

Depth completion deals with the problem of recovering dense depth maps from sparse ones, where color images are often used to facilitate this task. Recent approaches mainly focus on image guided learning frameworks to predict dense depth. However, blurry guidance in the image and unclear structure in the depth still impede the performance of the image guided frameworks. To tackle these problems, we explore a repetitive design in our image guided network to gradually and sufficiently recover depth values. Specifically, the repetition is embodied in both the image guidance branch and depth generation branch. In the former branch, we design a repetitive hourglass network to extract discriminative image features of complex environments, which can provide powerful contextual instruction for depth prediction. In the latter branch, we introduce a repetitive guidance module based on dynamic convolution, in which an efficient convolution factorization is proposed to simultaneously reduce its complexity and progressively model high-frequency structures. Extensive experiments show that our method achieves superior or competitive results on KITTI benchmark and NYUv2 dataset.

研究の動機と目的

  • 既存の画像誘導型深度補完手法におけるぼやけた画像誘導と不明瞭な深度構造の問題に対処すること。
  • 画像誘導ブランチにおけるマルチスケールの文脈的理解を強化することで、複雑な環境下での特徴表現を向上させること。
  • 繰り返し的な動的畳み込み機構を用いて、高周波数の深度構造を段階的に回復させること。
  • 効率的なモジュール設計により、精度を維持したまま動的畳み込みにおけるGPUメモリ消費量を削減すること。
  • 複数段階の特徴量を適応的融合機構で統合することで、深度予測を向上させること。

提案手法

  • RGB画像から判別性の高いマルチスケール特徴量を抽出するために、画像誘導ブランチに繰り返し的な時計回りのネットワークを設計し、文脈的理解と誘導品質を向上させる。
  • 深度生成ブランチに動的畳み込みに基づく繰り返し誘導モジュールを導入し、高周波数の深度構造を精度を高めて段階的にモデル化する。
  • 動的畳み込みモジュールにおける計算複雑性とGPUメモリ使用量を低減するための効率的な畳み込み因子分解戦略を提案する。
  • 繰り返しモジュールの複数段階からの特徴量を適応的融合機構で統合し、より強靭な深度表現を生成する。
  • スパースな深度とRGB画像入力を用いて、密度のある深度予測を監視対象として、エンドツーエンドでモデルを学習する。

実験結果

リサーチクエスチョン

  • RQ1画像誘導ブランチおよび深度生成ブランチの両方に繰り返し設計を適用することで、深度補完の品質が向上するか?
  • RQ2繰り返し的な時計回りのネットワークにおけるマルチスケール特徴量の統合は、深度予測における画像誘導をどのように向上させるか?
  • RQ3繰り返し的な動的畳み込みモジュールは、メモリ消費量を削減しながらも、高周波数の深度構造を効果的にモデル化できるか?
  • RQ4複数段階の特徴量の適応的融合は、単純な連結や加算よりも優れた深度予測をもたらすか?
  • RQ5本手法は、深度のスパarsity、照明、天候の変動が生じる条件下でも、どれほど耐性を示すか?

主な発見

  • RigNetはKITTIベンチマークで最先端の性能を達成し、0.025のサンプリング比を含む極端なスパarsity状況を含む、あらゆるスパarsityレベルで既存手法を上回る。
  • NYUv2データセットでは、複雑なテクスチャーや構造を持つ屋内シーンに対しても強力な一般化性能を示し、競争力のある結果を達成した。
  • 適応的融合機構は、単純な加算や連結よりもRMSEで5.3 mm優れており、複数段階の特徴量統合の有効性を実証した。
  • Virtual KITTIにおける照明および天候の変動条件下でも、GuideNetやACMNetと比較して優れた性能を維持し、強い耐性を示した。
  • 効率的な因子分解により、動的畳み込みモジュールにおけるGPUメモリ使用量を顕著に削減し、実用的デプロイメントを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。