Skip to main content
QUICK REVIEW

[論文レビュー] Joint convolutional neural pyramid for depth map super-resolution

Yi Xiao, Xiang Cao|arXiv (Cornell University)|Jan 3, 2018
Advanced Vision and Imaging参考文献 2被引用数 7
ひとこと要約

本稿では、融合CNNを介して2つの畳み込みニューラルピラミッドで接続された、大規模な受容 field を活用する共同畳み込みニューラルピラミッド(JCNP)モデルを提案する。この手法は、RGB/深度、カラー/サリエンシー、カラー・スクリッチ/画像ペアの複数のタスクで最先端の手法を上回り、構造的詳細の効果的な転送により、アーチファクトを低減しつつ、より鋭い結果と低いRMSEを達成する。

ABSTRACT

High-resolution depth map can be inferred from a low-resolution one with the guidance of an additional high-resolution texture map of the same scene. Recently, deep neural networks with large receptive fields are shown to benefit applications such as image completion. Our insight is that super resolution is similar to image completion, where only parts of the depth values are precisely known. In this paper, we present a joint convolutional neural pyramid model with large receptive fields for joint depth map super-resolution. Our model consists of three sub-networks, two convolutional neural pyramids concatenated by a normal convolutional neural network. The convolutional neural pyramids extract information from large receptive fields of the depth map and guidance map, while the convolutional neural network effectively transfers useful structures of the guidance image to the depth image. Experimental results show that our model outperforms existing state-of-the-art algorithms not only on data pairs of RGB/depth images, but also on other data pairs like color/saliency and color-scribbles/colorized images.

研究の動機と目的

  • 高分解能のテクスチャまたはガイドマップを活用して、深度マップのスーパーサンプリングを向上させること。
  • 受容 field が限られているために詳細を過剰に平滑化したり、アーチファクトを生成する既存手法の限界を解消すること。
  • より良い再構成を実現するための長距離の文脈的情報を効率的に捉える深層学習アーキテクチャを開発すること。
  • 深度マップにとどまらず、色度やサリエンシー地図などの他の画像スーパーサンプリングタスクへの応用可能性を拡張すること。

提案手法

  • モデルは、低分解能深度マップと高分解能ガイド画像からマルチスケール特徴を抽出するために、それぞれ独立した畳み込みニューラルピラミッド(CNPs)を用いる。
  • 各CNIは、計算コストを増加させることなく、受容 field を段階的に拡大する階層的レベルを経由して特徴を処理する。
  • 中央の畳み込みニューラルネットワーク(CNN)が、両方のピラミッドからの特徴を統合して高分解能深度マップを再構成する。
  • ピラミッドの各レベルにドリルド畳み込みをスタックすることで、有効な大きな受容 field を実現し、文脈モデリングを強化する。
  • 予測された高分解能深度マップと真値との間の再構成誤差を最小化するため、ピxls単位の損失関数を用いてエンドツーエンドで訓練する。
  • 同じネットワーク構造を用い、異なる入力ペairで、色度やサリエンシー地図の強化を含む、他のスーパーサンプリングタスクへも容易に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1大規模な受容 field を有する深層ニューラルネットワークは、現在の最先端手法を上回る深度マップのスーパーサンプリングを実現できるか?
  • RQ2高分解能ガイド画像からの構造的詳細が、高分解能深度マップの再構成にどの程度効果的に転送できるか?
  • RQ3提案された共同畳み込みニューラルピラミッドアーキテクチャは、深度マップにとどまらず、他の画像スーパーサンプリングタスクにも一般化可能か?
  • RQ4大規模な受容 field は、過剰な平滑化や勾配反転などのアーチファクトを低減する上で、どのような影響を及ぼすか?

主な発見

  • JCNPモデルは、Middlebury、Lu、NYUv2のデータセットにおいて、最も低いRMSEを達成し、特に8×および16×のスケーリングで顕著な優位性を示した。
  • Middleburyデータセットでは、2×でRMSE 1.16、4×で1.79、8×で3.22、16×で5.54を記録し、すべてのベースラインを上回った。
  • 色度マップのスーパーサンプリングでは、2×でRMSE 6.73、4×で13.41を達成し、Bicubicおよび他の最先端手法よりも顕著に低い値となった。
  • サリエンシー地図のスーパーサンプリングでは、2×でRMSE 11.19、4×で15.46を記録し、エッジの保持が優れており、色の漏れも低減された。
  • 視覚的比較により、特にテクスチャが豊富で境界領域に顕著な、He [3]、Li [6]、Kopf [2] と比較して、JCNPはより鋭いエッジと少ないアーチファクトを生成することが確認された。
  • 非深度タスクに対しても良好な一般化性能を示し、最小限のアーキテクチャ変更で、カラー・スクリッチおよびカラー化画像のスーパーサンプリングにおいても優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。