Skip to main content
QUICK REVIEW

[論文レビュー] Deep Gaussian Conditional Random Field Network: A Model-based Deep Network for Discriminative Denoising

Raviteja Vemulapalli, Oncel Tuzel|arXiv (Cornell University)|Nov 12, 2015
Image and Signal Denoising Methods参考文献 35被引用数 8
ひとこと要約

本稿では、複数のノイズレベルにわたる画像のノイズ除去を、パrameter生成と推論を統合的に学習するエンド・ツー・エンドの訓練により行う、深層ガウス条件付きランダムフィールド(GCRF)ネットワークを提案する。従来の方法が各ノイズレベルごとに別々のモデルを必要としていたのに対し、本手法は入力ノイズ分散を明示的にモデル化し、反復的HQ Sに基づく推論と適応的でパッチごとのポテンシャルパラメータを用いることで、BerkeleyおよびPASCAL VOCデータセットで最先端のPSNR性能を達成した。

ABSTRACT

We propose a novel deep network architecture for image\\ denoising based on a Gaussian Conditional Random Field (GCRF) model. In contrast to the existing discriminative denoising methods that train a separate model for each noise level, the proposed deep network explicitly models the input noise variance and hence is capable of handling a range of noise levels. Our deep network, which we refer to as deep GCRF network, consists of two sub-networks: (i) a parameter generation network that generates the pairwise potential parameters based on the noisy input image, and (ii) an inference network whose layers perform the computations involved in an iterative GCRF inference procedure.\ We train the entire deep GCRF network (both parameter generation and inference networks) discriminatively in an end-to-end fashion by maximizing the peak signal-to-noise ratio measure. Experiments on Berkeley segmentation and PASCALVOC datasets show that the proposed deep GCRF network outperforms state-of-the-art image denoising approaches for several noise levels.

研究の動機と目的

  • 各ノイズレベルごとに別々のモデルを必要としている既存の深層ノイズ除去ネットワークの制限を解消すること。
  • モデルベースのガウスCRF事前分布を深層学習フレームワークに統合し、ノイズレベル間での一般化性能を向上させること。
  • 画像ノイズ除去のためのパrameter生成と推論を同時に最適化するトレーニング可能なアーキテクチャを開発すること。
  • PSNRを最適化目的関数として用いるエンド・ツー・エンドの判別的訓練を可能にすること。
  • データ依存的でパッチごとのポテンシャル関数パラメータを用いることで、エッジの保持を向上させ、過剰な平滑化を低減すること。

提案手法

  • GCRFに基づくノイズ除去のための2ストリーム深層ネットワーク(パrameter生成ネットワーク:PgNet と 推論ネットワーク:InfNet)を提案する。
  • PgNetが$d\times d$の画像パッチ上で処理することにより、空間的に適応的なペアワイズポテンシャルパラメータをパッチベースの特徴抽出によって生成する。
  • 反復的推論手法としてハイフ・クアドラティックスプリット(HQS)を採用し、InfNetに微分可能HQSレイヤーとして実装することで、効率的かつ微分可能な最適化を実現する。
  • 各HQS反復後に複数のPgNetsを導入し、徐々にノイズ除去が進んだ特徴に基づいてポテンシャルパラメータを精緻化することで、高ノイズ環境下でもロバストな性能を実現する。
  • 学習された組み合わせ重み$\gamma_{ij}^k$を用いて、局所的ポテンシャルパラメータをグローバルな画像レベルのペアワイズポテンシャルに統合する。
  • HQSレイヤーやパラメータ結合の閉形式導関数を用いることで、HQSレイヤーおよびすべてのコンponentを含むネットワーク全体に対してエンド・ツー・エンドのバックプロパゲーションを可能にする。

実験結果

リサーチクエスチョン

  • RQ1入力ノイズ分散を明示的にモデル化する深層ネットワークが、複数のノイズレベルで既存の判別的ノイズ除去手法を上回る性能を発揮できるか?
  • RQ2モデルベースのGCRF事前分布を深層学習フレームワークに統合することで、ノイズ除去性能と一般化性能が向上するか?
  • RQ3反復的HQ Sに基づく推論が、深層ネットワーク内で微分可能かつトレーニング可能であるか?
  • RQ4各HQSステップ後に中間PgNetsを導入することで、高ノイズレベルに対するロバストネスが向上するか?
  • RQ51つの統合ネットワークが、各ノイズレベルごとの再トレーニングなしに、複数のノイズレベルでSOTA性能を達成できるか?

主な発見

  • 提案された深層GCRFネットワークは、ノイズレベル$\sigma = 15$、$\sigma = 25$、$\sigma = 50$において、Berkeley Segmentation Datasetで最先端のPSNRを達成し、BM3Dおよび他の深層学習ベースラインを上回った。
  • PASCAL VOCデータセットでは、$\sigma = 50$の条件下で32.15 dBという最高のPSNRを記録し、量子化されていない設定においてTRDやRTF$_5$を含むすべての比較手法を上回った。
  • 68枚の画像で構成されるベンチマークでは、量子化設定では2番目の高いPSNR、非量子化設定では最高のPSNRを達成し、評価プロトコルにかかわらず高いロバストネスを示した。
  • 視覚的結果では、特にエッジや繊細なテクスチャの保持を重視した、アーチファクトが少なくシャープな画像を生成しており、ベースライン手法と比較して優れた性能を示した。
  • NVIDIA Titan GPU上での計算時間は、$321 \times 481$の画像あたり4.4秒であり、反復的推論と高解像度処理を伴うモデルとしては効率的であった。
  • アブレーションスタディの結果、各HQS反復後に複数のPgNetsを導入することで、特に高ノイズレベル下での性能向上が顕著に確認され、ポテンシャルパラメータの適応的精緻化が可能であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。