Skip to main content
QUICK REVIEW

[論文レビュー] Blind Image Deconvolution using Pretrained Generative Priors

Muhammad Asim, Fahad Shamshad|arXiv (Cornell University)|Aug 20, 2019
Advanced Image Processing Techniques参考文献 39被引用数 5
ひとこと要約

本稿では、GAN や VAE といった事前学習済みの深層生成モデルを用いて、画像とぼかしカーネルの事前分布を獲得し、これらのモデルの潜在空間で交互勾配降下法を用いる、画質復元のための新規なブラインド画像復員手法を提案する。本手法は、大規模なぼかしと強いノイズ下でも、エンドツーエンドの深層学習手法や従来の事前分布に基づく手法を著しく上回る最先端の復元性能を達成する。

ABSTRACT

This paper proposes a novel approach to regularize the ill-posed blind image deconvolution (blind image deblurring) problem using deep generative networks. We employ two separate deep generative models - one trained to produce sharp images while the other trained to generate blur kernels from lower dimensional parameters. To deblur, we propose an alternating gradient descent scheme operating in the latent lower-dimensional space of each of the pretrained generative models. Our experiments show excellent deblurring results even under large blurs and heavy noise. To improve the performance on rich image datasets not well learned by the generative networks, we present a modification of the proposed scheme that governs the deblurring process under both generative and classical priors.

研究の動機と目的

  • 手動で設計された事前分布の代わりに、表現力の高い深層生成的事前分布を導入することで、ブラインド画像復元問題の不適切な性質に対処すること。
  • 従来の手法が失敗するような大規模なぼかしカーネルや高いノイズレベルに対しても、より高いロバスト性を向上させること。
  • 未知のぼかしやノイズ分布に対して一般化性能が低いエンドツーエンドの深層学習モデルの限界を克服すること。
  • 生成的事前分布を、画像生成の用途にとどまらず、逆画像処理問題における正則化子としての有効性を示すこと。
  • 生成的事前分布と古典的事前分布を統合する統一フレームワークを提供し、複雑で豊かな画像データセットにおける性能向上を図ること。

提案手法

  • シャープな画像とぼかしカーネルの両方を、それぞれ別個の深層生成モデルで学習し、潜在空間で表現する。
  • 各生成モデルの潜在空間において、交互最適化を実行することで、元のクリア画像とぼかしカーネルを回復する。
  • 観測モデル $ y = i \otimes k + n $ に基づくデータ適合項を最小化する勾配降下法を用いながら、生成的事前分布を強制する。
  • 生成的事前分布と古典的事前分布(例:全変動、低ランク)を組み合わせたハイブリッド正則化スキームを導入し、より豊かなデータセットに対応する。
  • 生成モデルの出力範囲が複雑な画像に対し不十分な場合に柔軟な最適化を可能にするために、スラック変数を導入する。
  • ハイパーパrameter $\lambda$, $\gamma$ を固定し、ランダムリスタートを用いて収束性とロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの深層生成モデルは、不適切な性質を示すブラインド画像復元問題に対して、効果的に正則化できるか?
  • RQ2大規模なぼかしとノイズ下において、本手法の性能はエンドツーエンドの深層学習手法や古典的事前分布に基づく手法と比べてどうか?
  • RQ3生成モデルがデータ分布を完全に捉えきれないような複雑で豊かな画像データセットに対しても、本手法は一般化可能か?
  • RQ4生成的事前分布と古典的事前分布を組み合わせることで、復元性能にどのような影響を与えるか?
  • RQ5本手法は、トレーニング時に見られなかったぼかしサイズやノイズレベルの変動に対し、どの程度ロバストか?

主な発見

  • CelebA、SVHN、Shoes データセットにおいて、平均PSNRがそれぞれ 0.88、0.87、0.80 を達成し、すべてのベースライン手法を上回った。
  • CelebA では SSIM が 0.93、SVHN では 0.91 を達成し、復元画像の構造的類似性が非常に高いことが示された。
  • 最大 10% の強いノイズ下でも、固定ノイズレベルで学習されたエンドツーエンドモデルと比較して、本手法は優れたPSNR性能を維持した。
  • 大規模なぼかしカーネルに対して、本手法はエンドツーエンドおよび古典的ベースラインを著しく上回り、極端なケースでは5dB以上のPSNR向上を達成した。
  • 視覚的評価では、まったく認識不能なぼやけた入力からでも、復元画像が明確で、真値に忠実であることが確認された。
  • 古典的事前分布を組み合わせたハイブリッドアプローチにより、生成モデルの出力範囲が不十分な CelebA のような複雑な画像においても性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。