Skip to main content
QUICK REVIEW

[论文解读] Blind Image Deconvolution using Pretrained Generative Priors

Muhammad Asim, Fahad Shamshad|arXiv (Cornell University)|Aug 20, 2019
Advanced Image Processing Techniques参考文献 39被引用 5
一句话总结

该论文提出了一种新颖的盲图像去卷积方法,利用预训练的深度生成模型——特别是 GAN 和 VAE——作为图像和模糊核的先验,通过在这些模型的潜在空间中进行交替梯度下降来实现。该方法在大模糊和强噪声条件下实现了最先进水平的去模糊性能,显著优于端到端深度学习方法和基于经典先验的方法。

ABSTRACT

This paper proposes a novel approach to regularize the ill-posed blind image deconvolution (blind image deblurring) problem using deep generative networks. We employ two separate deep generative models - one trained to produce sharp images while the other trained to generate blur kernels from lower dimensional parameters. To deblur, we propose an alternating gradient descent scheme operating in the latent lower-dimensional space of each of the pretrained generative models. Our experiments show excellent deblurring results even under large blurs and heavy noise. To improve the performance on rich image datasets not well learned by the generative networks, we present a modification of the proposed scheme that governs the deblurring process under both generative and classical priors.

研究动机与目标

  • 通过引入表达性强的深度生成先验,而非手工设计的先验,来解决盲图像去模糊问题的病态性。
  • 提高对大模糊核和高噪声水平的鲁棒性,这些情况下传统方法会失效。
  • 克服端到端深度学习模型在未见模糊和噪声分布上泛化能力差的局限性。
  • 证明预训练生成模型作为正则化器在图像生成之外的逆向成像问题中的有效性。
  • 提供一个统一框架,将生成先验与经典先验结合,以在复杂、丰富的图像数据集上提升性能。

提出的方法

  • 分别训练两个独立的深度生成模型:一个用于清晰图像,一个用于模糊核,均在潜在空间中进行。
  • 在每个生成模型的潜在空间中执行交替优化,以恢复干净图像和模糊核。
  • 使用梯度下降最小化基于观测模型 $ y = i \otimes k + n $ 的数据保真项,同时施加生成先验。
  • 引入一种混合正则化方案,将生成先验与经典先验(如总变差、低秩)结合,以适应更丰富的数据集。
  • 引入松弛变量,以在生成器范围不足以覆盖复杂图像时实现更灵活的优化。
  • 固定超参数 $\lambda$, $\gamma$,并使用随机重启以提升收敛性和鲁棒性。

实验结果

研究问题

  • RQ1预训练的深度生成模型能否有效正则化病态的盲图像去模糊问题?
  • RQ2在大模糊和噪声条件下,该方法与端到端深度学习方法和基于经典先验的方法相比性能如何?
  • RQ3该方法能否泛化到复杂、丰富的图像数据集,即使生成模型无法完全捕捉数据分布?
  • RQ4将生成先验与经典先验结合对去模糊性能有何影响?
  • RQ5该方法对训练时未见过的模糊尺寸和噪声水平变化的鲁棒性如何?

主要发现

  • 在 CelebA、SVHN 和 Shoes 数据集上,该方法的平均 PSNR 分别达到 0.88、0.87 和 0.80,优于所有基线方法。
  • 在 CelebA 上 SSIM 达到 0.93,在 SVHN 上达到 0.91,表明去模糊图像具有较高的结构保真度。
  • 在强噪声(高达 10%)条件下,该方法相比在固定噪声水平上训练的端到端模型,仍保持更优的 PSNR 性能。
  • 对于大模糊核,该方法显著优于端到端和经典基线方法,在极端情况下 PSNR 提升超过 5 dB。
  • 定性结果表明,即使输入完全无法辨认,去模糊后的图像在视觉上也更清晰且更接近真实图像。
  • 结合经典先验的混合方法在复杂图像(如 CelebA 中的图像)上性能更优,尤其当生成器范围不足时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。