Skip to main content
QUICK REVIEW

[论文解读] One Model to Reconstruct Them All: A Novel Way to Use the Stochastic Noise in StyleGAN

Christian Bartz, Joseph Bethge|arXiv (Cornell University)|Oct 21, 2020
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

本文提出了一种基于StyleGAN的新型自编码器,通过利用随机噪声作为可学习的特征空间,在无需微调预训练生成器的情况下,实现了在多种数据领域间的高质量图像重建。该方法在单张GPU上实现每秒高达40张图像的重建速度——比先前方法快28倍——同时在无需针对该任务进行显式训练的情况下,展现出强大的图像去噪性能。

ABSTRACT

Generative Adversarial Networks (GANs) have achieved state-of-the-art performance for several image generation and manipulation tasks. Different works have improved the limited understanding of the latent space of GANs by embedding images into specific GAN architectures to reconstruct the original images. We present a novel StyleGAN-based autoencoder architecture, which can reconstruct images with very high quality across several data domains. We demonstrate a previously unknown grade of generalizablility by training the encoder and decoder independently and on different datasets. Furthermore, we provide new insights about the significance and capabilities of noise inputs of the well-known StyleGAN architecture. Our proposed architecture can handle up to 40 images per second on a single GPU, which is approximately 28x faster than previous approaches. Finally, our model also shows promising results, when compared to the state-of-the-art on the image denoising task, although it was not explicitly designed for this task.

研究动机与目标

  • 使用单个预训练的StyleGAN生成器,在多种数据领域间实现高保真度的图像重建。
  • 探究StyleGAN中的随机噪声是否能超越随机波动,发挥功能性作用。
  • 开发一种快速、高效的GAN反演方法,实现在不同数据集上解码器与编码器的独立训练。
  • 探索当噪声作为主要控制机制时,潜在代码的语义表达能力。
  • 评估模型在图像去噪任务上的表现,尽管未针对该任务进行显式训练。

提出的方法

  • 构建了一个条件GAN架构,使用预训练的StyleGAN生成器作为固定的解码器,并在不同数据集上训练一个基于ResNet的编码器。
  • 编码器学习将输入图像映射到预训练StyleGAN的潜在空间,训练期间冻结生成器的权重。
  • 利用随机噪声输入作为图像细节和色彩调控的主要控制机制,从而无需使用潜在代码。
  • 引入两阶段训练策略,以增强潜在代码的语义含义,同时保持重建质量。
  • 模型采用端到端训练,结合感知损失(LPIPS)、对抗损失和重建损失(MSE),以优化图像保真度。
  • 在去噪任务中,自编码器被训练为从含噪输入重建干净图像,直接预测去噪输出,无需残差减法。

实验结果

研究问题

  • RQ1当噪声作为主要控制信号时,潜在代码在多大程度上影响重建质量?
  • RQ2StyleGAN中的随机噪声是否能够捕捉超出随机波动的精细细节和色彩变化?
  • RQ3预训练的StyleGAN生成器是否能够重建其训练分布之外的数据领域的图像?
  • RQ4在某一数据集上训练的编码器是否能有效利用固定生成器,重建来自不同领域图像?
  • RQ5该架构在未针对任务进行显式训练的情况下,能在多大程度上实现良好的图像去噪性能?

主要发现

  • 该模型在单张NVIDIA RTX 2080 Ti GPU上实现高达每秒40张图像的重建速度,相比先前方法[11]提升28倍。
  • 该模型成功利用在FFHQ上预训练的StyleGAN,重建了来自LSUN教堂、猫和卧室等多样化领域图像,展现出强大的跨领域泛化能力。
  • 实验表明,随机噪声输入在捕捉精细细节和实现色彩调控方面具有关键作用,即使未使用潜在代码亦可实现。
  • 在BSD68数据集上,σ=50时,该模型达到PSNR 27.57和SSIM 0.92,尽管无任务特定设计,仍达到当前最优性能。
  • 在去噪过程中,模型表现出细微的色彩校正效果,可能提升感知质量,但可能成为定量评估中的混杂因素。
  • 两阶段训练策略成功提升了潜在代码的语义表达能力,且未降低重建质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。