[论文解读] Unbalanced GANs: Pre-training the Generator of Generative Adversarial Network using Variational Autoencoder
本文提出Unbalanced GANs,一种通过变分自编码器(VAE)预训练生成器来稳定训练的方法,通过防止判别器过早收敛来实现。通过使用预训练VAE解码器初始化生成器,该方法提升了训练稳定性,减少了模式崩溃,并在MNIST、CIFAR-10和LSUN Bedroom数据集上实现了更快的收敛速度和更优的早期图像质量。
We propose Unbalanced GANs, which pre-trains the generator of the generative adversarial network (GAN) using variational autoencoder (VAE). We guarantee the stable training of the generator by preventing the faster convergence of the discriminator at early epochs. Furthermore, we balance between the generator and the discriminator at early epochs and thus maintain the stabilized training of GANs. We apply Unbalanced GANs to well known public datasets and find that Unbalanced GANs reduce mode collapses. We also show that Unbalanced GANs outperform ordinary GANs in terms of stabilized learning, faster convergence and better image quality at early epochs.
研究动机与目标
- 解决因判别器收敛速度远快于生成器而导致的GAN训练不稳定性问题。
- 通过稳定生成器与判别器之间的训练动态,减少GAN中常见的模式崩溃问题。
- 通过使用预训练VAE解码器初始化生成器,提升GAN的早期训练性能。
- 提出一种简单、模块化的GAN迁移学习方法,利用VAE预训练实现鲁棒且广泛适用的初始化。
- 证明使用VAE预训练生成器可实现更快收敛与更优图像质量,且无需修改GAN架构。
提出的方法
- 在目标数据集上预训练变分自编码器(VAE),以学习潜在分布并生成逼真图像。
- 将VAE解码器学习到的权重迁移至GAN的生成器网络中,使其初始化为接近先验(标准正态)的分布。
- 将预训练的生成器作为GAN训练的起点,维持生成器与判别器之间平衡的学习动态。
- 使用标准对抗损失(如标准GAN、LSGAN、WGAN)训练GAN,结合预初始化的生成器以稳定训练过程。
- 利用VAE预训练本身具有内在稳定性、较不易失败的特性,确保可靠的初始化。
- 在不修改架构的前提下,将该方法应用于多种GAN架构(DCGAN、LSGAN、WGAN)和数据集(MNIST、CIFAR-10、LSUN Bedroom)。
实验结果
研究问题
- RQ1使用VAE预训练GAN生成器是否能提升训练稳定性并减少模式崩溃?
- RQ2使用VAE解码器初始化生成器是否能带来更早训练阶段的更快收敛与更优图像质量?
- RQ3在不同数据集与架构下,Unbalanced GANs与标准GANs在Inception Score与损失方差方面的性能表现如何比较?
- RQ4所提出的方法是否可普遍适用于不同GAN变体,而无需进行架构修改?
- RQ5与基于GAN的预训练相比,VAE预训练能否作为GAN的可靠且抗失败的初始化方法?
主要发现
- 在CIFAR-10上,Unbalanced GANs在所有训练阶段的Inception Score均高于普通GAN,且差距随时间推移而扩大,尤其在WGAN中表现显著。
- 与标准WGAN相比,Unbalanced WGAN在Inception Score上表现出显著提升,表明其图像质量与多样性更优。
- 在LSUN Bedroom数据集上,Unbalanced DCGAN在第5000个训练周期时已能生成结构连贯的卧室类图像,而标准DCGAN则生成无意义的图案。
- Unbalanced LSGAN完全避免了模式崩溃,而标准LSGAN在训练初期即生成扭曲、怪异的图案。
- Unbalanced GANs的损失收敛更快,且标准差更低,表明其训练动态更具稳定性。
- 预训练的VAE解码器在LSUN Bedroom上生成模糊但结构合理的图像,GAN随后将其微调为更清晰、逼真的样本,且未造成质量退化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。