[论文解读] Generative Latent Flow
生成潜在流(GLF)是一种基于自编码器的新型生成模型,利用归一化流显式地将学习到的潜在分布映射到简单的先验分布,从而实现高质量的样本生成。该模型在自编码器基生成模型中实现了最先进水平的样本质量,具备更快的收敛速度和单阶段训练,优于带有流先验的变分自编码器(VAE),并可与生成对抗网络(GAN)基准在标准数据集上相媲美。
In this work, we propose the Generative Latent Flow (GLF), an algorithm for generative modeling of the data distribution. GLF uses an Auto-encoder (AE) to learn latent representations of the data, and a normalizing flow to map the distribution of the latent variables to that of simple i.i.d noise. In contrast to some other Auto-encoder based generative models, which use various regularizers that encourage the encoded latent distribution to match the prior distribution, our model explicitly constructs a mapping between these two distributions, leading to better density matching while avoiding over regularizing the latent variables. We compare our model with several related techniques, and show that it has many relative advantages including fast convergence, single stage training and minimal reconstruction trade-off. We also study the relationship between our model and its stochastic counterpart, and show that our model can be viewed as a vanishing noise limit of VAEs with flow prior. Quantitatively, under standardized evaluations, our method achieves state-of-the-art sample quality among AE based models on commonly used datasets, and is competitive with GANs' benchmarks.
研究动机与目标
- 为解决基于自编码器的生成模型中常见的样本质量差的问题,特别是变分自编码器(VAE)中普遍存在的模糊性。
- 通过显式建模潜在分布与先验分布之间的映射,消除潜在空间中启发式正则化的需要。
- 实现基于自编码器模型的稳定端到端训练,同时具备更优的样本质量和更快的收敛速度。
- 探索确定性模型(如GLF)与随机对应模型(如带流先验的VAE)之间的关系。
- 证明潜在空间中的归一化流可在无需对抗训练的情况下实现与GAN相当的样本质量。
提出的方法
- GLF使用确定性自编码器学习数据的低维潜在表征,包含独立的编码器和解码器网络。
- 在潜在空间中应用归一化流,以建模学习到的潜在分布与简单先验(如标准正态分布)之间的可逆变换。
- 通过最大化流正则化潜在分布下数据的对数似然,实现端到端训练,避免使用基于KL散度的正则化。
- 与VAE不同,GLF不使用随机推理;相反,它将潜在变量视为确定性码,而流负责捕捉分布的复杂性。
- 通过将流与潜在码优化解耦,避免了常规正则化自编码器模型中常见的退化问题。
- 该方法被证明等价于带流先验的VAE在噪声趋于零时的极限情况,为其行为提供了理论依据。
实验结果
研究问题
- RQ1基于确定性自编码器并结合潜在空间中的归一化流,能否实现与GAN相当的高质量图像生成?
- RQ2潜在分布与先验分布之间的显式流映射,与VAE中隐式的正则化相比,表现如何?
- RQ3为何正则化的GLF会出现训练不稳定性?GLF又是如何避免此问题的?
- RQ4GLF与带流先验的随机模型(如VAE)之间存在何种关系?
- RQ5基于自编码器模型的端到端、单阶段训练,能否在无需对抗训练的情况下实现最先进水平的样本质量?
主要发现
- 在MNIST、Fashion-MNIST、CIFAR-10和CelebA数据集上,GLF在自编码器基生成模型中实现了最先进水平的样本质量,其FID得分与GAN基准相当。
- GLF的收敛速度优于两阶段VAE和GLANN,在MNIST上仅需100个周期,在CIFAR-10上仅需200个周期,在CelebA上仅需40个周期即可达到最优FID得分。
- 正则化的GLF因对潜在方差过度惩罚而出现训练不稳定性与负对数似然(NLL)损失退化,而GLF通过将流与潜在码解耦避免了此问题。
- 随着正则化强度(β)增加,带流先验的VAE会收敛至GLF的性能水平,但即使在高β下,GLF在FID得分上仍略胜一筹。
- 在VAE+流先验中,随着β增大,后验熵损失减小,表明后验方差缩小;而GLF保持稳定训练,未出现此类方差坍缩。
- GLF的FID得分在训练过程中持续稳定提升,无振荡现象;而VAE+流先验和正则化GLF均表现出强烈的波动。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。