[论文解读] Wasserstein-Wasserstein Auto-Encoders
该论文提出 Wasserstein-Wasserstein 自编码器(WWAE),一种深度生成模型,通过使用高斯先验与聚合后验之间的闭式平方 Wasserstein-2 距离,最小化真实数据分布与生成分布之间的惩罚最优传输。WWAE 在 MNIST、Fashion-MNIST 和 CelebA 数据集上实现了优于 VAE 和 WAE 的图像生成清晰度与更好的潜在空间结构,FID 得分达到当前最优水平,同时避免了训练不稳定性和模糊性。
To address the challenges in learning deep generative models (e.g.,the blurriness of variational auto-encoder and the instability of training generative adversarial networks, we propose a novel deep generative model, named Wasserstein-Wasserstein auto-encoders (WWAE). We formulate WWAE as minimization of the penalized optimal transport between the target distribution and the generated distribution. By noticing that both the prior $P_Z$ and the aggregated posterior $Q_Z$ of the latent code Z can be well captured by Gaussians, the proposed WWAE utilizes the closed-form of the squared Wasserstein-2 distance for two Gaussians in the optimization process. As a result, WWAE does not suffer from the sampling burden and it is computationally efficient by leveraging the reparameterization trick. Numerical results evaluated on multiple benchmark datasets including MNIST, fashion- MNIST and CelebA show that WWAE learns better latent structures than VAEs and generates samples of better visual quality and higher FID scores than VAEs and GANs.
研究动机与目标
- 解决变分自编码器(VAE)中的模糊性问题以及生成对抗网络(GAN)中的训练不稳定性问题。
- 通过利用最优传输理论,改进深度生成模型中的潜在空间结构与样本质量。
- 消除现有基于最优传输的自编码器(如 WAE-MMD)中采样负担与计算低效性。
- 开发一种计算高效的模型,结合 VAE 的稳定性与 GAN 的感知质量。
- 在多个基准数据集上实现图像生成质量与 FID 得分的最先进性能。
提出的方法
- 将生成模型表述为最小化真实数据分布与生成分布之间惩罚最优传输问题。
- 使用两个高斯分布之间的闭式平方 Wasserstein-2 距离,对潜在码的聚合后验进行正则化,使其逼近标准高斯先验。
- 利用重参数化技巧以实现高效的反向传播,并在优化过程中避免采样。
- 采用深度神经网络生成器 $G_{\theta}$ 将潜在码 $Z \sim P_Z$ 映射到数据空间,目标是最小化生成分布与真实分布之间的 Wasserstein-2 距离。
- 引入双重正则化:一项作用于潜在空间(匹配先验与后验),另一项作用于数据空间(匹配真实与生成分布)。
- 通过随机梯度下降优化目标函数,利用 Wasserstein-2 距离的解析形式,避免 GAN 式判别器训练。
实验结果
研究问题
- RQ1基于最优传输的正则化,若采用闭式 Wasserstein-2 距离,是否能改善自编码器中潜在空间的解耦性与样本质量?
- RQ2将 WAE 中基于 MMD 的正则化器替换为 Wasserstein-2 距离,是否能相比 VAE 实现更清晰的样本与更低的模糊性?
- RQ3所提出的 WWAE 模型是否能实现稳定训练,避免 GAN 中常见的模式崩溃或不稳定性问题?
- RQ4在包含 MNIST、Fashion-MNIST 和 CelebA 的多样化数据集上,WWAE 的 FID 得分与 VAE、WAE-MMD 和 DCGAN 相比如何?
- RQ5使用闭式 Wasserstein-2 距离是否能消除最优传输正则化中的采样需求,从而提升计算效率?
主要发现
- 在三个基准数据集上,WWAE 的 FID 得分均低于 VAE 和 WAE-MMD:MNIST 上为 45,Fashion-MNIST 上为 51,CelebA 上为 55。
- 在 CelebA 数据集上,WWAE 的 FID 得分与 WAE-MMD 相同(55),但生成的图像在视觉上比 VAE 和 WAE-MMD 更加清晰。
- 与 VAE 相比,WWAE 生成的图像模糊性更低,定性比较显示其伪影更少,数字结构更清晰。
- WWAE 学习到的潜在空间表现出更平滑的类间插值(例如,0 和 6 之间),表明其具有更好的解耦性与连续性。
- WWAE 避免了 DCGAN 在长时间训练中常见的训练不稳定性与模式崩溃问题。
- 与 DCGAN、VAE 和 WAE-MMD 相比,该模型在视觉质量上表现更优,生成样本中的失真与伪影更少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。