Skip to main content
QUICK REVIEW

[论文解读] Wasserstein Auto-Encoders

Ilya Tolstikhin, Olivier Bousquet|arXiv (Cornell University)|Nov 5, 2017
Generative Adversarial Networks and Image Synthesis参考文献 32被引用 192
一句话总结

Wasserstein 自编码器(WAE)在编码器-解码器框架中,通过使用基于 GAN 的或基于 MMD 的惩罚来将编码潜在分布与先验对齐,从而最小化数据分布与模型分布之间的 Wasserstein 距离,从而实现稳定训练并提高 VAE 的样本质量。

ABSTRACT

We propose the Wasserstein Auto-Encoder (WAE)---a new algorithm for building a generative model of the data distribution. WAE minimizes a penalized form of the Wasserstein distance between the model distribution and the target distribution, which leads to a different regularizer than the one used by the Variational Auto-Encoder (VAE). This regularizer encourages the encoded training distribution to match the prior. We compare our algorithm with several other techniques and show that it is a generalization of adversarial auto-encoders (AAE). Our experiments show that WAE shares many of the properties of VAEs (stable training, encoder-decoder architecture, nice latent manifold structure) while generating samples of better quality, as measured by the FID score.

研究动机与目标

  • 以基于最优传输的生成建模框架为动机,目标是实现稳定训练和可解释的潜在流形。
  • 开发一种新的自编码器目标函数,使真實数据分布与模型分布之间的 Wasserstein 距离最小化。
  • 提出两种正则化策略,将编码后的潜在分布与先验对齐:基于 GAN 的(WAE-GAN)和基于 MMD 的(WAE-MMD)。
  • 证明 WAE 保留 VAE 的优势,同时在 MNIST 和 CelebA 上产生更高质量的样本。

提出的方法

  • 将 Wasserstein 自编码器目标公式化为对概率编码器 Q(Z|X) 的最小化,目标是期望重构成本加上一个惩罚项,该惩罚使 QZ 与先验 PZ 相匹配(D_Z(QZ, PZ))。
  • 使用 OT 成本的原始形式;推导出在最优传输耦合下潜在边缘分布 QZ 必须等于先验 PZ。
  • 提供两种具体的惩罚项:(a) 基于 GAN 的 D_Z,在潜在空间进行对抗训练(WAE-GAN),以及 (b) 使用特征核的最大平均差异(MMD)(WAE-MMD)。
  • 可选用确定性或概率性编码器,并使用深度网络来参数化 Q 与 G。
  • 在 MNIST 与 CelebA 上进行经验评估,使用平方成本 c(x,y)=||x−y||^2,与 VAE 进行比较,显示样本质量的提升。

实验结果

研究问题

  • RQ1我们是否能够构建一个在可处理的方式下最小化数据分布与生成分布 Wasserstein 距离的正则化自编码器?
  • RQ2我们如何将潜在编码正则化以匹配指定的先验,以及基于 GAN 与基于 MMD 的惩罚的权衡?
  • RQ3WAEs 是否在保持稳定训练和潜在流形的同时,相较于 VAE 提高样本质量?
  • RQ4在标准基准数据集(MNIST、CelebA)上,WAEs 在重构、潜在结构和样本真实度方面的表现如何?

主要发现

  • WAE 泛化了对抗性自编码器,允许任意成本 c 和潜在空间不一致性 D_Z 之间的任意 QZ 与 PZ。
  • WAE-GAN 与 WAE-MMD 实现了稳定训练和潜在空间正则化,在 MNIST 和 CelebA 上产生的样本质量高于 VAE。
  • WAE 的样本质量接近 GAN,同时保留 VAE 的编码器-解码器架构和潜在流形结构特征。
  • WAE-MMD 展现出稳定的训练和有竞争力的样本质量,WAE-GAN 在 CelebA 上偶尔在样本真实度上有更好表现。
  • 在 CelebA 的定量结果显示 WAE-GAN 在报道的变体中实现了最佳的 Fréchet Inception Distance (FID),而 WAE-MMD 也优于 VAE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。