Skip to main content
QUICK REVIEW

[论文解读] Cramer-Wold AutoEncoder

Szymon Knop, Jacek Tabor|arXiv (Cornell University)|May 23, 2018
Generative Adversarial Networks and Image Synthesis参考文献 26被引用 17
一句话总结

本文提出了Cramer-Wold自编码器(CWAE),一种生成模型,利用一种新颖的闭式Cramer-Wold核来计算后验分布与先验分布之间的距离,而无需采样。通过实现发散的解析计算,CWAE在标准基准测试中实现了比WAE-MMD和SWAE更快的训练速度和更优的性能,尤其得益于其通过径向高斯核乘积实现的高效优化。

ABSTRACT

We propose a new generative model, Cramer-Wold Autoencoder (CWAE). Following WAE, we directly encourage normality of the latent space. Our paper uses also the recent idea from Sliced WAE (SWAE) model, which uses one-dimensional projections as a method of verifying closeness of two distributions. The crucial new ingredient is the introduction of a new (Cramer-Wold) metric in the space of densities, which replaces the Wasserstein metric used in SWAE. We show that the Cramer-Wold metric between Gaussian mixtures is given by a simple analytic formula, which results in the removal of sampling necessary to estimate the cost function in WAE and SWAE models. As a consequence, while drastically simplifying the optimization procedure, CWAE produces samples of a matching perceptual quality to other SOTA models.

研究动机与目标

  • 通过在损失计算中消除采样,开发一种更高效的生成自编码器。
  • 通过推导出分布之间距离的闭式度量,简化潜在空间正则化的优化。
  • 在单一模型中结合SWAE(基于投影的距离)与WAE-MMD(基于特征核的发散)的优势。
  • 在MNIST、CIFAR-10和CelebA等标准基准上提升训练速度和性能。
  • 为高斯混合模型提供一种可靠、解析的正态性偏离度量。

提出的方法

  • 提出Cramer-Wold核,一种具有径向高斯乘积闭式表达的特征核。
  • 使用Cramer-Wold距离,定义为在所有一维直线上投影的平滑化后均方L2距离的均值。
  • 通过将Cramer-Wold核嵌入WAE框架,构建CWAE模型,以解析方式计算先验与后验之间的发散。
  • 采用一种特征核,确保单射性并避免其他核中常见的指数衰减问题。
  • 采用损失函数的对数变换版本以提升训练稳定性,不同于WAE-MMD使用的基于样本的U统计量。
  • 在使用全连接和卷积-反卷积架构的图像生成任务中应用该模型,并采用Adam优化。

实验结果

研究问题

  • RQ1能否为自编码器中的正态先验推导出分布之间的闭式距离度量,以消除损失计算中的采样?
  • RQ2将SWAE中的投影方法(一维投影)与WAE-MMD中的特征核方法结合,是否能构建出更高效、更有效的生成模型?
  • RQ3Cramer-Wold核能否为WAE框架中的样本基MMD估计器提供一种稳定且解析的替代方案?
  • RQ4CWAE在标准基准上的训练速度和生成质量与WAE-MMD和SWAE相比如何?
  • RQ5CWAE中采用的对数变换损失是否相比WAE-MMD(使用样本基U统计量)能提升训练稳定性?

主要发现

  • 在批量大小不超过256时,CWAE实现了每批次训练时间2倍的加速,优化效率优于WAE-MMD和SWAE。
  • 在MNIST、CIFAR-10和CelebA上,CWAE的生成质量保持或优于WAE-MMD和SWAE,FID和IS得分表现更优。
  • Cramer-Wold核实现了后验与先验之间发散的精确解析计算,消除了损失函数中蒙特卡洛采样的需求。
  • 当批量大小超过1024时,由于其二次时间复杂度,CWAE变得较慢,但此类批量大小在实践中极少使用。
  • CWAE中的对数变换损失提升了训练稳定性,而WAE-MMD使用基于样本的U统计量,可能导致负值。
  • 实验中采用的架构与先前工作(如Tolstikhin等,2017)一致,实现了性能提升的直接比较与验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。