Skip to main content
QUICK REVIEW

[论文解读] A Geometric Perspective on Variational Autoencoders

Clément Chadebec, Stéphanie Allassonnière|arXiv (Cornell University)|Sep 15, 2022
Generative Adversarial Networks and Image Synthesis被引用 10
一句话总结

本文通过将潜在空间建模为使用学习后验协方差的黎曼流形,对变分自编码器(VAEs)进行了几何重思。通过从内在黎曼度量而非标准高斯先验中进行均匀采样,该方法提升了生成质量——在不改变网络架构的情况下,在MNIST和CelebA数据集上实现了最先进(SOTA)的FID分数,并在低数据场景下表现出强大的鲁棒性。

ABSTRACT

This paper introduces a new interpretation of the Variational Autoencoder framework by taking a fully geometric point of view. We argue that vanilla VAE models unveil naturally a Riemannian structure in their latent space and that taking into consideration those geometrical aspects can lead to better interpolations and an improved generation procedure. This new proposed sampling method consists in sampling from the uniform distribution deriving intrinsically from the learned Riemannian latent space and we show that using this scheme can make a vanilla VAE competitive and even better than more advanced versions on several benchmark datasets. Since generative models are known to be sensitive to the number of training samples we also stress the method's robustness in the low data regime.

研究动机与目标

  • 通过几何视角重新诠释潜在空间,解决原始VAE中生成图像模糊的问题。
  • 克服标准高斯先验的局限性以及先验与聚合后验之间分布不匹配的问题。
  • 通过利用潜在空间的内在黎曼结构,提升插值质量和生成保真度。
  • 证明简单的几何采样方案可超越更复杂的VAE变体,尤其在低数据场景下表现更优。
  • 提供一种即插即用的方法,适用于多种VAE架构,包括VAMP-VAE和VAEGAN等近期模型。

提出的方法

  • 使用后验协方差矩阵的逆作为黎曼度量张量,将潜在空间建模为黎曼流形:$\mathbf{G}(x) = \mathbf{\Sigma}(x)^{-1}$。
  • 通过基于测地线距离的加权平均,在训练数据点的局部度量之间进行插值,构建黎曼度量。
  • 从学习到的黎曼流形上的均匀分布中进行采样,确保潜在空间的平滑且忠实的探索。
  • 使用正则化参数$\rho$平衡度量插值中的局部与全局影响,防止过度平滑或连接性断裂。
  • 在不修改模型架构或训练过程的前提下,将黎曼采样方案应用于标准VAE和先进VAE模型。
  • 将黎曼度量定义为通过后验协方差逆映射的欧氏度量的拉回度量,使其与信息几何建立联系。

实验结果

研究问题

  • RQ1能否利用后验协方差结构,自然地将原始VAE的潜在空间解释为黎曼流形?
  • RQ2与标准高斯采样相比,从学习到的黎曼流形上的内在均匀分布中采样,是否能提升生成质量?
  • RQ3该几何采样方法是否能在低数据场景下超越更复杂的VAE架构?
  • RQ4与重新估计聚合后验分布的两阶段VAE相比,该方法表现如何?
  • RQ5该几何采样方案在多大程度上可泛化并集成到现代VAE变体中?

主要发现

  • 所提出的黎曼采样方案在MNIST上实现了9.9的Fréchet Inception Distance(FID)分数,在CelebA上实现了49.6的FID分数,优于基线VAE和[15]中的两阶段VAE。
  • 在同一基准上,该方法将CelebA的FID从67.2(基于先验)降低至60.9,将MNIST的FID从34.5降低至32.7,适用于VAMP-VAE。
  • 对于AAE和VAEGAN,FID分别从19.1降至11.7,从8.7降至6.1,表明在各类架构中均实现了一致的性能提升。
  • 该方法在低数据场景下表现出更优的鲁棒性,且随着训练数据量减少,性能增益进一步提升。
  • 即使应用于VAMP-VAE、VAEGAN和IWAE等最先进模型,该几何采样方案仍能提升生成质量,表明其具有广泛的适用性。
  • 结果表明,黎曼度量等价于由后验协方差诱导的拉回度量,使该方法在微分几何中具有坚实的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。