Skip to main content
QUICK REVIEW

[论文解读] Latent Variables on Spheres for Autoencoders in High Dimensions

Deli Zhao, Jiapeng Zhu|arXiv (Cornell University)|Dec 21, 2019
Generative Adversarial Networks and Image Synthesis参考文献 27被引用 6
一句话总结

本文提出球面自编码器(SAE),一种简单而有效的方法,用高维潜在空间中的球面归一化替代变分自编码器(VAE)中的变分推断。通过利用高维几何特性,SAE 在重建和生成性能方面表现更优,且对先验分布和潜在维度具有鲁棒性,在 MNIST 和 FFHQ 数据集上的定量指标与定性样本均优于 VAE。

ABSTRACT

Variational Auto-Encoder (VAE) has been widely applied as a fundamental generative model in machine learning. For complex samples like imagery objects or scenes, however, VAE suffers from the dimensional dilemma between reconstruction precision that needs high-dimensional latent codes and probabilistic inference that favors a low-dimensional latent space. By virtue of high-dimensional geometry, we propose a very simple algorithm, called Spherical Auto-Encoder (SAE), completely different from existing VAEs to address the issue. SAE is in essence the vanilla autoencoder with spherical normalization on the latent space. We analyze the unique characteristics of random variables on spheres in high dimensions and argue that random variables on spheres are agnostic to various prior distributions and data modes when the dimension is sufficiently high. Therefore, SAE can harness a high-dimensional latent space to improve the inference precision of latent codes while maintain the property of stochastic sampling from priors. The experiments on sampling and inference validate our theoretical analysis and the superiority of SAE.

研究动机与目标

  • 为解决 VAE 中的维度困境问题,即高维潜在空间虽提升重建性能,却损害变分推断效果。
  • 探究高维球面是否能为与先验分布无关的鲁棒潜在表征提供几何基础。
  • 开发一种变分推断的简单替代方法,保持随机采样能力的同时提升推断精度。
  • 验证球面潜在空间是否具有分布无关性,并在高维下表现出距离收敛特性。
  • 证明 SAE 在重建、生成及对不同潜在维度和先验分布的鲁棒性方面优于 VAE。

提出的方法

  • 提出 SAE 作为朴素自编码器,引入球面归一化:潜在码被约束在单位球面 $\mathbb{S}^{d_z-1}$ 上,并通过 $\mathbf{z}^\top \mathbf{1} = 0$ 实现中心化。
  • 利用高维球面几何论证:当维度 $d_z$ 足够大时,球面上的随机变量对先验分布具有无关性。
  • 理论分析表明,高维球面上两组潜在变量之间的 Wasserstein 距离收敛至常数,暗示分布鲁棒性。
  • 利用高维空间中体积集中现象,论证球面归一化可保留信息并提升推断精度。
  • 以球面推断替代变分推断——不假设概率先验,仅在球面上进行归一化。
  • 将方法应用于 MNIST 和 FFHQ 数据集,使用 FID、SWD 和 MSE 等标准指标对比 SAE 与 VAE。

实验结果

研究问题

  • RQ1在高维潜在空间中,球面归一化能否缓解 VAE 中的维度困境?
  • RQ2高维球面上的随机变量是否表现出分布无关特性,使其对不同先验分布具有鲁棒性?
  • RQ3高维球面上随机采样点之间的 Wasserstein 距离是否收敛至常数,表明其内在几何稳定性?
  • RQ4与 VAE 中的变分推断相比,简单的球面归一化能否提升重建与生成性能?
  • RQ5SAE 在不同潜在维度和多样化概率先验下,其采样与推断任务中的表现如何?

主要发现

  • SAE 在 FFHQ 人脸数据集上取得 91.02 的 Fréchet Inception Distance(FID),显著低于 VAE 的 134.22,表明图像质量更优。
  • SAE 降低了结构相似性指数(SSIM)损失与 MSE,其在 FFHQ 上的重建 MSE 为 0.063,低于 VAE 的 0.091。
  • SAE 在四种不同先验(正态、均匀、泊松、卡方分布)下均保持一致的生成质量,而 VAE 的输出质量随先验变化显著波动。
  • SAE 的重建误差随潜在维度增加单调递减,而 VAE 的误差在超过 512 维后上升,表明 SAE 避免了维度灾难。
  • 定性结果表明,SAE 比 VAE 更好地保留了细粒度细节(如太阳镜和面部结构),且重建结果更少模糊。
  • 理论分析证实,高维球面上两组随机点集之间的 Wasserstein 距离收敛至常数,支持 SAE 的分布鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。