[论文解读] A Prior of a Googol Gaussians: a Tensor Ring Induced Prior for Generative Models
本文提出张量环诱导先验(TRIP),一种深度生成模型先验,利用张量环分解在高维格点上打包超过10^100个高斯分布,实现对复杂、多模态分布的高效建模。TRIP在生成对抗网络(GANs)中提升了Fréchet初始距离(FID),在变分自编码器(VAEs)中提升了证据下界(ELBO),同时支持缺失属性条件生成,优于标准高斯分布和高斯混合模型(GMM)先验。
Generative models produce realistic objects in many domains, including text, image, video, and audio synthesis. Most popular models---Generative Adversarial Networks (GANs) and Variational Autoencoders (VAEs)---usually employ a standard Gaussian distribution as a prior. Previous works show that the richer family of prior distributions may help to avoid the mode collapse problem in GANs and to improve the evidence lower bound in VAEs. We propose a new family of prior distributions---Tensor Ring Induced Prior (TRIP)---that packs an exponential number of Gaussians into a high-dimensional lattice with a relatively small number of parameters. We show that these priors improve Fréchet Inception Distance for GANs and Evidence Lower Bound for VAEs. We also study generative models with TRIP in the conditional generation setup with missing conditions. Altogether, we propose a novel plug-and-play framework for generative models that can be utilized in any GAN and VAE-like architectures.
研究动机与目标
- 通过引入比标准高斯分布更丰富的先验分布,解决生成对抗网络中的模式崩溃问题,并提升变分自编码器的证据下界(ELBO)。
- 利用紧凑的参数化方式,对具有指数级数量分量(超过10^100个高斯分布)的先验进行建模。
- 即使在部分属性缺失的情况下,也能实现高效的采样、边缘化和条件生成。
- 开发一种即插即用的先验,可适用于任意生成对抗网络或变分自编码器架构,无需修改网络结构。
提出的方法
- 将先验分布表示为高维离散或连续的高斯混合模型(GMM),其模式位于格点上。
- 使用张量环分解对联合分布进行参数化,仅用少量参数即可实现联合、边缘和条件概率的高效计算。
- 将潜在向量的概率计算为由张量核心导出的矩阵乘积的迹:$\widehat{P}[r_{1:d}] = \operatorname{Tr}\left(\prod_{j=1}^{d} Q_j[r_j]\right)$。
- 通过在张量核心中引入可学习参数,将方法扩展至连续潜在空间,实现连续GMM的建模。
- 通过联合概率与边缘概率的比值计算条件概率,实现条件生成,支持部分条件下的采样。
- 使用标准VAE或GAN目标端到端训练模型,将TRIP作为先验分布。
实验结果
研究问题
- RQ1具有指数级数量分量的先验是否能超越标准高斯先验,显著提升生成模型质量?
- RQ2如张量环分解这类紧凑参数化方式,能否在不发生过拟合的情况下高效表示高维、多模态先验?
- RQ3与标准先验和GMM先验相比,TRIP是否能在FID指标上提升GAN性能,并在ELBO指标上提升VAE性能?
- RQ4当仅提供部分属性时,TRIP是否能实现有效的条件生成?
主要发现
- 在CelebA数据集上,TRIP将FID降低至52.86(使用WGAN-GP),优于基线WGAN-GP(54.71)和CIFAR-10上的SOTA方法SN-GAN(21.7)。
- VAE-TRIP模型实现了-193.32的ELBO,优于使用标准高斯先验的VAE(-194.16)和GMM先验(-201.60)。
- 在CIFAR-10上,WGAN-GP-TRIP的FID达到16.72,显著优于WGAN-GP(29.3),并接近SOTA性能。
- 模式跳跃可视化显示,潜在空间中相邻模式对应语义上相似的图像变化,表明表示具有解耦性和局部性。
- 在部分属性缺失的情况下进行条件生成,可生成多样化图像(如不同发色、眼镜或帽子的年轻男性),表明对部分条件具有鲁棒性。
- 尽管具有指数级数量的分量,TRIP仅使用了总模型参数的10%以下,避免了过拟合,实现了高效训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。