[论文解读] Gaussian Process Prior Variational Autoencoders
本文提出高斯过程先验变分自编码器(GPPVAE),一种生成模型,用高斯过程先验替代标准 VAE 的独立同分布(i.i.d.)潜在先验,以建模数据样本之间的相关性——尤其适用于序列或结构化数据。通过利用低秩协方差结构和一种新颖的随机反向传播策略,GPPVAE 实现了高效、内存高效的训练,并在旋转 MNIST 和人脸姿态数据集上的图像生成与插值任务中达到最先进性能,优于 CVAE 和标准 VAE。
Variational autoencoders (VAE) are a powerful and widely-used class of models to learn complex data distributions in an unsupervised fashion. One important limitation of VAEs is the prior assumption that latent sample representations are independent and identically distributed. However, for many important datasets, such as time-series of images, this assumption is too strong: accounting for covariances between samples, such as those in time, can yield to a more appropriate model specification and improve performance in downstream tasks. In this work, we introduce a new model, the Gaussian Process (GP) Prior Variational Autoencoder (GPPVAE), to specifically address this issue. The GPPVAE aims to combine the power of VAEs with the ability to model correlations afforded by GP priors. To achieve efficient inference in this new class of models, we leverage structure in the covariance matrix, and introduce a new stochastic backpropagation strategy that allows for computing stochastic gradients in a distributed and low-memory fashion. We show that our method outperforms conditional VAEs (CVAEs) and an adaptation of standard VAEs in two image data applications.
研究动机与目标
- 为解决标准 VAE 的局限性,即假设样本间潜在表征独立同分布,而这一假设在时间序列或结构化数据(如多主体或多姿态图像)中并不现实。
- 开发一种可扩展且内存高效的 VAE 推理方法,其先验为高斯过程,通常因完整协方差矩阵导致立方级计算复杂度。
- 通过在潜在表征上学习结构化的核函数,实现对高维数据中多层次相关性(如时间、物体身份、姿态)的有效建模。
- 证明将 GP 先验引入 VAE 可在分布外生成和插值任务中提升性能,优于标准 VAE 和 CVAE。
提出的方法
- 提出 GPPVAE 模型,用潜在码上的 GP 先验替代 VAE 中的 i.i.d. 先验,通过核函数实现样本间相关性的建模。
- 采用 GP 协方差矩阵的低秩分解,将计算复杂度从 O(N³) 降低至 O(NK²),其中 K ≪ N 为近似秩。
- 提出一种新颖的随机反向传播策略,即使在 GP 先验引入非 i.i.d. 结构的情况下,也能实现无偏、基于小批量的梯度估计。
- 使用组合核函数,结合视图特定特征(如旋转、姿态)和对象特定特征(如身份),以在潜在空间中建模多层次相关性。
- 采用变分推断与摊销推理网络相结合的方法,通过随机梯度下降联合优化编码器、解码器和 GP 超参数。
- 采用联合训练方案(GPPVAE-joint),端到端优化 VAE 与 GP 组件;同时引入解耦变体(GPPVAE-dis)用于对比。
实验结果
研究问题
- RQ1通过 GP 先验在潜在空间中建模样本间相关性,能否提升在序列或结构化图像数据上的生成建模性能?
- RQ2在 GP 先验 VAE 中,如何实现高效且可扩展的推理,以应对完整 GP 推理带来的高计算成本?
- RQ3GPPVAE 模型能否在结构化数据中学习到关于物体身份和视图(如姿态或旋转)的有意义解耦表征?
- RQ4在重建与泛化性能方面,GPPVAE 相较于强基线模型(如 CVAE 和线性 VAE)表现如何?
主要发现
- 在旋转 MNIST 数据集上,GPPVAE-joint 的测试集均方误差为 0.0280 ± 0.0008,显著优于 GPPVAE-dis(0.0306 ± 0.0009,p < 0.02)及其他基线模型。
- 在人脸姿态数据集上,GPPVAE-joint 的均方误差为 0.0281 ± 0.0008,优于 CVAE 和 LIVAE,与 GPPVAE-dis(0.0298 ± 0.0008)无显著差异。
- GPPVAE-joint 成功解耦了物体(身份)与视图(姿态)的协方差,学习到针对各因素的独立核函数。
- 该模型学习到与标准 VAE 不同的变分参数,表明 GP 先验引导 VAE 优化其潜在空间以提升泛化能力。
- 对未见旋转与姿态的样本外预测显示,GPPVAE-joint 生成的图像比基线模型更真实、更准确。
- 所提出的随机反向传播策略实现了内存高效的分布式训练,使该模型适用于大规模图像数据集。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。