[论文解读] Diffusion Priors In Variational Autoencoders
本文提出在变分自编码器(VAEs)中使用去噪扩散概率模型(DDPMs)作为可学习先验,替代标准的高斯先验以提升生成性能。通过联合训练VAE的编码器、解码器与扩散先验,基于ELBO目标,该方法在生成样本质量上达到与归一化流先验相当的水平,尤其在CelebA数据集上显著优于高斯先验,在CIFAR10上也表现出竞争力,尽管FID分数存在局限性。
Among likelihood-based approaches for deep generative modelling, variational autoencoders (VAEs) offer scalable amortized posterior inference and fast sampling. However, VAEs are also more and more outperformed by competing models such as normalizing flows (NFs), deep-energy models, or the new denoising diffusion probabilistic models (DDPMs). In this preliminary work, we improve VAEs by demonstrating how DDPMs can be used for modelling the prior distribution of the latent variables. The diffusion prior model improves upon Gaussian priors of classical VAEs and is competitive with NF-based priors. Finally, we hypothesize that hierarchical VAEs could similarly benefit from the enhanced capacity of diffusion priors.
研究动机与目标
- 通过用更具表达能力的先验模型替代标准高斯先验,提升变分自编码器(VAEs)的生成性能。
- 探究去噪扩散概率模型(DDPMs)是否可在VAE框架中作为有效且可学习的先验。
- 评估扩散先验在不同数据集和潜在维度下的样本质量与FID分数的影响。
- 探索扩散先验在分层VAE架构中的潜力,以增强结构建模能力。
提出的方法
- 该方法将VAE中的标准高斯先验替换为基于DDPM的先验,并通过证据下界(ELBO)目标联合训练。
- 扩散先验通过反转前向加噪过程来建模潜在变量的分布,学习潜在空间中的基于得分的生成模型。
- VAE的编码器与解码器通过在ELBO上的随机梯度上升法端到端训练,其中包含后验与先验之间的KL散度项。
- 架构采用受DCGAN启发的编码器-解码器主干网络,所有模型共享组件以确保公平比较。
- 扩散先验实现为三步去噪过程,采用基于MLP的转移函数,与归一化流基线相似。
- 训练持续250个周期,使用Adam优化器,固定初始学习率为0.0005,模型选择基于验证集表现。
实验结果
研究问题
- RQ1DDPM能否有效作为VAE中的可学习先验,从而在性能上超越标准高斯先验?
- RQ2在FID分数与视觉保真度方面,使用扩散先验的VAE与使用归一化流先验的VAE相比,其生成质量如何?
- RQ3扩散先验是否为CelebA与CIFAR10等复杂数据分布提供了更具表达力且更匹配的先验分布?
- RQ4在VAE中使用扩散先验时,FID分数在多大程度上能准确反映感知质量?
- RQ5VAE压缩与扩散建模的结合是否能在简化解码器架构的前提下提升样本质量?
主要发现
- 在CelebA数据集上,扩散先验在40个潜在维度下取得114.8的FID分数,优于高斯先验(154.3),并接近归一化流基线(72.9)。
- 在CelebA上100个潜在维度下,扩散先盈取得67.95的FID分数,显著优于高斯先验(149.4),并接近NF基线(59.49)。
- 在CIFAR10上,扩散先验在100维下取得160.5的FID分数,略高于高斯先验(126.2),但视觉检查表明其生成样本比高斯先验更真实。
- 尽管FID分数更高,CIFAR10上扩散先验生成的样本在视觉上被认为比高斯先验更真实,表明FID可能无法完全捕捉感知质量。
- 归一化流先验在两个数据集上均取得最佳FID分数,但视觉质量并未一致体现其优势,表明仅依赖FID分数不足以评估样本质量。
- 结果表明,扩散先验为VAE中的先验建模提供了一种强有力的替代方案,尤其在样本真实感与与分层架构的兼容性方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。