[论文解读] Learning Deep Generative Models with Doubly Stochastic MCMC
本文提出双重随机梯度MCMC方法,用于在深度生成模型(DGMs)中进行近似贝叶斯推断,该方法结合了小批量随机梯度估计与神经自适应重要性采样器(NAIS),以高效近似难以计算的后验期望。该方法在多种DGM架构中,在密度估计、生成和缺失数据插补任务上均实现了最先进性能。
We present doubly stochastic gradient MCMC, a simple and generic method for (approximate) Bayesian inference of deep generative models (DGMs) in a collapsed continuous parameter space. At each MCMC sampling step, the algorithm randomly draws a mini-batch of data samples to estimate the gradient of log-posterior and further estimates the intractable expectation over hidden variables via a neural adaptive importance sampler, where the proposal distribution is parameterized by a deep neural network and learnt jointly. We demonstrate the effectiveness on learning various DGMs in a wide range of tasks, including density estimation, data generation and missing data imputation. Our method outperforms many state-of-the-art competitors.
研究动机与目标
- 解决在贝叶斯框架下深度生成模型(DGMs)中难以计算的后验推断问题。
- 提升高维连续参数空间中的采样效率与梯度估计精度。
- 在同时包含离散与连续隐变量的DGM中,实现可扩展的近似贝叶斯学习。
- 开发一种通用且可训练的MCMC提议机制,以适应复杂的后验结构。
- 在密度估计、生成与插补任务中,超越现有变分与MCMC方法。
提出的方法
- 采用具有双重随机性的随机梯度MCMC(SGMCMC):小批量数据采样与隐变量的随机采样。
- 使用带有识别网络的神经自适应重要性采样器(NAIS)来参数化隐变量的提议分布。
- 通过最小化提议分布与真实后验之间的包含KL散度来学习NAIS提议分布。
- 将小批量梯度估计与重要性采样相结合,在连续参数空间中构建渐近无偏的梯度估计。
- 在SGMCMC框架(如DSGNHT)中应用退火学习率,以确保收敛至目标后验分布。
- 采用与IWAE相同的优化目标来训练提议分布,从而实现有效的梯度优化。
实验结果
研究问题
- RQ1双重随机MCMC方法是否能在DGM中实现比现有MCMC与变分方法更优的可扩展性与准确性?
- RQ2神经自适应重要性采样器在高维DGM中替代传统Gibbs采样是否有效?
- RQ3结合小批量数据估计与随机隐变量采样是否能实现无偏且高效的后验推断?
- RQ4所提方法是否能在不同DGM架构中泛化,包括具有离散与连续隐变量的模型?
- RQ5该方法在密度估计、数据生成与缺失数据插补任务中的性能提升程度如何?
主要发现
- 在二值化MNIST数据集上,DSGNHT-NAIS的测试对数似然达到-86.93,优于VAE(-88.83)与IWAE(-87.63)。
- 在Omniglot数据集上,DSGNHT-NAIS的测试对数似然达到-106.10,与IWAE或其他强基线模型相当或更优。
- 在Caltech 101草图数据集上,DSGNHT-NAIS结合NADE/NADE 150的测试对数似然达到-100.0,较RWS提升4.3纳特。
- 将重要性样本数从M=1增加至M=100,测试对数似然从-105.3提升至-100.0,证明了后验均值估计的优势。
- 在SBN/SBN 300-100-50-10上,该方法达到最先进性能,测试对数似然为-103.6,优于RWS及其他竞争方法。
- 神经自适应重要性采样器(NAIS)显著提升了采样效率,相比Gibbs采样,实现了高维空间中更快的混合速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。