[论文解读] Learning Deep Generative Models with Annealed Importance Sampling
本文提出使用退火重要性采样(AIS)——受Jarzynski等式启发——通过弥合变分推断(VI)与马尔可夫链蒙特卡洛(MCMC)之间的差距,来改进深度生成模型的训练。该方法推广了变分自编码器(VAEs)和重要性加权自编码器(IWAE),通过高效的计算-精度权衡实现更优的边缘似然估计,且无需增加内存使用,在MNIST和Omniglot数据集上优于IWAE和MH-HMC。
Variational inference (VI) and Markov chain Monte Carlo (MCMC) are two main approximate approaches for learning deep generative models by maximizing marginal likelihood. In this paper, we propose using annealed importance sampling for learning deep generative models. Our proposed approach bridges VI with MCMC. It generalizes VI methods such as variational auto-encoders and importance weighted auto-encoders (IWAE) and the MCMC method proposed in (Hoffman, 2017). It also provides insights into why running multiple short MCMC chains can help learning deep generative models. Through experiments, we show that our approach yields better density models than IWAE and can effectively trade computation for model accuracy without increasing memory cost.
研究动机与目标
- 为解决在最大似然学习过程中难以计算的后验分布近似问题。
- 弥合变分推断(VI)与马尔可夫链蒙特卡洛(MCMC)方法之间的差距,以实现更精确的似然估计。
- 开发一个统一框架,通过AIS推广VAEs、IWAEs以及基于MCMC的学习方法。
- 在不增加内存使用的情况下,实现计算成本与模型精度之间的有效权衡。
- 提供关于为何使用多个短MCMC链能改善模型学习的理论与实证见解。
提出的方法
- 该方法使用退火重要性采样(AIS)来估计对数边缘似然的梯度,利用从提议分布到目标后验的一系列中间分布。
- 将梯度估计器表述为沿分布路径加权样本的期望,路径由从0到1的温度调度 $\beta_t$ 参数化。
- 核心估计器通过允许多条重要性采样路径并采用自适应加权,推广了IWAE,从而改善后验近似。
- 该方法采用自由形式的温度调度 $\beta_t$,满足 $0 = \beta_0 \leq \cdots \leq \beta_T = 1$,支持灵活的路径构建。
- 在AIS框架内集成MCMC步骤(如MH-HMC),以在退火路径上优化样本质量,提升样本精度。
- 该方法支持单条与多条样本路径,性能随 $K$(样本数量)和 $T$(退火步数)的增加而提升。
实验结果
研究问题
- RQ1能否将退火重要性采样用作统一框架,以推广用于深度生成模型学习的VI与MCMC方法?
- RQ2与标准VAEs和IWAEs相比,AIS在边缘似然估计方面有何改进?
- RQ3为何使用多个短MCMC链能改善模型学习?这一现象能否在AIS框架内形式化?
- RQ4在相同计算成本下,AIS能否实现比IWAE和MH-HMC更高的模型精度?
- RQ5增加 $K$(样本数量)和 $T$(退火步数)对模型性能与计算效率有何影响?
主要发现
- 在Omniglot数据集上,所提方法在 $L=5$、$K=50$、$T=11$ 条件下实现了测试对数似然 -101.64,优于相同计算成本下的IWAE-DReG和MH-HMC。
- 在相同计算成本下,所提方法生成的密度模型优于IWAE-DReG,表明其具备更优的计算-精度权衡能力。
- 当 $T=11$ 时,MH-HMC方法略胜一筹;但当 $T=5$ 时,所提方法表现更优,表明其对路径长度敏感。
- 增加 $K$ 或 $T$ 均能持续提升模型性能,证实更优的后验近似可带来更精确的梯度估计。
- 该方法在MNIST和Omniglot数据集上均实现了最先进的边缘似然估计,基于AIS的似然估计通过双向蒙特卡洛方法验证。
- 该方法可在不增加内存成本的前提下实现有效的计算-精度权衡,适用于大规模深度生成建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。