[论文解读] Hamiltonian Variational Auto-Encoder
本文提出哈密顿变分自编码器(HVAE),一种利用时变哈密顿动力学构建目标感知归一化流以实现变分推断的方法。通过结合哈密顿重要性采样与重参数化技巧,HVAE 获得了低方差、无偏的证据下界(ELBO)及其梯度估计,显著提升了在 MNIST 等基准数据集上标准 VAE 和归一化流的后验近似与对数似然性能。
Variational Auto-Encoders (VAEs) have become very popular techniques to perform inference and learning in latent variable models as they allow us to leverage the rich representational power of neural networks to obtain flexible approximations of the posterior of latent variables as well as tight evidence lower bounds (ELBOs). Combined with stochastic variational inference, this provides a methodology scaling to large datasets. However, for this methodology to be practically efficient, it is necessary to obtain low-variance unbiased estimators of the ELBO and its gradients with respect to the parameters of interest. While the use of Markov chain Monte Carlo (MCMC) techniques such as Hamiltonian Monte Carlo (HMC) has been previously suggested to achieve this [23, 26], the proposed methods require specifying reverse kernels which have a large impact on performance. Additionally, the resulting unbiased estimator of the ELBO for most MCMC kernels is typically not amenable to the reparameterization trick. We show here how to optimally select reverse kernels in this setting and, by building upon Hamiltonian Importance Sampling (HIS) [17], we obtain a scheme that provides low-variance unbiased estimators of the ELBO and its gradients using the reparameterization trick. This allows us to develop a Hamiltonian Variational Auto-Encoder (HVAE). This method can be reinterpreted as a target-informed normalizing flow [20] which, within our context, only requires a few evaluations of the gradient of the sampled likelihood and trivial Jacobian calculations at each iteration.
研究动机与目标
- 解决标准 VAE 因均值场假设而难以近似复杂后验分布的局限性。
- 通过无需依赖学习到的反向核的 MCMC 技术,开发一种可扩展的、低方差的 ELBO 及其梯度估计器。
- 通过构建依赖目标后验的非齐次流,结合哈密顿蒙特卡洛与归一化流的优势,利用似然函数的梯度信息。
- 在基于 MCMC 的变分推断框架中实现重参数化技巧,确保高效且无偏的梯度估计。
- 通过用由目标后验信息驱动的动力学替代过参数化的归一化流,提升泛化能力并降低模型复杂度。
提出的方法
- 该方法利用时变哈密顿动力学,通过一系列变换演化基础样本,形成显式依赖于目标后验的流。
- 应用哈密顿重要性采样(HIS),通过具有最优反向核的前向马尔可夫链,构建 ELBO 及其梯度的无偏估计器。
- 反向核由时间反演的哈密顿动力学导出,无需学习的转移模型即可最小化重要性采样估计器的方差。
- 该方法通过确保对数似然的梯度可通过流进行可微分,从而实现重参数化技巧,支持高效的随机优化。
- 该方法仅需对每个数据点进行少量对数似然梯度的评估以及简单的雅可比计算,使其可扩展至高维数据。
- 所得 HVAE 可被解释为一种归一化流,其变换动力学由目标分布所引导,从而提升后验表达能力。
实验结果
研究问题
- RQ1能否在不依赖学习到的反向核的前提下,利用哈密顿动力学在 VAE 框架中构建低方差、无偏的 ELBO 及其梯度估计?
- RQ2将目标感知动力学引入后,相较于标准 VAE 和归一化流,其在后验近似与对数似然估计方面有何改进?
- RQ3在基于 MCMC 的变分推断方案中,重参数化技巧的适用程度如何,能否实现高效的基于梯度的优化?
- RQ4非齐次动力学(如变化的跃迁步长或退火方案)对模型性能有何影响?
- RQ5目标感知流是否能在参数更少的情况下实现优于标准归一化流的性能?
主要发现
- 在 MNIST 上,HVAE 使用自由退火与各层变化的跃迁步长,测试 NLL 达到 82.62,优于基线 VAE(83.20)与标准归一化流。
- 在自由退火下将跃迁步数 K 增加至 15 时性能最佳,表明更长的动力学有助于提升后验近似。
- 在不同层间变化跃迁步长 ε 可进一步提升性能,表明非齐次动力学增强了模型表达能力。
- 通过使用由目标后验信息驱动的动力学,该方法减少了对过参数化流的依赖,从而构建出更高效且泛化能力更强的模型。
- 由时间反演哈密顿动力学导出的最优反向核显著降低了 ELBO 估计器的方差,相比先前基于 MCMC 的方法具有优势。
- HVAE 框架通过重参数化技巧实现了无偏梯度估计,即使在基于 MCMC 的采样下,仍能支持高效的随机优化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。