[论文解读] Deep Involutive Generative Models for Neural MCMC
本文提出深度卷积生成模型,一种体积保持、自逆的神经网络,可实现对复杂MCMC提议分布的快速、通用近似。通过利用这些模型构建Metropolis–Hastings更新,该方法在多模态后验分布上实现近乎瞬时收敛——在高斯混合模型实验中,表现出100%的接受率,且混合速度优于A-NICE-MC和混合蒙特卡洛方法。
We introduce deep involutive generative models, a new architecture for deep generative modeling, and use them to define Involutive Neural MCMC, a new approach to fast neural MCMC. An involutive generative model represents a probability kernel $G(ϕ\mapsto ϕ')$ as an involutive (i.e., self-inverting) deterministic function $f(ϕ, π)$ on an enlarged state space containing auxiliary variables $π$. We show how to make these models volume preserving, and how to use deep volume-preserving involutive generative models to make valid Metropolis-Hastings updates based on an auxiliary variable scheme with an easy-to-calculate acceptance ratio. We prove that deep involutive generative models and their volume-preserving special case are universal approximators for probability kernels. This result implies that with enough network capacity and training time, they can be used to learn arbitrarily complex MCMC updates. We define a loss function and optimization algorithm for training parameters given simulated data. We also provide initial experiments showing that Involutive Neural MCMC can efficiently explore multi-modal distributions that are intractable for Hybrid Monte Carlo, and can converge faster than A-NICE-MC, a recently introduced neural MCMC technique.
研究动机与目标
- 为解决复杂、多模态后验分布中学习高效、快速收敛的MCMC提议的挑战。
- 解决在Metropolis–Hastings算法中构建满足细致平衡条件的确定性、卷积神经提议的困难。
- 开发一种无需显式密度计算的通用、可训练MCMC提议学习框架。
- 与现有神经MCMC方法(如A-NICE-MC和混合蒙特卡洛)相比,提升收敛速度和混合效率。
- 建立深度体积保持卷积生成模型在MCMC中理论上的通用性与实际有效性。
提出的方法
- 提出卷积神经网络——通过使用具有耦合层的可逆块的对称组合,构造出保证自逆(f(f(x)) = x)的深层架构。
- 通过在扩展状态空间上使用辅助变量π的确定性、体积保持函数f(ϕ, π),将深层卷积生成模型构建为概率核G(ϕ ↦ ϕ′)。
- 采用辅助变量方案,使接受率解析可计算:p = [f_Φ(ϕ) f_Y(π′)] / [f_Φ(ϕ) f_Y(π)],从而实现有效的Metropolis–Hastings更新。
- 通过将网络的雅可比行列式约束为绝对值1,实现体积保持,确保细致平衡。
- 使用方差更低的估计器训练Markov-GAN目标,实现生成模型在模拟数据上的稳定优化。
- 采用对称架构:I_F^{n,g} ∘ I_P^{n,σ} ∘ I_F^{n,h} ∘ I_P^{n,σ} ∘ I_F^{n,g},其中包含随机排列和使用ReLU与全连接层的可学习可逆块(g, h)。
实验结果
研究问题
- RQ1我们能否构建一类既具有卷积性又保持体积的神经MCMC提议,从而在无需密度评估的情况下确保细致平衡?
- RQ2深度体积保持卷积生成模型能否通用近似MCMC中的任意转移核?
- RQ3在多模态后验分布上,卷积神经MCMC是否比A-NICE-MC和混合蒙特卡罗方法具有更快的收敛速度和更好的混合性能?
- RQ4在高维、多模态设置下,该方法的提议接受概率与标准基线相比如何?
- RQ5网络的自逆特性是否能简化神经MCMC中的收敛诊断与训练稳定性?
主要发现
- 在六高斯混合模型中,卷积神经MCMC对提议转移的接受概率接近100%,显著优于A-NICE-MC约50%的接受率。
- 来自卷积神经MCMC的提议从任意初始状态几乎完全匹配真实后验分布,实现在单步内近乎瞬时收敛。
- 在混合蒙特卡洛因跨模态高拒绝率而失效的多模态分布中,该方法成功实现模态间混合。
- 实验表明,卷积神经MCMC收敛速度快于A-NICE-MC,采样链的混合速度更快,自相关性更低。
- 理论结果证明,深度体积保持卷积生成模型是概率核的通用近似器,为黑箱MCMC提议学习提供了理论依据。
- 该方法使MCMC提议的训练无需显式计算输出密度,扩展了基于GAN的方法在MCMC中的适用范围。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。