[论文解读] No MCMC for me: Amortized sampling for fast and stable training of energy-based models
本文提出 VERA(变分熵正则化近似最大似然),一种用快速、可微的生成器网络替代能量模型(EBM)训练中缓慢且不稳定的 MCMC 采样方法。通过摊销 MCMC 采样并使用变分近似进行熵正则化,VERA 实现了更快、更稳定的 EBM 训练,达到最先进的似然性能,并在表格数据上实现了有效的半监督学习。
Energy-Based Models (EBMs) present a flexible and appealing way to represent uncertainty. Despite recent advances, training EBMs on high-dimensional data remains a challenging problem as the state-of-the-art approaches are costly, unstable, and require considerable tuning and domain expertise to apply successfully. In this work, we present a simple method for training EBMs at scale which uses an entropy-regularized generator to amortize the MCMC sampling typically used in EBM training. We improve upon prior MCMC-based entropy regularization methods with a fast variational approximation. We demonstrate the effectiveness of our approach by using it to train tractable likelihood models. Next, we apply our estimator to the recently proposed Joint Energy Model (JEM), where we match the original performance with faster and stable training. This allows us to extend JEM models to semi-supervised classification on tabular data from a variety of continuous domains.
研究动机与目标
- 为解决在高维数据上基于 MCMC 的能量模型(EBM)训练的不稳定性与高计算成本问题。
- 开发一种可扩展、稳定且高效的现有 EBM 训练方法的替代方案,避免得分匹配、噪声对比估计和 MCMC 采样方法的局限性。
- 在无需辅助模型或限制网络架构选择的前提下,实现高似然的 EBM 训练。
- 稳定并加速联合能量模型(JEM)的训练,特别是在高维表格数据上的半监督学习。
- 证明熵正则化生成模型能够产生高质量的似然估计和泛化性能。
提出的方法
- 将 EBM 的最大似然训练重新解释为双层变分优化问题,实现 MCMC 采样的摊销化。
- 引入一个生成器网络,学习从模型分布中采样,用单次前向传播替代迭代的 MCMC 步骤。
- 使用快速变分近似对生成器施加熵正则化,提升稳定性和收敛性。
- 采用可微目标函数,结合能量模型损失与熵正则化,支持通过反向传播进行端到端训练。
- 使用随机梯度估计器,通过生成器采样近似似然目标函数,避免直接进行 MCMC 采样。
- 将生成器视为真实模型分布的变分近似,熵正则化确保样本的多样性与覆盖性。
实验结果
研究问题
- RQ1我们能否用可学习、可微的生成器替代 EBM 训练中的 MCMC 采样,以提升训练速度与稳定性?
- RQ2通过变分近似实现的熵正则化是否能带来优于传统基于 MCMC 方法的似然估计?
- RQ3VERA 是否能在先前方法失效的高维表格数据上,实现 JEM 的有效半监督学习?
- RQ4在图像和表格基准数据集上,VERA 与最先进的 EBM 和 GAN 模型相比,在似然和准确率方面表现如何?
- RQ5VERA 中基于生成器的采样能否在保持准确似然估计的同时生成高质量样本?
主要发现
- 在高斯混合分布上,VERA 的似然性能显著优于基于 MCMC 的训练(PCD),在最优设置下,moons 数据集上的似然值分别为 -2.58 和 -3.82。
- 在 MNIST 上,VERA 在 α=1 时取得 27.5 的 Fréchet Inception 距离(FID),优于 SNGAN(25.50)和 NCSN(23.52),且在 FID 上超过基线 JEM。
- 在表格数据(HEPMASS、CROP、HUMAN)的半监督学习中,当缺乏领域知识时,VERA 训练的 JEM 模型优于虚拟对抗训练(VAT)。
- VERA 实现了 JEM 在表格数据上的稳定训练,使以往因不稳定性而失败的半监督分类任务得以成功完成。
- 在 CIFAR-10 和 CIFAR-100 上,VERA 分别取得 30.5 和 32.4 的 FID 分数,实现最先进的无条件与条件生成性能。
- 消融研究证实,熵正则化系数(λ)和生成器多样性(α)对性能至关重要,其中 α=100 时 FID 和 IS 分数表现最佳。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。