Skip to main content
QUICK REVIEW

[论文解读] To Relieve Your Headache of Training an MRF, Take AdVIL

Chongxuan Li, Chao Du|arXiv (Cornell University)|Jan 24, 2019
Gaussian Processes and Bayesian Inference参考文献 47被引用 5
一句话总结

AdVIL 提出了一种基于极小极大优化框架的黑箱变分推断与学习方法,用于马尔可夫随机场(MRFs),该框架使用两种变分分布:用于潜变量推断的变分编码器和用于估计对数归一化常数的变分解码器。与 NVIL 和对比发散方法相比,AdVIL 在复杂模型(如深度玻尔兹曼机)中实现了更紧的对数归一化常数估计和更优的似然性能。

ABSTRACT

We propose a black-box algorithm called {\it Adversarial Variational Inference and Learning} (AdVIL) to perform inference and learning on a general Markov random field (MRF). AdVIL employs two variational distributions to approximately infer the latent variables and estimate the partition function of an MRF, respectively. The two variational distributions provide an estimate of the negative log-likelihood of the MRF as a minimax optimization problem, which is solved by stochastic gradient descent. AdVIL is proven convergent under certain conditions. On one hand, compared with contrastive divergence, AdVIL requires a minimal assumption about the model structure and can deal with a broader family of MRFs. On the other hand, compared with existing black-box methods, AdVIL provides a tighter estimate of the log partition function and achieves much better empirical results.

研究动机与目标

  • 开发一种适用于一般马尔可夫随机场(MRFs)的黑箱推断与学习方法,避免依赖于模型特异性分析。
  • 解决现有方法的局限性,包括对归一化常数估计不佳以及对模型结构的依赖。
  • 在 NVIL 的基础上,通过提供对数归一化常数的更紧下界,解决 MRF 推断问题。
  • 实现具有潜变量的马尔可夫随机场的端到端训练,采用随机梯度下降。
  • 在复杂 MRF(如深度玻尔兹曼机)上,实现比对比发散和 NVIL 更优的实验性能。

提出的方法

  • AdVIL 使用两种变分分布:变分编码器用于近似潜变量的后验分布,变分解码器用于估计归一化常数。
  • 该方法将负对数似然表述为一个极小极大优化问题,结合自由能的上下界。
  • 变分解码器引入一个辅助变量以增强灵活性,熵项通过第三重变分技巧近似。
  • 训练通过在编码器和解码器之间交替进行随机梯度下降实现,模拟 GAN 类目标。
  • 该框架支持高效的祖先采样以实现生成,并实现无需模型特异性推导的黑箱训练。
  • 在变分解码器能良好近似真实模型的条件下,证明了理论收敛性。

实验结果

研究问题

  • RQ1能否为 MRF 开发一种避免模型特异性分析并支持端到端训练的黑箱方法?
  • RQ2能否在 NVIL 存在低估问题的前提下,实现对数归一化常数的更紧下界?
  • RQ3极小极大变分框架是否能提升复杂 MRF(如深度玻尔兹曼机)的对数似然性能?
  • RQ4在变分分布中引入熵项如何影响模型收敛性和生成质量?
  • RQ5对抗训练原则能否被有效适配到具有不可计算归一化常数的无向模型?

主要发现

  • AdVIL 在所有数据集上的对数似然结果显著优于 NVIL,包括在 Digits 数据集上实现了 1.02 nats 的平均提升。
  • 在 Digits 数据集上,采用分层解码器的 AdVIL 实现了测试 NLL -27.89,优于 VCD 的 -28.49,并与最佳基线模型相当。
  • 在 RBM 中,AdVIL 在 Digits 数据集上实现了 -26.34 nats 的平均 AIS 结果,优于 NVIL 的 -27.36 nats,表明其对数归一化常数估计更紧。
  • 采用 NADE 解码器的 AdVIL 表现略差且不稳定,表明辅助变量结构的重要性。
  • 消融研究证实,若从变分分布中移除熵项,将导致模式崩溃并无法生成有意义的样本。
  • AdVIL 的极小极大优化导致学习曲线不如 VCD 稳定,但在深度模型(如 DBMs)中实现了更优的最终性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。