Skip to main content
QUICK REVIEW

[论文解读] Metropolis-Hastings view on variational inference and adversarial training

Kirill Neklyudov, Egorov, Evgenii|arXiv (Cornell University)|Oct 16, 2018
Generative Adversarial Networks and Image Synthesis参考文献 34被引用 9
一句话总结

本文通过将生成器视为提议分布、判别器视为接受测试,将变分推断与生成对抗网络(GANs)统一于马尔可夫链蒙特卡洛(MH)框架之下。提出通过最小化对称KL散度来最大化MH接受率,从而提升后验采样效率与ImageNet上的GAN性能,FID和Inception Score均获得提升。

ABSTRACT

A significant part of MCMC methods can be considered as the Metropolis-Hastings (MH) algorithm with different proposal distributions. From this point of view, the problem of constructing a sampler can be reduced to the question - how to choose a proposal for the MH algorithm? To address this question, we propose to learn an independent sampler that maximizes the acceptance rate of the MH algorithm, which, as we demonstrate, is highly related to the conventional variational inference. For Bayesian inference, the proposed method compares favorably against alternatives to sample from the posterior distribution. Under the same approach, we step beyond the scope of classical MCMC methods and deduce the Generative Adversarial Networks (GANs) framework from scratch, treating the generator as the proposal and the discriminator as the acceptance test. On real-world datasets, we improve Frechet Inception Distance and Inception Score, using different GANs as a proposal distribution for the MH algorithm. In particular, we demonstrate improvements of recently proposed BigGAN model on ImageNet.

研究动机与目标

  • 通过学习最大化马尔可夫链蒙特卡洛(MH)接受率的提议分布,提升采样效率。
  • 在统一的MH框架下整合变分推断与GAN,揭示其共享的底层原理。
  • 证明在MH提议学习中,最小化提议与目标分布之间的对称KL散度,优于反向KL最小化。
  • 通过将MH算法与学习到的判别器作为接受测试,改进GAN训练,提升生成样本质量。
  • 在贝叶斯逻辑回归与大规模图像生成任务上验证方法,FID与Inception Score均取得提升。

提出的方法

  • 提出通过神经网络直接最大化MH接受率,学习独立的提议分布。
  • 利用提议分布与目标分布之间的对称KL散度,推导出接受率的下界。
  • 用对称KL替代标准变分推断目标(反向KL),避免模式崩溃并提升覆盖度。
  • 从零开始重构GAN框架,将生成器解释为提议分布,判别器解释为MH接受测试的密度比估计器。
  • 采用双流判别器架构,估计MH接受决策所需的密度比p(x)/q(x)。
  • 应用MH算法,结合学习到的提议分布与判别器生成样本,实现对复杂后验与数据分布的改进采样。

实验结果

研究问题

  • RQ1最大化马尔可夫链蒙特卡洛(MH)接受率是否能提升使用独立提议的采样效率?
  • RQ2在MH提议学习背景下,对称KL散度最小化与反向KL最小化相比表现如何?
  • RQ3能否通过将生成器视为提议、判别器视为接受测试,从MH算法推导出GAN框架?
  • RQ4将MH算法与学习到的提议分布及判别器结合,是否能提升GAN中样本质量(以FID与Inception Score衡量)?
  • RQ5该基于MH的方法是否能提升贝叶斯模型(如逻辑回归)中的后验采样性能?

主要发现

  • 所提方法通过最小化对称KL散度,实现高于标准变分推断的接受率,避免了模式搜索行为。
  • 在贝叶斯逻辑回归任务中,使用学习提议的MH采样器在采样效率与后验覆盖度方面优于基线方法。
  • 在CIFAR-10与ImageNet上,使用GAN生成器作为提议、训练判别器作为接受测试的MH算法,显著提升了FID与Inception Score。
  • 在ImageNet上的BigGAN中,所提MH方法将FID降低1.5分,Inception Score提升2.1分,证明了其可扩展性。
  • MH链生成的样本展现出更高的多样性与混合性,在MNIST中成功实现数字间的模式切换,而基线方法则表现出模式搜索行为。
  • 从提议分布进行的条件采样显示出马氏依赖性,证实提议并非完全独立,而是具备上下文感知能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。