[论文解读] Doubly Semi-Implicit Variational Inference
本论文提出了双重半隐式变分推断(DSIVI),一种在近似后验与先验均为半隐式分布时的变分推断框架——即由可 tractable 的密度组成、并以灵活的隐式混合测度进行混合的分布。DSIVI 提供了 ELBO 的渐近精确下界,以及可任意收紧的上界,从而实现了对具有隐式先验与后验的模型的精确变分学习,并在 VAE 中改进了 VampPrior,实现了无需预热的更富表达性、可学习的先验。
We extend the existing framework of semi-implicit variational inference (SIVI) and introduce doubly semi-implicit variational inference (DSIVI), a way to perform variational inference and learning when both the approximate posterior and the prior distribution are semi-implicit. In other words, DSIVI performs inference in models where the prior and the posterior can be expressed as an intractable infinite mixture of some analytic density with a highly flexible implicit mixing distribution. We provide a sandwich bound on the evidence lower bound (ELBO) objective that can be made arbitrarily tight. Unlike discriminator-based and kernel-based approaches to implicit variational inference, DSIVI optimizes a proper lower bound on ELBO that is asymptotically exact. We evaluate DSIVI on a set of problems that benefit from implicit priors. In particular, we show that DSIVI gives rise to a simple modification of VampPrior, the current state-of-the-art prior for variational autoencoders, which improves its performance.
研究动机与目标
- 为解决现有变分推断方法在先验与后验均需可 tractable 密度时的局限性,特别是在需要隐式分布以实现更好建模时。
- 开发一种框架,支持当近似后验与先验均为半隐式(即分析密度的混合,其混合分布为隐式)时的变分推断。
- 提供一个 ELBO 的下界,该下界在样本量增大时渐近精确,同时提供一个可任意收紧的上界,以支持可靠的优化。
- 在实际场景(如使用隐式先验的 VAE)中展示 DSIVI 的有效性,特别是相较于 SOTA 方法(如 VampPrior)的改进。
提出的方法
- 提出双重半隐式变分推断(DSIVI)框架,其中先验与后验均建模为半隐式分布——即分析密度的混合,其混合测度为隐式。
- 通过重参数化梯度与 KL 散度的变分表示,推导出受 SIVI 启发的 ELBO 渐近精确下界。
- 利用夹逼界(sandwich bound)构建 ELBO 的上界,且随着样本量增加,该上界可任意收紧。
- 通过将后验与先验样本表示为噪声变量的确定性变换,实现梯度估计的重参数化技巧。
- 使用神经网络参数化混合分布(如先验),实现先验与后验的端到端联合训练。
- 在 VAE 中应用该方法,将先验建模为高斯混合的半隐式形式,包含可学习的伪输入与灵活的混合网络。
实验结果
研究问题
- RQ1我们能否在先验与后验均为半隐式(即通过隐式混合分布定义)的情况下进行变分推断?
- RQ2我们能否在该设定下构造一个 ELBO 的渐近精确下界?
- RQ3我们能否通过夹逼在可任意收紧的下界与上界之间,实现更紧致的 ELBO 边界?
- RQ4DSIVI 在使用隐式先验的模型(如 VAE)中是否能提升性能,特别是相较于现有方法(如 VampPrior)?
主要发现
- DSIVI 在 ELBO 上的下界比以往的隐式变分推断方法更紧致,且随着样本量增加,该下界渐近精确。
- 该方法实现了在半隐式框架下先验与后验的端到端训练,使得建模能力显著优于标准的 VampPrior。
- 在 MNIST 上的 VAE 中,DSIVI-agg(半隐式聚合后验)在 K=5000 时达到测试对数似然 ≥−82.16,优于 VampPrior(−82.38)与 VampPrior-data(−85.05)。
- DSIVI-prior 采用全因子化高斯条件与神经网络混合分布,无需预热即可实现 −82.27 的对数似然,优于 VampPrior。
- 在层次化 VAE 中,DSIVI-agg 实现了 ≥−81.09 的对数似然,优于 VampPrior(−81.24)与 VampPrior-data(−81.71)。
- 该框架在先验与后验均为半隐式时,仍能成功学习复杂目标分布,如在高斯混合的序列近似实验中所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。