Skip to main content
QUICK REVIEW

[论文解读] Variational Inference with Continuously-Indexed Normalizing Flows

Anthony L. Caterini, Rob Cornish|arXiv (Cornell University)|Jul 10, 2020
Gaussian Processes and Bayesian Inference参考文献 38被引用 5
一句话总结

本文通过将连续索引流(CIFs)整合到辅助变分推断(AVI)框架中,提出了一种新颖且高度表达的变分推断(VI)后验近似方法。借助CIFs的可 tractable 联合分布和条件独立性结构,该方法实现了低方差的模型证据估计,并在复杂后验拓扑和最大似然估计任务中优于标准归一化流。

ABSTRACT

Continuously-indexed flows (CIFs) have recently achieved improvements over baseline normalizing flows on a variety of density estimation tasks. CIFs do not possess a closed-form marginal density, and so, unlike standard flows, cannot be plugged in directly to a variational inference (VI) scheme in order to produce a more expressive family of approximate posteriors. However, we show here how CIFs can be used as part of an auxiliary VI scheme to formulate and train expressive posterior approximations in a natural way. We exploit the conditional independence structure of multi-layer CIFs to build the required auxiliary inference models, which we show empirically yield low-variance estimators of the model evidence. We then demonstrate the advantages of CIFs over baseline flows in VI problems when the posterior distribution of interest possesses a complicated topology, obtaining improved results in both the Bayesian inference and surrogate maximum likelihood settings.

研究动机与目标

  • 为解决标准归一化流因双射约束而难以建模复杂后验拓扑的局限性。
  • 通过将缺乏闭式边缘密度的连续索引流(CIFs)整合到辅助变分推断(AVI)框架中,实现其在变分推断中的有效使用。
  • 证明CIFs在贝叶斯推断和代理最大似然设置下,能够提供比基线流更表达性和更精确的后验近似。
  • 表明CIFs通过其可 tractable 联合分布和压缩推断结构,能够维持低方差的模型证据估计器。

提出的方法

  • 在辅助变分推断(AVI)方案中使用CIFs作为变分后验,其中潜在变量与辅助索引变量的联合分布保持可 tractable。
  • 利用多层CIFs的条件独立性结构,构建高效索引变量的辅助推断模型。
  • 通过训练条件神经网络 $q_{U_{ ext{loc}}|W_{ ext{loc}}}$ 和 $r_{U_{ ext{loc}}|W_{ ext{loc}},X}$ 实现压缩推断,从潜在空间和数据中推断辅助变量。
  • 使用小型VAE编码器作为基础分布 $q_{W_0|X}$,将图像数据映射到潜在空间,减少对大型编码器的依赖。
  • 在每个流层使用单个神经网络参数化流变换 $G_{ ext{loc}}$ 中的耦合变换 $s_{ ext{loc}}$ 和 $t_{ ext{loc}}$,确保参数效率。
  • 通过重要性采样使用代理目标优化ELBO,并应用梯度裁剪以保证训练稳定性。

实验结果

研究问题

  • RQ1尽管边缘分布不可 tractable,连续索引流(CIFs)是否能在变分推断中有效使用?
  • RQ2将CIFs整合到辅助变分推断(AVI)框架中,是否能相比标准归一化流获得更低方差的模型证据估计器?
  • RQ3基于CIF的后验近似是否在建模具有非平凡拓扑的复杂后验分布方面优于基线归一化流?
  • RQ4CIFs是否能在潜在变量模型的代理最大似然估计中提升性能,相比标准流基线?

主要发现

  • 在测试集上,CIF模型在估计的平均边缘似然方面始终优于对应的基线归一化流,其中CIF-MAF和CIF-NSF分别显著优于Small MAF和Small NSF。
  • CIF模型在所有实验中均达到最佳平均性能,或在误差范围内与最佳结果相当,证明其在贝叶斯推断和最大似然估计中的优越性。
  • 尽管参数效率高于IWAE方法,CIF模型在更少训练周期内达到优于IWAE的性能,表明其具有更高的样本效率。
  • 使用AVI的CIFs实现了低方差的模型证据估计,验证了该框架的理论优势。
  • 参数数量与较大基线流相近的压缩CIF变体仍优于后者,表明CIFs为复杂后验提供了强大的归纳偏置。
  • 通过梯度裁剪(最大范数为5)保持了训练稳定性,证实了该方法在不同架构下的实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。