Skip to main content
QUICK REVIEW

[论文解读] Automatic structured variational inference

Luca Ambrogioni, Kate Ching‐Ju Lin|arXiv (Cornell University)|Feb 3, 2020
Gaussian Processes and Bayesian Inference参考文献 44被引用 10
一句话总结

本文提出自动结构化变分推断(ASVI),一种完全自动化的方法,通过模仿共轭指数族更新机制构建结构化变分族,从而在概率程序中实现高效且精确的后验近似。ASVI 在低维与高维模型上均达到最先进性能,优于均值场方法与逆自回归流方法,同时保持与原始模型相同的计算复杂度。

ABSTRACT

Stochastic variational inference offers an attractive option as a default method for differentiable probabilistic programming. However, the performance of the variational approach depends on the choice of an appropriate variational family. Here, we introduce automatic structured variational inference (ASVI), a fully automated method for constructing structured variational families, inspired by the closed-form update in conjugate Bayesian models. These convex-update families incorporate the forward pass of the input probabilistic program and can therefore capture complex statistical dependencies. Convex-update families have the same space and time complexity as the input probabilistic program and are therefore tractable for a very large family of models including both continuous and discrete variables. We validate our automatic variational method on a wide range of low- and high-dimensional inference problems. We find that ASVI provides a clear improvement in performance when compared with other popular approaches such as the mean-field approach and inverse autoregressive flows. We provide an open source implementation of ASVI in TensorFlow Probability.

研究动机与目标

  • 自动化构建能够捕捉概率程序中复杂依赖关系的结构化变分族。
  • 克服均值场方法与人工设计的结构化变分推断方法的局限性,后者通常需要手动设计或强假设。
  • 开发一种方法,在保留输入模型前向传播结构的同时,实现可扩展且可微分的推断。
  • 为 TensorFlow Probability 等自动微分框架提供均值场 VI 的即插即用替代方案。
  • 在不增加计算复杂度超过原始模型的前提下,实现高性能的后验近似。

提出的方法

  • ASVI 构建一个凸更新变分族,其中每个潜变量的后验参数是父节点诱导参数与数据驱动项的凸组合,以模拟共轭指数族更新。
  • 该方法采用一种参数化方式,将概率程序的确定性前向传播与数据依赖更新相结合,确保与原始模型具有相同的时间与空间复杂度。
  • 变分族被定义为:每个潜变量的均值是父网络输出与数据驱动分量的加权平均,其中混合权重可学习。
  • 该方法支持连续与离散变量,且与标准随机梯度优化及自动微分兼容。
  • 该方法通过 `tfp.experimental.build_asvi_surrogate_posterior` 在 TensorFlow Probability 中实现为可重用组件。
  • 通过使用推理网络预测变分参数中的数据依赖分量,实现推理的摊销化。

实验结果

研究问题

  • RQ1是否能够通过完全自动化的方法构建结构化变分族,在无需模型特定推导的前提下捕捉概率程序中的复杂依赖?
  • RQ2在结构化概率模型上,ASVI 与均值场方法及逆自回归流基线相比,性能如何?
  • RQ3凸更新族是否能在保持与原始模型相同计算复杂度的同时,提升后验近似质量?
  • RQ4当图模型中存在汇聚箭头(如贝叶斯神经网络中)时,ASVI 能在多大程度上捕捉后验依赖关系?
  • RQ5ASVI 在低维与高维推理问题中,包括深度生成模型,是否具有良好的泛化能力?

主要发现

  • 在所有测试的低维模型中,ASVI 显著优于均值场 VI,ELBO 提升幅度在不同数据集上达到 1.5 至 10.5 分不等。
  • 在贝叶斯逻辑回归模型中,ASVI 的 ELBO 达到 -158.2 ± 1.3,而均值场方法为 -166.7 ± 0.2,显示出明显的性能优势。
  • 在深度变分自编码器实验中,ASVI 在 MNIST、FashionMNIST 和 KMNIST 三个数据集上均实现了高于均值场基线的测试集 ELBO。
  • 在联合图像与标签生成及仅图像生成任务中,深度模型的性能提升保持一致。
  • ASVI 在保持更低计算复杂度的同时,实现了与高容量归一化流方法(如逆自回归流,IAFs)相当的性能。
  • 该方法即使在先验图中存在汇聚箭头的情况下,也能通过模型的前向传播成功捕捉后验结构,尽管无法直接建模此类结构引发的依赖关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。