[论文解读] Hierarchical Variational Models
本文提出了分层变分模型(HVMs),一种通过在变分参数上设置先验来增强变分推断的框架,从而在保持黑箱计算效率的同时,实现更丰富的后验近似。HVMs 显著提升了近似保真度,尤其在深度离散潜在变量模型中表现突出,在文本数据集上的困惑度相比均值场变分推断最高降低了180分。
Black box variational inference allows researchers to easily prototype and evaluate an array of models. Recent advances allow such algorithms to scale to high dimensions. However, a central question remains: How to specify an expressive variational distribution that maintains efficient computation? To address this, we develop hierarchical variational models (HVMs). HVMs augment a variational approximation with a prior on its parameters, which allows it to capture complex structure for both discrete and continuous latent variables. The algorithm we develop is black box, can be used for any HVM, and has the same computational efficiency as the original approximation. We study HVMs on a variety of deep discrete latent variable models. HVMs generalize other expressive variational distributions and maintains higher fidelity to the posterior.
研究动机与目标
- 解决均值场变分推断在捕捉潜在变量之间后验依赖关系方面的局限性。
- 构建一个灵活且表达能力强的变分族,同时保持高维模型的计算效率。
- 在如具有离散潜在变量的深度指数族等复杂模型中实现有效推断。
- 通过在变分参数上引入先验来构建分层结构,推广现有变分族。
- 在提升近似质量的同时,保持黑箱推断能力,适用于连续和离散潜在变量。
提出的方法
- 通过在基础变分族 $ q_{\text{mf}}(\boldsymbol{z}; \boldsymbol{\lambda}) $ 的参数 $ \boldsymbol{\lambda} $ 上设置先验 $ q(\boldsymbol{\lambda}; \boldsymbol{\theta}) $,构建分层变分模型,得到边缘化分布 $ q_{\text{hvm}}(\boldsymbol{z}; \boldsymbol{\theta}) = \int q(\boldsymbol{\lambda}; \boldsymbol{\theta}) \prod_i q(z_i; \boldsymbol{\lambda}_i) d\boldsymbol{\lambda} $。
- 使用归一化流(如平面流)建模先验 $ q(\boldsymbol{\lambda}; \boldsymbol{\theta}) $,以实现灵活的非高斯参数分布。
- 应用黑箱变分推断优化超参数 $ \boldsymbol{\theta} $,保持与标准均值场推断相同的计算效率。
- 将分层先验整合到现有变分族中,使其能够捕捉后验中的复杂依赖关系和多模态结构。
- 在推断过程中利用联合后验 $ q(\boldsymbol{\lambda} \mid \boldsymbol{z}, \boldsymbol{\theta}) $ 来优化参数估计,从而提升近似质量。
实验结果
研究问题
- RQ1我们能否构建一个比均值场更富表达力的变分族,同时仍支持高效的黑箱优化?
- RQ2在具有离散潜在变量的模型中,在变分参数上设置分层先验如何改善后验近似?
- RQ3HVMs 在深度潜在变量模型(如深度指数族)中相比均值场变分推断的性能提升程度如何?
- RQ4HVMs 是否能有效建模均值场方法失效的多层泊松和伯努利深度指数族?
- RQ5变分族中的分层结构是否能降低对模型深度的敏感性,并提升跨数据集的泛化能力?
主要发现
- 在两个文本数据集上的六个模型中,HVMs 相较于均值场变分推断实现了平均180分的困惑度降低,且在多层模型中保持一致的性能增益。
- 在 Science 数据集上,HVMs 识别出多层泊松模型为最优结构,而均值场变分推断因近似保真度不足而未能检测到该结构。
- 在《纽约时报》数据集上,HVMs 在六组模型中的五组表现优于均值场,仅在两层伯努利模型中均值场方法略胜一筹。
- HVMs 实现了对多层泊松深度指数族的有效推断,这类模型中均值场变分推断无法收敛或产生有意义的结果。
- 将归一化流作为变分参数的先验,显著提升了建模灵活性,同时未牺牲计算效率。
- HVMs 在保持黑箱推断效率的同时,能够捕捉复杂后验依赖关系和多模态结构,尤其在深度离散潜在变量模型中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。