Skip to main content
QUICK REVIEW

[论文解读] Filtering Variational Objectives

Chris J. Maddison, Dieterich Lawson|arXiv (Cornell University)|May 25, 2017
Gaussian Processes and Bayesian Inference参考文献 53被引用 3
一句话总结

本文提出了过滤变分目标(FIVOs),通过利用基于粒子滤波的边缘似然估计器,为序列潜在变量模型中的最大似然估计引入了一类更紧的下界。FIVO在序列数据上训练深度生成模型时优于ELBO和IWAE,实现了显著更高的对数似然值,同时提升了变分后验质量并减少了后验崩溃现象。

ABSTRACT

When used as a surrogate objective for maximum likelihood estimation in latent variable models, the evidence lower bound (ELBO) produces state-of-the-art results. Inspired by this, we consider the extension of the ELBO to a family of lower bounds defined by a particle filter's estimator of the marginal likelihood, the filtering variational objectives (FIVOs). FIVOs take the same arguments as the ELBO, but can exploit a model's sequential structure to form tighter bounds. We present results that relate the tightness of FIVO's bound to the variance of the particle filter's estimator by considering the generic case of bounds defined as log-transformed likelihood estimators. Experimentally, we show that training with FIVO results in substantial improvements over training the same model architecture with the ELBO on sequential data.

研究动机与目标

  • 解决证据下界(ELBO)在捕捉序列模型中复杂后验依赖关系方面的局限性。
  • 改进具有序列结构的模型在最大似然估计中变分界的紧致性。
  • 提出一类新的目标——过滤变分目标(FIVOs),利用序列建模结构,获得比ELBO和IWAE更紧的下界。
  • 研究粒子滤波估计器的方差与所得变分界紧致性之间的关系。
  • 通过实证结果证明,FIVO在序列数据上能带来更好的模型性能,包括减少后验崩溃和获得更高的对数似然值。

提出的方法

  • 将FIVOs定义为粒子滤波边缘似然估计器的对数,构成真实对数似然的下界。
  • 使用带重采样的顺序重要性采样构建粒子滤波器,以高效估计边缘似然。
  • 将FIVO表述为蒙特卡洛目标(MCO),其中下界来源于边缘似然无偏估计器的对数。
  • 通过无偏梯度估计器实现FIVO的随机梯度上升优化,包括针对重采样步骤的新型梯度估计器。
  • 提出一种VRNN的平滑变体,使变分后验能够依赖于未来观测,从而可与ELBO和IWAE等尖锐目标进行比较。
  • 应用控制变量和方差减少技术以稳定训练,特别是针对重采样梯度分量。

实验结果

研究问题

  • RQ1基于粒子滤波的边缘似然估计器是否能在序列模型中产生比ELBO和IWAE更紧的变分界?
  • RQ2粒子滤波似然估计器的方差如何影响所得FIVO边界的紧致性?
  • RQ3与ELBO和IWAE相比,FIVO训练是否能带来更好的泛化能力与更高的对数似然值?
  • RQ4为何使用FIVO训练的模型比ELBO训练的模型更能有效避免后验崩溃?
  • RQ5尽管重采样步骤使用了有偏梯度,FIVO能否实现稳定优化?其经验后果是什么?

主要发现

  • 在四个音乐建模数据集和TIMIT语音数据集上,使用FIVO训练的模型相比ELBO和IWAE,实现了显著更高的边缘对数似然值。
  • 在JSB Chorales数据集上,FIVO在训练集上实现了-4.08纳特/时间步的对数似然,优于ELBO(-5.48)和IWAE(-5.77)。
  • 在TIMIT数据集上,FIVO相比非平滑ELBO实现了每序列6,991纳特的相对对数似然提升,且在所有方法中表现最佳。
  • 使用FIVO训练的模型保持了较高的KL散度(与先验相比),表明后验崩溃现象显著减少,而ELBO训练的模型则表现出强烈的后验崩溃。
  • 在训练中不使用重采样梯度项时,收敛速度更快且性能更优,表明重采样梯度可能具有破坏性或高度可变。
  • 将变分后验平滑以包含未来信息并未提升FIVO性能,而这一做法在IWAE中有效,表明FIVO的边界已足够紧致且稳健。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。