Skip to main content
QUICK REVIEW

[论文解读] Differentiable Antithetic Sampling for Variance Reduction in Stochastic Variational Inference

Mike Wu, Noah D. Goodman|arXiv (Cornell University)|Oct 5, 2018
Generative Adversarial Networks and Image Synthesis被引用 6
一句话总结

本文提出可微分对偶抽样方法,通过生成与目标总体矩匹配的负相关样本,以降低随机变分推断中的方差。结合对偶抽样与重参数化,该方法实现了低方差、可微分的梯度估计,显著提升了如VAE等深度生成模型的训练稳定性和性能。

ABSTRACT

Stochastic optimization techniques are standard in variational inference algorithms. These methods estimate gradients by approximating expectations with independent Monte Carlo samples. In this paper, we explore a technique that uses correlated, but more representative , samples to reduce estimator variance. Specifically, we show how to generate antithetic samples that match sample moments with the true moments of an underlying importance distribution. Combining a differentiable antithetic sampler with modern stochastic variational inference, we showcase the effectiveness of this approach for learning a deep generative model.

研究动机与目标

  • 在不增加样本数量的前提下,降低随机变分推断中的梯度方差。
  • 开发一种可微分的抽样机制,在保持无偏估计的同时提升样本的代表性。
  • 使对偶抽样能够应用于现代深度生成模型,并支持端到端反向传播。

提出的方法

  • 提出一种可微分对偶抽样器,可生成k个样本,其样本均值η和样本方差δ²精确匹配总体矩。
  • 基于Helmert正交矩阵的变换,将i.i.d.标准正态变量映射为具有受控矩的对偶样本。
  • 采用Marsaglia算法高效生成对偶变量子,相比先前方法减少了随机抽样次数。
  • 将对偶抽样器与重参数化结合,实现通过抽样过程的梯度计算。
  • 推导出对偶样本保持边缘分布为目标分布(如高斯分布)的条件。
  • 采用对偶对的线性组合构造无偏估计量,从而降低方差。

实验结果

研究问题

  • RQ1对偶抽样能否被设计为可微分,以支持变分推断中的基于梯度的优化?
  • RQ2与i.i.d.抽样相比,具有受控样本矩的对偶抽样是否能降低ELBO估计中的方差?
  • RQ3该方法在不同VAE架构、似然族和数据集上的表现如何?
  • RQ4能否通过确定性变换将该方法推广至高斯分布之外的分布?
  • RQ5对偶抽样对深度生成模型的训练稳定性与收敛速度有何影响?

主要发现

  • 所提出的可微分对偶抽样器生成的样本在边缘分布上与目标分布(如高斯分布)一致,同时精确匹配期望的样本矩。
  • 该方法显著降低了ELBO估计中的梯度方差,从而在训练过程中实现更稳定、更快的收敛。
  • 使用对偶样本训练VAE在多个目标函数、后验族和数据集上均表现出性能提升。
  • 该算法所需的随机抽样次数仅为先前对偶抽样方法的一半,显著提升了计算效率。
  • 实验结果表明,测试对数似然和重建质量在小批量设置下均有持续改善。
  • 该方法与现有重参数化技术完全兼容,支持端到端可微分训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。