[论文解读] Differentiable Antithetic Sampling for Variance Reduction in Stochastic Variational Inference
本文提出可微分对偶抽样方法,通过生成与目标总体矩匹配的负相关样本,以降低随机变分推断中的方差。结合对偶抽样与重参数化,该方法实现了低方差、可微分的梯度估计,显著提升了如VAE等深度生成模型的训练稳定性和性能。
Stochastic optimization techniques are standard in variational inference algorithms. These methods estimate gradients by approximating expectations with independent Monte Carlo samples. In this paper, we explore a technique that uses correlated, but more representative , samples to reduce estimator variance. Specifically, we show how to generate antithetic samples that match sample moments with the true moments of an underlying importance distribution. Combining a differentiable antithetic sampler with modern stochastic variational inference, we showcase the effectiveness of this approach for learning a deep generative model.
研究动机与目标
- 在不增加样本数量的前提下,降低随机变分推断中的梯度方差。
- 开发一种可微分的抽样机制,在保持无偏估计的同时提升样本的代表性。
- 使对偶抽样能够应用于现代深度生成模型,并支持端到端反向传播。
提出的方法
- 提出一种可微分对偶抽样器,可生成k个样本,其样本均值η和样本方差δ²精确匹配总体矩。
- 基于Helmert正交矩阵的变换,将i.i.d.标准正态变量映射为具有受控矩的对偶样本。
- 采用Marsaglia算法高效生成对偶变量子,相比先前方法减少了随机抽样次数。
- 将对偶抽样器与重参数化结合,实现通过抽样过程的梯度计算。
- 推导出对偶样本保持边缘分布为目标分布(如高斯分布)的条件。
- 采用对偶对的线性组合构造无偏估计量,从而降低方差。
实验结果
研究问题
- RQ1对偶抽样能否被设计为可微分,以支持变分推断中的基于梯度的优化?
- RQ2与i.i.d.抽样相比,具有受控样本矩的对偶抽样是否能降低ELBO估计中的方差?
- RQ3该方法在不同VAE架构、似然族和数据集上的表现如何?
- RQ4能否通过确定性变换将该方法推广至高斯分布之外的分布?
- RQ5对偶抽样对深度生成模型的训练稳定性与收敛速度有何影响?
主要发现
- 所提出的可微分对偶抽样器生成的样本在边缘分布上与目标分布(如高斯分布)一致,同时精确匹配期望的样本矩。
- 该方法显著降低了ELBO估计中的梯度方差,从而在训练过程中实现更稳定、更快的收敛。
- 使用对偶样本训练VAE在多个目标函数、后验族和数据集上均表现出性能提升。
- 该算法所需的随机抽样次数仅为先前对偶抽样方法的一半,显著提升了计算效率。
- 实验结果表明,测试对数似然和重建质量在小批量设置下均有持续改善。
- 该方法与现有重参数化技术完全兼容,支持端到端可微分训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。