[论文解读] On Using Control Variates with Stochastic Approximation for Variational Bayes and its Connection to Stochastic Linear Regression
本文提出了一种新颖的控制变量子方法,用于在随机近似变分推断(SAVI)中降低方差,表明最优控制变量子与随机线性回归密切相关。该方法相较于现有方法显著降低了方差,实证结果表明,与基线方法相比,梯度估计器的方差最高可降低10倍。
Recently, we and several other authors have written about the possibilities of using stochastic approximation techniques for fitting variational approximations to intractable Bayesian posterior distributions. Naive implementations of stochastic approximation suffer from high variance in this setting. Several authors have therefore suggested using control variates to reduce this variance, while we have taken a different but analogous approach to reducing the variance which we call stochastic linear regression. In this note we take the former perspective and derive the ideal set of control variates for stochastic approximation variational Bayes under a certain set of assumptions. We then show that using these control variates is closely related to using the stochastic linear regression approximation technique we proposed earlier. A simple example shows that our method for constructing control variates leads to stochastic estimators with much lower variance compared to other approaches.
研究动机与目标
- 通过控制变量子方法降低变分贝叶斯中固有的高方差随机梯度估计器的方差。
- 在特定假设下,推导出随机近似变分推断中理论上最优的控制变量子集合。
- 建立所提出的控制变量子方法与作者先前提出的随机线性回归框架之间的正式联系。
- 通过实证结果证明,所提出的控制变量子相较于现有方法可产生显著更低方差的梯度估计器。
- 通过利用解析协方差结构,无需显式了解对数后验分布的曲率,实现对难以处理的后验分布的高效黑箱推断。
提出的方法
- 在分数函数协方差结构固定且已知的假设下,通过最小化梯度估计器的方差,推导出随机近似变分贝叶斯的理想控制变量子。
- 将KL散度梯度重新表述为分数函数与对数似然比之间的协方差,从而通过线性回归技术实现方差降低。
- 提出一种两步估计器:首先使用蒙特卡洛样本估计分数函数的协方差矩阵,然后利用该协方差矩阵计算基于回归的低方差梯度估计器。
- 采用自然梯度作为搜索方向,其被证明相较于标准梯度具有更好的收敛特性。
- 采用基于样本的协方差矩阵近似,以保持计算效率,尤其在解析形式不可用时。
- 将该方法应用于完全因子化的指数族近似,其中协方差矩阵具有稀疏性且可在小块(如2×2)内可逆,从而实现可扩展的实现。
实验结果
研究问题
- RQ1在随机近似变分推断中,为降低方差,理论上最优的控制变量子集合是什么?
- RQ2所提出的控制变量子方法与作者先前提出的随机线性回归框架有何关联?
- RQ3在实际场景中,所提出的控制变量子是否能显著降低现有控制变量子策略的方差?
- RQ4结合所提出的控制变量子使用自然梯度,是否能在随机优化中实现更快的收敛?
- RQ5当对数后验结构未知或难以处理时,该方法的适用性在多大程度上仍保持有效?
主要发现
- 与Ranganath等人(2013)和Kingma与Welling(2013)的基线方法相比,所提出的控制变量子可将随机梯度估计器的方差降低一个数量级。
- 使用理想控制变量子的估计器的均方误差为0.0136,显著低于Ranganath等人控制变量子方法的3.0090均方误差。
- 基于样本协方差的回归梯度估计器(ˆg_reg)的方差为0.0180,优于Paisley等人(2012)的delta方法估计器的0.4968方差。
- 平方偏差约占ˆg_reg估计器均方误差的20%,但其随样本数量的增加呈二次递减,表明具有强渐近一致性。
- 尽管基于有偏协方差估计,该方法在实践中仍近乎无偏,表明其具有良好的鲁棒性。
- 即使在对数后验结构未知的情况下,该方法依然有效,使其能够以黑箱方式广泛应用于各类模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。