[论文解读] REBAR: Low-variance, unbiased gradient estimates for discrete latent variable models
REBAR 引入一种无偏、低方差的离散潜变量模型梯度估计器,通过使用基于 REINFORCE 与放松的 Concrete 分布重参数化梯度之间差距的控制变差项,结合在线温度调整。
Learning in models with discrete latent variables is challenging due to high variance gradient estimators. Generally, approaches have relied on control variates to reduce the variance of the REINFORCE estimator. Recent work (Jang et al. 2016, Maddison et al. 2016) has taken a different approach, introducing a continuous relaxation of discrete variables to produce low-variance, but biased, gradient estimates. In this work, we combine the two approaches through a novel control variate that produces low-variance, \emph{unbiased} gradient estimates. Then, we introduce a modification to the continuous relaxation and show that the tightness of the relaxation can be adapted online, removing it as a hyperparameter. We show state-of-the-art variance reduction on several benchmark generative modeling tasks, generally leading to faster convergence to a better final log-likelihood.
研究动机与目标
- 动机并解决离散潜变量的梯度估计中高方差问题。
- 通过将 REINFORCE 与基于重参数化的控制变差项结合,开发出低方差的无偏梯度估计器。
- 引入放松的连续近似(Concrete)和条件边际化以提高方差约简。
- 实现放松温度的在线自适应,以消除额外的超参数。
- 在生成建模和结构化预测任务中展示最先进的方差约简效果。
提出的方法
- 定义一个控制变差项,基于放松模型的 REINFORCE 与重参数化梯度之间的差异。
- 使用 p(z|b) 条件边际化控制变差项以创建 REBAR,然后与经过修正的重参数化梯度结合。
- 耦合随机变量(u, v)以减少计算量和方差。
- 推导出包含控制放松的温度参数 lambda 的无偏梯度估计器。
- 通过最小化估计量方差在线优化温度 lambda。
- 在高温极限下讨论与 MuProp 的联系,并扩展到多层随机网络。
实验结果
研究问题
- RQ1是否可以在不对放松进行超参数调节的情况下,为离散潜变量模型构建一个低方差的无偏梯度估计器?
- RQ2基于放松(Concrete 分布)的控制变差项是否能显著降低方差,相比现有的无偏估计量?
- RQ3放松温度的在线自适应是否还能在不引入偏差的情况下进一步降低梯度方差?
- RQ4在生成与结构化预测任务中,REBAR 相对于 NVIL、MuProp 以及 Gumbel-Softmax/Concrete 的表现如何?
- RQ5在不同温度区间,REBAR、MuProp 与 SimpleMuProp 的理论与实践关系是什么?
主要发现
- REBAR 在所测试任务中实现了无偏梯度估计器中的最先进方差减小。
- 在 MNIST 和 Omniglot 的生成建模中,结合在线 lambda 自适应的 REBAR 始终降低梯度方差,改善收敛性和最终对数似然。
- REBAR 在若干设置中优于 Concrete(Gumbel-Softmax)估计量,尤其是线性模型,在非线性情形下也能达到或超过表现。
- 一种修改的放松揭示了 REBAR 与 MuProp 在高温极限下的联系,称为 SimpleMuProp。
- 放松温度的在线优化在不引入偏差的情况下有效降低方差,减轻了预先指定 lambda 的需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。