Skip to main content
QUICK REVIEW

[论文解读] Reparameterization trick for discrete variables

Seiya Tokui, Issei Sato|arXiv (Cornell University)|Nov 4, 2016
Gaussian Processes and Bayesian Inference参考文献 10被引用 8
一句话总结

该论文通过边缘化离散变量并使用所有配置中的共享噪声因子,提出了一种离散变量的重参数化技巧,实现了通过公共随机数进行低方差梯度估计。该方法在理论上保证了其方差低于使用最优输入相关基线的似然比方法,并在Sigmoid信念网络的变分推断中实现了更快的收敛速度和更优的性能。

ABSTRACT

Low-variance gradient estimation is crucial for learning directed graphical models parameterized by neural networks, where the reparameterization trick is widely used for those with continuous variables. While this technique gives low-variance gradient estimates, it has not been directly applicable to discrete variables, the sampling of which inherently requires discontinuous operations. We argue that the discontinuity can be bypassed by marginalizing out the variable of interest, which results in a new reparameterization trick for discrete variables. This reparameterization greatly reduces the variance, which is understood by regarding the method as an application of common random numbers to the estimation. The resulting estimator is theoretically guaranteed to have a variance not larger than that of the likelihood-ratio method with the optimal input-dependent baseline. We give empirical results for variational learning of sigmoid belief networks.

研究动机与目标

  • 解决在具有离散潜变量的有向图模型中低方差梯度估计的挑战。
  • 通过边缘化绕过采样中的不连续性,将此前仅适用于连续变量的重参数化技巧扩展至离散变量。
  • 在离散模型的变分推断中降低梯度方差,特别是在Sigmoid信念网络等深度架构中。
  • 提供一种理论基础坚实的优化方法,其方差和优化稳定性均优于现有似然比估计器。

提出的方法

  • 该方法边缘化目标离散变量,使其在无需不连续采样操作的情况下应用重参数化。
  • 在离散变量的所有配置中使用共享噪声因子,从而将公共随机数技术应用于梯度估计。
  • 通过同时模拟离散变量的所有配置而非顺序处理,利用共享随机性来降低方差。
  • 通过联合重参数化所有变量并边缘化离散变量的分布,重新表述期望。
  • 理论上证明该方法的方差不超过使用最优输入相关基线的似然比估计器的方差。
  • 通过在单次前向传播中生成离散变量的所有配置,对所有配置使用共享噪声,并通过反向传播计算梯度来实现。

实验结果

研究问题

  • RQ1尽管采样存在固有不连续性,能否将重参数化技巧扩展至离散变量?
  • RQ2边缘化离散变量是否能实现与连续重参数化相当的低方差梯度估计?
  • RQ3在所有配置中使用共享噪声是否能比现有方法更有效地降低梯度方差?
  • RQ4与似然比方法相比,该方法在深度离散模型上的优化速度和模型性能如何?
  • RQ5与似然比框架中最佳基线相比,该方法的方差降低是否具有理论保证?

主要发现

  • 理论上证明,该方法的梯度方差显著低于使用最优输入相关基线的似然比方法。
  • 在MNIST数据集上的SBN实验中,该方法在变分下界方面优于似然比方法,在32-64-128-256架构上实现了2.04 nats的提升。
  • 与似然比方法相比,梯度估计的方差最高降低了10^8倍,尤其在更深的模型中表现显著。
  • 尽管计算成本最高可达M倍(M为配置数),但由于高效的并行化,该方法在GPU上运行时间不足两倍。
  • 该方法表现出更快的收敛速度和更好的泛化能力,尤其在更深的架构中,梯度质量对优化至关重要。
  • 使用该方法训练的模型在32-64-128-256 SBN上的测试集负对数似然为92.79,而使用似然比方法的模型为94.73。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。