Skip to main content
QUICK REVIEW

[论文解读] Estimating Gradients for Discrete Random Variables by Sampling without Replacement

Wouter Kool, Herke van Hoof|arXiv (Cornell University)|Feb 14, 2020
Reinforcement Learning in Robotics参考文献 49被引用 16
一句话总结

该论文提出了一种用于离散随机变量的无偏梯度估计器,采用无放回采样方法,通过消除重复样本降低方差。通过Rao-Blackwellization推导出自带控制变量,该方法在变分自编码器和结构化预测任务的实验中,方差低于REINFORCE,且在高熵和低熵设置下始终优于其他估计器。

ABSTRACT

We derive an unbiased estimator for expectations over discrete random variables based on sampling without replacement, which reduces variance as it avoids duplicate samples. We show that our estimator can be derived as the Rao-Blackwellization of three different estimators. Combining our estimator with REINFORCE, we obtain a policy gradient estimator and we reduce its variance using a built-in control variate which is obtained without additional model evaluations. The resulting estimator is closely related to other gradient estimators. Experiments with a toy problem, a categorical Variational Auto-Encoder and a structured prediction problem show that our estimator is the only estimator that is consistently among the best estimators in both high and low entropy settings.

研究动机与目标

  • 降低强化学习和隐变量模型中用于离散随机变量的梯度估计方差。
  • 开发一种通过无放回采样避免重复样本的无偏梯度估计器。
  • 推导一种不需额外模型评估即可降低方差的控制变量。
  • 在多种设置下评估性能,包括高熵和低熵分布。
  • 在离散变分自编码器和结构化预测任务中,证明其相对于现有估计器的一致优越性。

提出的方法

  • 基于从离散分布中无放回抽取的无序样本集合,推导出无偏梯度估计器。
  • 通过Rao-Blackwellization从三种不同的基础估计器中推导该估计器,确保方差降低。
  • 引入一种源自相同样本的自建控制变量,无需额外模型评估即可保持无偏性。
  • 将该估计器应用于REINFORCE框架,生成低方差策略梯度估计器。
  • 采用受限分布模型计算无放回采样下的概率,对已移除元素进行调整。
  • 通过合成数据和真实世界基准(包括类别VIA和TSP求解器)验证该方法。

实验结果

研究问题

  • RQ1与有放回采样相比,无放回采样是否能降低离散分布梯度估计的方差?
  • RQ2能否基于无放回采样的无序样本集合构建无偏梯度估计器?
  • RQ3在高熵和低熵区域,该估计器是否均优于REINFORCE、Gumbel-Softmax和ARSM等现有方法?
  • RQ4能否在不增加额外模型评估的前提下推导出自建控制变量,同时保持无偏性?
  • RQ5在离散VAE和结构化预测等实际应用中,该估计器表现如何?

主要发现

  • 在所有评估任务中,该估计器在高熵和低熵设置下均表现优异,始终位列前茅。
  • 在类别VAE实验中,该估计器实现了最低的验证-ELBO,优于有放回采样的REINFORCE和ARSM。
  • 在TSP基准测试中,该估计器实现了更快的收敛速度和更低的期望路径长度,优于有放回采样的REINFORCE。
  • 该估计器的梯度对数方差显著低于有放回采样的REINFORCE,尤其在高熵设置下更为明显。
  • 自建控制变量在不增加额外模型评估的前提下有效降低了方差,同时保持了无偏性。
  • 该方法在训练过程中保持稳定,未出现发散现象,即使在大隐空间等挑战性设置下,也优于标准的有放回REINFORCE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。