Skip to main content
QUICK REVIEW

[论文解读] On the Variance of Unbiased Online Recurrent Optimization

Tim Cooijmans, James Martens|arXiv (Cornell University)|Feb 6, 2019
Machine Learning and ELM参考文献 26被引用 6
一句话总结

本文分析了无偏在线循环优化(uoro)算法在循环神经网络在线训练中的梯度方差,提出了一种新颖的基于矩阵的方差减少技术,以提高梯度估计的准确性。该方法通过优化uoro中使用的随机投影结构来降低方差,并建立了uoro与注入噪声的REINFORCE估计器之间的理论联系。

ABSTRACT

The recently proposed Unbiased Online Recurrent Optimization algorithm (UORO, arXiv:1702.05043) uses an unbiased approximation of RTRL to achieve fully online gradient-based learning in RNNs. In this work we analyze the variance of the gradient estimate computed by UORO, and propose several possible changes to the method which reduce this variance both in theory and practice. We also contribute significantly to the theoretical and intuitive understanding of UORO (and its existing variance reduction technique), and demonstrate a fundamental connection between its gradient estimate and the one that would be computed by REINFORCE if small amounts of noise were added to the RNN's hidden units.

研究动机与目标

  • 解决在线循环学习中高梯度方差的挑战,特别是在长序列或不定长序列中。
  • 提升uoro算法的效率与稳定性,该算法为RNN提供无偏在线梯度估计。
  • 提供对uoro梯度估计机制及其现有方差减少方法的更深层次理论与直观理解。
  • 探索uoro与其他策略梯度方法(特别是带扰动隐藏状态的REINFORCE)之间的联系。
  • 构建一个分析和最小化uoro型梯度估计器方差的框架,且满足结构约束。

提出的方法

  • 利用自动微分与RNN中信用分配的原理,推导出uoro算法的一种新颖且更直观的表达形式。
  • 提出将uoro中方差减少中的标量系数扩展为矩阵值变换,以更好地捕捉梯度之间的相关性。
  • 建立一个理论框架,用于计算随时间累积的uoro梯度估计总方差,从而实现系统的分析。
  • 在所提出的框架内,通过闭式解推导出在结构约束下的最优方差减少矩阵。
  • 提出uoro的一个变体,利用权重梯度的秩一结构,将方差降低一个与隐藏单元数量成比例的因子。
  • 正式建立uoro与REINFORCE估计器之间的联系,当向RNN隐藏单元注入小噪声时,表明在噪声退火条件下,REINFORCE估计器收敛至uoro估计器加上一个均值为零但方差无界的项。

实验结果

研究问题

  • RQ1uoro梯度估计器的方差如何随序列长度变化?哪些结构因素导致其不稳定性?
  • RQ2能否通过用矩阵值变换替换标量系数来改进uoro中现有的方差减少技术?
  • RQ3当向RNN隐藏单元注入噪声时,uoro与REINFORCE策略梯度估计器之间的根本关系是什么?
  • RQ4在实践中,uoro的方差与标准的通过时间反向传播(BPTT)和实时循环学习(RTRL)相比如何?
  • RQ5能否利用RNN权重梯度的秩一结构,设计一种方差更低的uoro变体,且不会过度增加计算成本?

主要发现

  • 所提出的基于矩阵的方差减少技术在理论上和实证上均显著降低了uoro的梯度方差,通过更好地捕捉梯度估计的协方差结构实现。
  • uoro估计器的方差被理论性地关联到注入噪声的REINFORCE估计器;在噪声退火条件下,REINFORCE估计器收敛至uoro估计器加上一个均值为零但方差无界的项。
  • 一种利用权重梯度秩一性质的uoro变体,将方差降低了与隐藏单元数量同阶的因子,代价是计算时间增加相似的量级。
  • 所开发的理论框架能够精确计算uoro型估计器随时间累积的总方差,从而实现对结构约束下方差减少矩阵的优化。
  • 实证评估证实,新方差减少方法相比原始uoro和基线方法,显著提升了训练的稳定性和收敛速度。
  • 分析表明,原始uoro中方差减少所用的标量系数次优,而矩阵扩展形式能更好地匹配真实梯度结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。