Skip to main content
QUICK REVIEW

[论文解读] Optimal Kronecker-Sum Approximation of Real Time Recurrent Learning

Frederik Benzing, Marcelo Matheus Gauy|arXiv (Cornell University)|Feb 11, 2019
Machine Learning in Healthcare被引用 5
一句话总结

本文提出了最优克罗内克和近似(OK),这是一种新颖的、低方差的实时反向传播(RTRL)近似方法,在克罗内克基RTRL近似类别中实现了理论最优性能。OK在Penn TreeBank基准测试中达到与TBPTT相当的性能,并在合成记忆化任务中表现更优,实证表明其噪声可忽略不计,且具备高效的在线学习能力。

ABSTRACT

One of the central goals of Recurrent Neural Networks (RNNs) is to learn long-term dependencies in sequential data. Nevertheless, the most popular training method, Truncated Backpropagation through Time (TBPTT), categorically forbids learning dependencies beyond the truncation horizon. In contrast, the online training algorithm Real Time Recurrent Learning (RTRL) provides untruncated gradients, with the disadvantage of impractically large computational costs. Recently published approaches reduce these costs by providing noisy approximations of RTRL. We present a new approximation algorithm of RTRL, Optimal Kronecker-Sum Approximation (OK). We prove that OK is optimal for a class of approximations of RTRL, which includes all approaches published so far. Additionally, we show that OK has empirically negligible noise: Unlike previous algorithms it matches TBPTT in a real world task (character-level Penn TreeBank) and can exploit online parameter updates to outperform TBPTT in a synthetic string memorization task. Code availiable on github.

研究动机与目标

  • 解决现有RTRL近似方法中计算成本高和噪声大的问题,同时保持未截断梯度计算能力。
  • 开发一种RTRL的理论最优近似方法,使在克罗内克和基近似类别中方差最小化。
  • 证明所提方法可实现有效的在线训练,在真实世界和合成任务中性能达到或超过TBPTT。
  • 探索无偏、低秩克罗内克因子近似在RTRL梯度中的理论极限。
  • 研究构建一种实用、内存和运行时效率高的RTRL替代方法的可行性,适用于标准RNN、LSTM和RHN。

提出的方法

  • 提出一种基于低秩矩阵克罗内克积之和的RTRL梯度新近似方法,实现高效计算。
  • 引入一种新型在线更新过程,用于克罗内克因子,确保在无偏近似中实现最小可实现方差。
  • 利用Eckart-Young定理构建梯度矩阵的最优低秩近似,使Frobenius范数误差最小化。
  • 设计一种变体——克罗内克三重积(KTP),在每批次元素上实现与TBPTT相当的计算成本,同时保持低内存占用。
  • 通过理论方差界和基准任务上的实证比较,实现并分析OK与KTP。
  • 利用方差分析和梯度近似质量度量,验证OK在不同网络规模和训练阶段下均保持低噪声。

实验结果

研究问题

  • RQ1能否在无偏近似中,构造出具有可证明最小方差的基于克罗内克和的RTRL梯度近似?
  • RQ2所提出的最优克罗内克和(OK)近似在真实世界序列建模任务中是否能达到与TBPTT相当的性能?
  • RQ3OK能否通过利用在线参数更新,在需要长期依赖学习的任务中超越TBPTT?
  • RQ4在整个训练过程中,真实RTRL梯度能否被低秩克罗内克和结构良好近似?
  • RQ5与OK相比,所提出的KTP变体在计算效率与近似噪声之间存在何种权衡?

主要发现

  • OK在实证中表现出可忽略的噪声,在字符级Penn TreeBank基准测试中性能与TBPTT相当,显著优于以往噪声较大的近似方法。
  • OK在合成字符串记忆化任务中优于TBPTT,通过有效利用在线参数更新,展现出对长期依赖关系更强的学习能力。
  • 方差分析表明,OK即使在更大网络规模下仍保持低噪声,其近似误差相比KF-RTRL-AVG衰减更慢。
  • OK的有偏版本(16-B-OK)性能几乎与无偏版本(16-U-OK)相当,表明真实梯度可被16个克罗内克因子之和良好近似。
  • 所提方法在其类别中具有理论最优性,使无偏克罗内克和近似中RTRL梯度的方差最小化。
  • KTP在每批次元素上的运行时间和内存使用量达到TBPTT水平,但噪声更高,导致在长序列上的性能受限于OK。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。