Skip to main content
QUICK REVIEW

[论文解读] Beyond exploding and vanishing gradients: analysing RNN training using attractors and smoothness

Antônio H. Ribeiro, Koen Tiels|arXiv (Cornell University)|Jun 20, 2019
Model Reduction and Neural Networks参考文献 12被引用 50
一句话总结

本文通过成本函数的平滑性和吸引子动力学重新框定爆炸/消失梯度,并在多个任务中比较 LSTM、稳定 LSTM 和正交 RNN,以解释训练动力学和长期记忆。

ABSTRACT

The exploding and vanishing gradient problem has been the major conceptual principle behind most architecture and training improvements in recurrent neural networks (RNNs) during the last decade. In this paper, we argue that this principle, while powerful, might need some refinement to explain recent developments. We refine the concept of exploding gradients by reformulating the problem in terms of the cost function smoothness, which gives insight into higher-order derivatives and the existence of regions with many close local minima. We also clarify the distinction between vanishing gradients and the need for the RNN to learn attractors to fully use its expressive power. Through the lens of these refinements, we shed new light on recent developments in the RNN field, namely stable RNN and unitary (or orthogonal) RNNs.

研究动机与目标

  • 通过强调成本函数平滑性和高阶导数来细化爆炸梯度的概念。
  • 澄清消失梯度与 RNN 需要通过学习吸引子来实现长期记忆之间的区别。
  • 研究稳定 RNN 与正交 RNN 如何管理动力学与梯度行为。
  • 展示在需要长期记忆的任务中,吸引子如何在训练过程中出现并分叉。

提出的方法

  • 将 RNN 建模为离散时间动力系统,并分析内部状态的熵以将信息保持与 Lipschitz 动力学联系起来。
  • 定义收缩与非收缩(contractive 与 non-contractive)状态,并将其与不动点、吸引子和记忆联系起来。
  • 使用分岔图在恒定输入下的训练阶段和推理阶段可视化吸引子。
  • 建立基于 Lipschitz 的理论框架(Theorem 1),将成本函数的光滑性与状态转移的 Lipschitz 常数 Lf 和轨迹长度 N 联系起来。
  • 在正弦波生成、序列分类和语言建模任务上比较 LSTM、稳定 LSTM(sLSTM)和正交 RNN(oRNN)。
  • 考察吸引子和分叉在训练与推理之间的差异及其对学习动力学的影响。

实验结果

研究问题

  • RQ1除了梯度幅值之外,成本函数的平滑性如何影响 RNN 的训练动力学?
  • RQ2状态转移 Lipschitz 常数 Lf 与训练中一阶、二阶导数爆炸之间的关系是什么?
  • RQ3收缩与非收缩动力学如何与 RNN 的信息保留和长期记忆相关?
  • RQ4稳定 RNN 与正交 RNN 在解决需要长期依赖的任务时,以何种不同方式使用吸引子?
  • RQ5吸引子分叉如何与正弦波生成、序列分类与语言建模等学习任务相关?

主要发现

  • 基于熵的分析将信息保持与 Lipschitz 常数 Lf 联系起来,不同的状态(Lf<1、Lf=1、Lf>1)意味着熵的衰减、保持或增长。
  • Theorem 1 给出成本 V 及其梯度的 Lipschitz 上界,随 N 和 Lf 增长,说明非收缩系统中一阶和二阶导数可能爆炸。
  • 在需要长期记忆的任务中,训练时会出现混沌或高度非线性的吸引子,影响成本景观,出现许多局部极小值区域。
  • 在某些任务中,稳定 LSTM 往往不能通过吸引子存储信息,而 oRNN 能形成定点云并在训练中对其进行调整以解决长序列。
  • 正交 RNN 保持单位特征值以避免分叉,但仍然可以学习周期性吸引子,凸显了长期记忆的多样机制。
  • 实验结果表明 LSTM 在短序列任务上可达到完全正确,但在较长序列上变得不稳定或效果较差,而 oRNN 在报告的任务中表现出更平滑的收敛和更好的长期序列性能。
  • 在 WikiText-2 的语言建模中,LSTM 达到较强的困惑度 (99.2),sLSTM 更差 (118.8),而 oRNN 更差 (185.3),反映了这些结构在高维输出中的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。