Skip to main content
QUICK REVIEW

[论文解读] Orthogonal Recurrent Neural Networks with Scaled Cayley Transform

Kyle Helfrich, Devin Willmott|arXiv (Cornell University)|Jul 29, 2017
Neural Networks and Applications参考文献 17被引用 15
一句话总结

本文提出缩放Cayley正交循环神经网络(scoRNN),一种通过使用缩放Cayley变换的斜对称矩阵参数化来保持正交循环权重矩阵的实值RNN。通过克服标准Cayley变换的特征值奇点问题,scoRNN实现了稳定、高效的训练,并在序列任务上表现出色,使用比其他酉RNN更少的参数实现了最先进性能。

ABSTRACT

Recurrent Neural Networks (RNNs) are designed to handle sequential data but suffer from vanishing or exploding gradients. Recent work on Unitary Recurrent Neural Networks (uRNNs) have been used to address this issue and in some cases, exceed the capabilities of Long Short-Term Memory networks (LSTMs). We propose a simpler and novel update scheme to maintain orthogonal recurrent weight matrices without using complex valued matrices. This is done by parametrizing with a skew-symmetric matrix using the Cayley transform. Such a parametrization is unable to represent matrices with negative one eigenvalues, but this limitation is overcome by scaling the recurrent weight matrix by a diagonal matrix consisting of ones and negative ones. The proposed training scheme involves a straightforward gradient calculation and update step. In several experiments, the proposed scaled Cayley orthogonal recurrent neural network (scoRNN) achieves superior results with fewer trainable parameters than other unitary RNNs.

研究动机与目标

  • 解决循环神经网络(RNNs)中因梯度消失和爆炸而限制长期依赖学习的问题。
  • 开发一种更简单的实值替代方案,用于替代使用复数的酉RNN,以保持正交循环权重矩阵。
  • 克服标准Cayley变换的局限性,即无法表示具有特征值-1的正交矩阵。
  • 在数值计算下通过简单的梯度更新规则保持正交性,实现稳定高效的训练。
  • 在减少模型复杂度的前提下,实现在序列学习任务上的最先进性能。

提出的方法

  • 通过斜对称矩阵A使用缩放Cayley变换对循环权重矩阵W进行参数化:W = (I - sA)(I + sA)^{-1},其中s为具有±1条目元素的对角缩放矩阵。
  • 使用缩放Cayley变换避免标准Cayley变换中在特征值为-1时出现的奇点。
  • 在训练过程中直接对斜对称矩阵A进行梯度下降,每次训练步骤中从A重构循环权重矩阵W。
  • 在反向传播过程中对A应用简单的加法更新规则,确保W在整个训练过程中保持正交。
  • 使用标准RNN架构,但通过参数化方法强制实现正交性,而非使用复数矩阵或约束优化。
  • 使用标准的时间反向传播方法进行端到端训练,每次前向传播时通过缩放Cayley变换从A计算W。

实验结果

研究问题

  • RQ1实值RNN能否在不使用复数或受限参数空间的情况下保持正交循环权重矩阵?
  • RQ2缩放Cayley变换是否能有效避免标准Cayley变换在特征值-1处的奇点问题?
  • RQ3对斜对称矩阵的简单加法更新规则是否能在数值舍入误差下保持训练过程中的正交性?
  • RQ4所提出的scoRNN是否在参数更少的情况下,优于现有酉或正交RNN在序列任务上的性能?
  • RQ5scoRNN中的梯度流动与标准RNN和LSTM相比,在长序列中表现如何,特别是在梯度消失/爆炸问题方面?

主要发现

  • scoRNN在多个序列学习任务上表现优异,包括加法问题和未打乱的MNIST数据集,其可训练参数数量少于其他酉RNN。
  • 在T=500的加法问题中,scoRNN的梯度在整个序列中衰减不足一个数量级(从10^{-3}衰减至10^{-4}),而LSTM的梯度显著衰减。
  • 对于n=170隐藏单元的scoRNN,其训练速度约为n=512的受限容量uRNN的1.5倍,且是n=116的全容量uRNN的两倍,尽管参数量相近。
  • 对于参数量约为137k的模型,scoRNN每轮训练耗时11.2分钟,而全容量uRNN耗时25.8分钟,显示出显著的速度优势。
  • 所有实验中,scoRNN均表现出平滑且稳定的收敛曲线,表明其训练动力学具有鲁棒性。
  • 该模型在长序列中保持了稳定的梯度范数,证实其能有效缓解梯度消失和爆炸问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。