Skip to main content
QUICK REVIEW

[论文解读] Gated Orthogonal Recurrent Units: On Learning to Forget

Jing Li, Çaǧlar Gülçehre|arXiv (Cornell University)|Jun 8, 2017
Topic Modeling被引用 14
一句话总结

本文提出了一种新型RNN架构——门控正交循环单元(GORU),该架构结合了正交权重矩阵以实现长期记忆的稳定性,以及可学习的门控机制以实现有效的遗忘。通过将GRU风格的门控机制与正交转移相结合,GORU在长时依赖任务(包括bAbI问答、Penn Treebank、TIMIT和合成任务)上的表现优于LSTM、GRU和酉RNN,展现出在记忆与遗忘能力方面的卓越性能。

ABSTRACT

We present a novel recurrent neural network (RNN) based model that combines the remembering ability of unitary RNNs with the ability of gated RNNs to effectively forget redundant/irrelevant information in its memory. We achieve this by extending unitary RNNs with a gating mechanism. Our model is able to outperform LSTMs, GRUs and Unitary RNNs on several long-term dependency benchmark tasks. We empirically both show the orthogonal/unitary RNNs lack the ability to forget and also the ability of GORU to simultaneously remember long term dependencies while forgetting irrelevant information. This plays an important role in recurrent neural networks. We provide competitive results along with an analysis of our model on many natural sequential tasks including the bAbI Question Answering, TIMIT speech spectrum prediction, Penn TreeBank, and synthetic tasks that involve long-term dependencies such as algorithmic, parenthesis, denoising and copying tasks.

研究动机与目标

  • 为解决酉RNN和正交RNN在遗忘无关或噪声信息方面的局限性,此类局限性会阻碍其在真实世界序列任务中的表现。
  • 将正交矩阵的梯度稳定性与GRU等门控机制的选控记忆能力相结合。
  • 开发一种能够同时捕捉长期依赖关系并丢弃冗余或噪声输入的模型。
  • 通过实证验证正交RNN缺乏有效的遗忘机制,而GORU可克服此局限。
  • 在需要长期记忆与对相关信息选择性关注的基准任务上展示优越性能。

提出的方法

  • 将GRU中重置门路径的隐藏状态到隐藏状态的权重矩阵替换为正交矩阵,以在长序列中保持梯度流动。
  • 使用modReLU激活函数,以在门控更新路径中保持正交性的同时引入非线性。
  • 引入受GRU启发的可学习更新门和重置门,以控制信息流入隐藏状态的流动。
  • 使用标准优化方法(如RMSProp、Adam)进行训练,配合权重衰减和批量归一化,通过参数化方法保持正交约束。
  • 采用Householder反射或Cayley变换实现可微分的正交矩阵参数化,以在训练过程中强制执行正交性。
  • 在真实世界与合成序列任务上评估模型性能,与LSTM、GRU和EURNN进行对比。

实验结果

研究问题

  • RQ1正交RNN能否在序列数据中有效遗忘无关或噪声信息?
  • RQ2将门控机制与正交转移相结合,是否能提升在长时依赖任务上的性能,相比标准RNN和酉RNN?
  • RQ3GORU在需要选择性记忆的任务(如去噪和复制)中表现如何,其中遗忘能力至关重要?
  • RQ4GORU能否在bAbI、Penn Treebank和TIMIT等基准任务上超越GRU、LSTM和EURNN等现有模型?
  • RQ5每个门控组件(重置门与更新门)对GORU整体性能的贡献是什么?

主要发现

  • 在bAbI问答基准测试中,GORU实现了60.4%的最高平均测试准确率,优于GRU(58.2%)、LSTM(56.0%)和EURNN(52.9%)。
  • 在Penn Treebank字符级语言建模任务中,GORU达到1.623比特/字符,显著优于EURNN(1.715),与LSTM和GRU相当。
  • 在TIMIT数据集上的语音谱预测任务中,GORU的测试集均方误差为47.6,优于LSTM(57.5)、GRU(57.3)和EURNN(51.9),且参数量更少。
  • 在合成去噪任务中,酉RNN表现灾难性失败,而GORU成功学习到噪声过滤能力,证明了其遗忘能力。
  • 消融实验表明,若禁用GORU中的任一门控(重置门或更新门),性能均显著下降(分别达到1.722和1.754比特/字符),证实了两个门控的必要性。
  • 在所测试的模型中,GORU是唯一能同时成功解决复制任务与去噪任务的模型,凸显其记忆与遗忘机制的平衡性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。