Skip to main content
QUICK REVIEW

[论文解读] Minimal Gated Unit for Recurrent Neural Networks

Guobing Zhou, Jianxin Wu|arXiv (Cornell University)|Mar 31, 2016
Neural Networks and Applications参考文献 1被引用 11
一句话总结

本文提出最小门控单元(MGU),一种仅含一个门的简化循环神经网络(RNN)隐藏单元,参数量减少至门控循环单元(GRU)的三分之二和长短期记忆网络(LSTM)的一半。尽管设计极为简洁,MGU在多种序列任务中仍能达到与GRU相当的准确率,同时训练速度显著提升,内存占用更少。

ABSTRACT

Recently recurrent neural networks (RNN) has been very successful in handling sequence data. However, understanding RNN and finding the best practices for RNN is a difficult task, partly because there are many competing and complex hidden units (such as LSTM and GRU). We propose a gated unit for RNN, named as Minimal Gated Unit (MGU), since it only contains one gate, which is a minimal design among all gated hidden units. The design of MGU benefits from evaluation results on LSTM and GRU in the literature. Experiments on various sequence data show that MGU has comparable accuracy with GRU, but has a simpler structure, fewer parameters, and faster training. Hence, MGU is suitable in RNN's applications. Its simple architecture also means that it is easier to evaluate and tune, and in principle it is easier to study MGU's properties theoretically and empirically.

研究动机与目标

  • 为解决LSTM和GRU等复杂且相互竞争的设计所导致的RNN架构缺乏共识与理论理解的问题。
  • 在不牺牲性能的前提下,减少门控RNN单元的模型复杂度与参数数量。
  • 提出仅含一个门的最小门控单元,以简化架构、训练过程,并促进未来理论分析。
  • 评估极简设计是否能在保持GRU准确率的同时提升训练效率。
  • 为实际应用与研究提供一种更简单、更易分析的门控RNN单元替代方案。

提出的方法

  • MGU引入单一门(遗忘门)以调节信息流动,省略GRU和LSTM中常见的更新门与窥视孔连接。
  • 隐藏状态通过门控机制计算:h_t = (1 - z_t) * h_{t-1} + z_t * tanh(W * x_t + U * h_{t-1}),其中z_t为遗忘门。
  • 门的计算方式为z_t = sigmoid(W_z * x_t + U_z * h_{t-1}),仅使用一个可学习的权重矩阵完成门计算。
  • 该架构避免多重隐藏状态与复杂连接,最大限度减少参数数量与计算开销。
  • 模型采用标准的时间反向传播与梯度下降法进行训练,与GRU和LSTM方法一致。
  • 实验在语言建模与视频动作识别等多样化序列任务中,将MGU与GRU、LSTM、IRNN及SCRN进行对比。

实验结果

研究问题

  • RQ1仅含一个门的门控RNN单元是否能在极简设计下实现与GRU相当的性能?
  • RQ2减少RNN单元中的参数与门数量是否能在不损失准确率的前提下实现更快的训练速度?
  • RQ3如MGU这般更简单的架构是否能促进未来对RNN的理论分析与实证理解?
  • RQ4MGU在不同序列长度与数据类型的任务中表现如何?
  • RQ5在真实应用场景中,MGU是否比GRU与LSTM更具样本效率与计算效率?

主要发现

  • 在500个隐藏单元下,MGU在Penn TreeBank数据集上的测试困惑度为105.89,与GRU在相同条件下的106.02相当。
  • 在400个隐藏单元下,MGU的测试困惑度为106.02,优于Jozefowicz等人(2015)报告的GRU结果(108.42)。
  • MGU的参数量仅为GRU的三分之二,参数数量从GRU(400单元)的722,400减少至MGU(400单元)的481,600。
  • MGU每轮训练时间约为190秒,比GRU的201秒快约10%-15%。
  • 使用500个隐藏单元的MGU训练速度超过使用300个隐藏单元的GRU,且在相同时间内可训练更多轮次,有望进一步提升性能。
  • 在Penn TreeBank数据集上,MGU(500单元)的验证困惑度为107.92,低于GRU(300单元)的110.92,表明在某些情况下收敛速度更快。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。