Skip to main content
QUICK REVIEW

[论文解读] Nested LSTMs.

Joel Ruben Antony Moniz, David Krueger|arXiv (Cornell University)|Jan 31, 2018
Natural Language Processing Techniques参考文献 25被引用 12
一句话总结

本文提出了嵌套LSTM(NLSTM),一种深层循环架构,通过将LSTM单元嵌套在彼此内部来增强长期依赖学习,其中外层记忆单元的值由内层LSTM的隐藏状态决定。在参数量相近的情况下,NLSTM在字符级语言建模任务上优于单层和堆叠LSTM,且内层记忆单元能更有效地捕捉更长的长期依赖关系。

ABSTRACT

We propose Nested LSTMs (NLSTM), a novel RNN architecture with multiple levels of memory. Nested LSTMs add depth to LSTMs via nesting as opposed to stacking. The value of a memory cell in an NLSTM is computed by an LSTM cell, which has its own inner memory cell. Specifically, instead of computing the value of the (outer) memory cell as $c^{outer}_t = f_t \odot c_{t-1} + i_t \odot g_t$, NLSTM memory cells use the concatenation $(f_t \odot c_{t-1}, i_t \odot g_t)$ as input to an inner LSTM (or NLSTM) memory cell, and set $c^{outer}_t$ = $h^{inner}_t$. Nested LSTMs outperform both stacked and single-layer LSTMs with similar numbers of parameters in our experiments on various character-level language modeling tasks, and the inner memories of an LSTM learn longer term dependencies compared with the higher-level units of a stacked LSTM.

研究动机与目标

  • 为解决堆叠LSTM在捕捉长期依赖关系方面的局限性,提出一种更深层次的记忆层次结构。
  • 在不显著增加模型复杂度的情况下,提升循环网络在序列建模任务中的性能。
  • 通过引入分层嵌套记忆结构,探索替代堆叠LSTM的方案。

提出的方法

  • 外层记忆单元的值并非直接由输入门和遗忘门计算,而是将遗忘门输出与输入门输出的拼接向量输入到一个内层LSTM单元中。
  • 内层LSTM处理拼接向量(f_t ⊙ c_{t-1}, i_t ⊙ g_t),并生成其隐藏状态 h^{inner}_t。
  • 外层记忆单元 c^{outer}_t 被设置为等于 h^{inner}_t,从而使得外层单元的记忆成为内层LSTM隐藏状态的函数。
  • 这种嵌套机制实现了更深的记忆抽象,使得内层单元能够独立于外层单元学习长期依赖关系。
  • 该架构的参数量与标准LSTM和堆叠LSTM相近,从而支持公平比较。
  • 模型在字符级语言建模任务上进行端到端训练,以评估记忆层次结构的有效性。

实验结果

研究问题

  • RQ1与堆叠LSTM或单层LSTM相比,嵌套LSTM架构是否能更有效地提升长期依赖关系的学习能力?
  • RQ2NLSTM的分层记忆结构如何影响其在序列建模任务中的性能表现?
  • RQ3NLSTM中的内层记忆单元是否比堆叠LSTM中的高层单元更有效地学习长期依赖关系?
  • RQ4在参数量相近的情况下,NLSTM相较于标准LSTM和堆叠LSTM的性能增益如何?
  • RQ5嵌套架构是否能提升循环网络中记忆利用的有效性?

主要发现

  • 在参数量相近的情况下,NLSTM在字符级语言建模任务上优于单层和堆叠LSTM。
  • NLSTM中的内层记忆单元比堆叠LSTM中的高层单元更有效地学习长期依赖关系。
  • 嵌套架构在不增加模型复杂度的前提下,实现了更深的记忆抽象。
  • 性能提升归因于通过内层LSTM单元对记忆状态进行分层处理。
  • 由于改进的记忆层次结构和更强的长期记忆保持能力,模型实现了更优的语言建模效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。