Skip to main content
QUICK REVIEW

[论文解读] Mogrifier LSTM.

Gábor Melis, Tomáš Kočiský|arXiv (Cornell University)|Sep 4, 2019
Natural Language Processing Techniques参考文献 25被引用 7
一句话总结

该论文提出了Mogrifier LSTM,一种增强型长短期记忆网络,通过在当前输入与先前隐藏状态之间引入相互门控机制,使转移函数具有上下文依赖性。这提升了输入-上下文交互的建模能力,在多个语言建模基准测试中取得最先进性能,Penn Treebank和Wikitext-2数据集上的困惑度降低3–4个点,字符级数据集上的比特每字符(bits per character)也有所改善。

ABSTRACT

Many advances in Natural Language Processing have been based upon more expressive models for how inputs interact with the context in which they occur. Recurrent networks, which have enjoyed a modicum of success, still lack the generalization and systematicity ultimately required for modelling language. In this work, we propose an extension to the venerable Long Short-Term Memory in the form of mutual gating of the current input and the previous output. This mechanism affords the modelling of a richer space of interactions between inputs and their context. Equivalently, our model can be viewed as making the transition function given by the LSTM context-dependent. Experiments demonstrate markedly improved generalization on language modelling in the range of 3-4 perplexity points on Penn Treebank and Wikitext-2, and 0.01-0.05 bpc on four character-based datasets. We establish a new state of the art on all datasets with the exception of Enwik8, where we close a large gap between the LSTM and Transformer models.

研究动机与目标

  • 为解决标准RNN,特别是LSTM在建模复杂语言模式时存在的泛化能力有限和系统性不足的问题。
  • 改进循环网络中输入与其上下文表示之间的交互方式。
  • 开发一种在不显著增加计算成本的前提下增强建模能力的机制。
  • 在标准语言建模基准测试中实现最先进性能,包括字符级数据集。

提出的方法

  • 引入一种相互门控机制,通过共享的门控网络动态调制输入和隐藏状态。
  • 将该门控机制应用于计算上下文依赖的转移函数,从而实现输入与隐藏状态之间更丰富的交互。
  • 使用可学习门控来控制输入与隐藏状态之间的信息流动,灵感来源于Transformer的门控机制,但针对RNN进行了适配。
  • 将门控变换集成到标准LSTM单元结构中,同时保持其记忆能力和梯度流动特性。
  • 采用参数高效的架构设计,在增加极少参数的同时显著提升建模能力。
  • 将门控机制视为可学习、可微的变换,能够根据输入和上下文自适应调整。

实验结果

研究问题

  • RQ1LSTM中的上下文依赖转移函数是否能提升语言建模任务的泛化能力?
  • RQ2输入与隐藏状态之间的相互门控如何影响长距离依赖和系统性模式的建模?
  • RQ3像相互门控这样的简单架构修改,能在多大程度上提升标准语言建模基准测试的性能?
  • RQ4Mogrifier LSTM是否在字符级语言建模任务中优于标准LSTM和如Transformer等竞争模型?
  • RQ5该模型能否在Enwik8等挑战性数据集上缩小LSTM与Transformer之间的性能差距?

主要发现

  • 与标准LSTM相比,Mogrifier LSTM在Penn Treebank和Wikitext-2数据集上实现了3–4个困惑度点的降低。
  • 在四个字符级语言建模数据集上,比特每字符(bpc)降低了0.01–0.05,表明建模效率更高。
  • 除Enwik8外,该模型在所有评估数据集上均建立了新的最先进水平,且在Enwik8上显著缩小了LSTM与Transformer之间的性能差距。
  • 改进仅带来极小的架构开销,同时保持了标准LSTM的计算效率。
  • 相互门控机制使输入-上下文交互的建模更加充分,从而提升了泛化能力和系统性。
  • 该模型在多种语言建模任务中表现出强大的泛化能力,涵盖词级和字符级基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。