Skip to main content
QUICK REVIEW

[论文解读] Recurrent Memory Array Structures

Kamil Rocki|arXiv (Cornell University)|Jul 11, 2016
Topic Modeling参考文献 14被引用 5
一句话总结

该论文提出了一种新型循环神经网络架构——Array-LSTM,其将标准LSTM单元中的单个记忆单元替换为每个隐藏单元多个记忆单元,从而提升了泛化能力和序列建模性能。通过引入确定性和随机性两种变体,该模型在字符级语言建模任务上达到最先进性能,在enwik8数据集上实现1.402比特/字符(BPC)的性能表现,并在enwik9和enwik10数据集上分别建立了1.12 BPC和1.19 BPC的新神经网络基线。

ABSTRACT

The following report introduces ideas augmenting standard Long Short Term Memory (LSTM) architecture with multiple memory cells per hidden unit in order to improve its generalization capabilities. It considers both deterministic and stochastic variants of memory operation. It is shown that the nondeterministic Array-LSTM approach improves state-of-the-art performance on character level text prediction achieving 1.402 BPC on enwik8 dataset. Furthermore, this report estabilishes baseline neural-based results of 1.12 BPC and 1.19 BPC for enwik9 and enwik10 datasets respectively.

研究动机与目标

  • 通过在每个隐藏单元中引入多个记忆单元,提升标准长短期记忆(LSTM)网络的泛化能力。
  • 探索记忆操作的确定性和随机性变体,以提升学习效率和鲁棒性。
  • 在大规模维基百科文本语料库(enwik9和enwik10)上建立字符级语言建模的新神经网络基线。
  • 从小脑皮层的结构中获得启发,设计一种可在单个隐藏单元内实现可互换子状态聚合的内存结构。
  • 探究显式内存数组结构是否能比标准RNN或堆叠LSTM更好地捕捉序列数据中的长程依赖关系和冗余模式。

提出的方法

  • 提出一种Array-LSTM架构,其中每个隐藏单元维护多个记忆单元(c_k^t),每个记忆单元拥有独立的输入门、遗忘门和输出门(i_k^t, f_k^t, o_k^t)。
  • 将标准LSTM方程扩展为在每个记忆单元上独立运行,每个单元通过以下方式更新其内容:c_k^t = f_k^t ⊙ c_k^{t-1} + i_k^t ⊙ ~c_k^t。
  • 引入一种随机变体,训练期间随机选择记忆单元,类似于正则化中的Dropout机制,以提升泛化能力。
  • 通过求和操作聚合所有记忆单元的输出:h^t = Σ_k (o_k^t ⊙ tanh(c_k^t)),实现多个记忆单元之间的共享隐藏状态表示。
  • 在输入与记忆单元之间采用调制连接,每个门和单元组合均使用可学习的权重矩阵(W, U)和偏置(b)。
  • 从具有阵列式结构的小脑皮层中获得架构启发,其中多个并行记忆通路允许对相似或可互换内容实现灵活的聚合表示。

实验结果

研究问题

  • RQ1将LSTM中的单个记忆单元替换为每个隐藏单元多个记忆单元,是否能提升序列建模任务中的泛化能力?
  • RQ2通过类似Dropout的机制在记忆单元选择中引入随机性,是否能增强字符级文本预测任务中的模型鲁棒性和泛化能力?
  • RQ3与标准LSTM或堆叠LSTM架构相比,阵列化内存结构在长程依赖任务中的性能提升程度如何?
  • RQ4所提出的架构是否能在enwik8、enwik9和enwik10等标准语言建模范式上实现最先进性能?
  • RQ5在单个隐藏层内对多个记忆单元进行池化,与通过堆叠多层实现的层次化结构相比,其在学习效率和表征能力方面表现如何?

主要发现

  • 非确定性Array-LSTM变体在enwik8数据集上实现了1.402比特/字符(BPC)的新SOTA结果,优于此前所有模型。
  • 确定性Array-LSTM在enwik9数据集上建立了1.12 BPC的新神经网络基线,表明其在压缩和预测性能方面均有提升。
  • 该模型在enwik10数据集上实现了1.19 BPC的神经网络基线性能,表明其在日益复杂的文本序列中仍具备强大泛化能力。
  • 每个隐藏单元中使用多个记忆单元,可更有效地表征可互换或相似的上下文模式,相当于在内部实现了一种类似卷积神经网络中空间池化的机制。
  • Array-LSTM的随机变体通过在记忆单元激活中引入受控随机性,提升了泛化能力,其机制类似于Dropout,可有效减少过拟合。
  • 该架构表明,通过在单层内扩展记忆容量而非增加网络深度,即可在序列建模任务中实现更优性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。