Skip to main content
QUICK REVIEW

[论文解读] Going Wider: Recurrent Neural Network With Parallel Cells

Danhao Zhu, Si Shen|arXiv (Cornell University)|May 3, 2017
Natural Language Processing Techniques参考文献 17被引用 5
一句话总结

本文提出并行单元(Parallel Cells, PCs),一种新颖的RNN架构,通过在每一层使用多个更小的并行RNN单元替代单一的大规模循环单元,以提升模型的表征能力。通过解耦并行单元之间的隐藏状态计算,模型减少了来自无关过去特征的干扰,实现了当前最优性能:在PTB语言建模任务中困惑度降至75.3(相比基线的78.6),在中英翻译任务中BLEU得分提升0.39点。

ABSTRACT

Recurrent Neural Network (RNN) has been widely applied for sequence modeling. In RNN, the hidden states at current step are full connected to those at previous step, thus the influence from less related features at previous step may potentially decrease model's learning ability. We propose a simple technique called parallel cells (PCs) to enhance the learning ability of Recurrent Neural Network (RNN). In each layer, we run multiple small RNN cells rather than one single large cell. In this paper, we evaluate PCs on 2 tasks. On language modeling task on PTB (Penn Tree Bank), our model outperforms state of art models by decreasing perplexity from 78.6 to 75.3. On Chinese-English translation task, our model increases BLEU score for 0.39 points than baseline model.

研究动机与目标

  • 为解决标准RNN中隐藏状态全连接可能引入无关过去特征噪声的问题。
  • 提升循环网络在序列建模任务中的表征能力与学习效率。
  • 探索标准RNN的架构替代方案,在保持序列处理能力的同时减少无关特征之间的干扰。
  • 评估将隐藏状态计算分布到并行单元是否能提升标准NLP基准上的性能。

提出的方法

  • 用同一层内多个更小、独立的RNN单元并行运行,替代单一的大规模RNN单元。
  • 每个并行单元维护独立的隐藏状态,独立处理输入,降低对可能无关的过去特征的依赖。
  • 所有并行单元的输出在传递至下一层前进行拼接或求和,以保持序列建模能力。
  • 使用标准的反向传播时间算法进行端到端训练,训练过程无需对架构进行修改。
  • 该方法在语言建模与神经机器翻译任务中均适用,且未改变核心RNN计算逻辑。
  • 并行单元的数量为超参数,通过验证数据调优,实验表明在适中数量下性能更优。

实验结果

研究问题

  • RQ1用多个更小的并行RNN单元替代单一的大规模RNN单元,能否提升序列建模性能?
  • RQ2减少隐藏状态中特征间的干扰,是否能提升RNN的泛化能力?
  • RQ3并行单元架构在标准NLP基准上与标准RNN及其他SOTA模型相比表现如何?
  • RQ4实现性能提升的最优并行单元数量是多少,且不会导致过拟合?

主要发现

  • 在Penn Tree Bank(PTB)语言建模任务中,所提模型达到75.3的困惑度,相比基线的78.6提升了3.3点。
  • 在中英翻译任务中,模型相比基线模型BLEU得分提升0.39分。
  • 性能提升归因于并行单元中解耦计算减少了来自不相关过去特征的干扰。
  • 该架构在保持RNN的序列归纳偏置的同时,通过增加宽度而非深度来增强表征能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。