Skip to main content
QUICK REVIEW

[论文解读] Recurrently Controlled Recurrent Networks

Yi Tay, Anh Tuan Luu|arXiv (Cornell University)|Nov 24, 2018
Topic Modeling被引用 14
一句话总结

该论文提出了一种新型RNN架构——循环控制循环网络(RCRN),其中控制器RNN动态学习监听器RNN的门控函数,从而实现更具表现力的序列编码。RCRN在26项NLP基准测试中均优于标准及堆叠的BiLSTM,取得了SOTA或接近SOTA的性能,同时保持了相当或更优的推理效率。

ABSTRACT

Recurrent neural networks (RNNs) such as long short-term memory and gated recurrent units are pivotal building blocks across a broad spectrum of sequence modeling problems. This paper proposes a recurrently controlled recurrent network (RCRN) for expressive and powerful sequence encoding. More concretely, the key idea behind our approach is to learn the recurrent gating functions using recurrent networks. Our architecture is split into two components - a controller cell and a listener cell whereby the recurrent controller actively influences the compositionality of the listener cell. We conduct extensive experiments on a myriad of tasks in the NLP domain such as sentiment analysis (SST, IMDb, Amazon reviews, etc.), question classification (TREC), entailment classification (SNLI, SciTail), answer selection (WikiQA, TrecQA) and reading comprehension (NarrativeQA). Across all 26 datasets, our results demonstrate that RCRN not only consistently outperforms BiLSTMs but also stacked BiLSTMs, suggesting that our controller architecture might be a suitable replacement for the widely adopted stacked architecture.

研究动机与目标

  • 为解决堆叠RNN的局限性(如梯度消失和深层特征传播困难),提出一种替代分层堆叠的架构。
  • 通过让一个RNN通过学习到的门控函数控制另一个RNN,提升序列编码能力,而无需增加模型深度。
  • 证明控制器-监听器架构是序列建模任务中堆叠RNN的可行且更优的替代方案。
  • 在多种NLP任务(包括情感分析、问题分类和阅读理解)中评估RCRN的性能。
  • 分析RCRN相对于标准及堆叠BiLSTM的计算效率,尤其在cuDNN优化设置下的表现。

提出的方法

  • RCRN由两个组件构成:控制器单元和监听器单元,两者均以RNN形式实现。
  • 控制器RNN在每个时间步生成监听器RNN的动态门控参数(如输入门、遗忘门、输出门)。
  • 监听器RNN利用控制器生成的门控函数调节其隐藏状态转移,实现自适应信息流动。
  • 该架构在相同层级并行运行,避免了RNN层的深层堆叠。
  • 控制器-监听器机制通过标准的时间反向传播算法端到端训练。
  • 实现了RCRN的CUDA优化版本,以提升训练和推理速度,尤其在长序列场景下表现更优。

实验结果

研究问题

  • RQ1能否通过动态学习门控函数的控制器RNN,在序列建模任务中超越标准堆叠BiLSTM架构?
  • RQ2控制器-监听器架构是否在长距离依赖建模方面,优于RNN的分层堆叠结构,从而提供更优的表征学习能力?
  • RQ3RCRN的计算效率与堆叠BiLSTM相比如何,尤其在cuDNN优化的推理设置下?
  • RQ4RCRN是否能在不依赖注意力机制的前提下,在多样化的NLP基准上实现SOTA或接近SOTA的性能?
  • RQ5控制器-监听器机制是否足够鲁棒,能够在包括情感分析、蕴含判断和阅读理解在内的多个NLP任务中提升性能?

主要发现

  • RCRN在全部26个基准数据集上均优于标准BiLSTM,包括SST、IMDb、Amazon评论、TREC、SNLI、SciTail、WikiQA、TrecQA和NarrativeQA。
  • 在WikiQA和TrecQA上,RCRN在无注意力设置下实现了MAP分数+2%的提升,使用注意力池化后仍保持+2%的提升,MRR提升达4-7%。
  • 在NarrativeQA阅读理解任务中,RCRN在仅使用单层RCRN(而R-NET使用三层BiGRU)的情况下,将R-NET的性能提升了1%-2%(各项指标)。
  • CUDA优化的RCRN推理时间与3层BiLSTM(cuDNN)相当,且在某些序列长度下甚至更快。
  • RCRN在参数量相近的堆叠BiLSTM中保持了相当或更优的效率,其优化版本在长序列上比3层BiLSTM(cuDNN)略快。
  • RCRN在SST、TREC问题分类以及全部16个Amazon评论数据集上均达到接近SOTA的性能,表明其在不同领域具有强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。