Skip to main content
QUICK REVIEW

[论文解读] Analyzing and Exploiting NARX Recurrent Neural Networks for Long-Term Dependencies

Robert DiPietro, Christian Rupprecht|arXiv (Cornell University)|Feb 24, 2017
Topic Modeling参考文献 26被引用 21
一句话总结

本文提出MIST RNNs,一种新颖的NARX循环神经网络架构,通过引入来自遥远过去的直接长程连接,显著改善梯度流动并减少梯度消失效应。与LSTM不同,MIST RNNs在参数更少、计算量更低的情况下,于长期依赖任务中表现更优,在外科手势识别与智能手机活动分类任务中超越LSTM与Clockwork RNNs。

ABSTRACT

Recurrent neural networks (RNNs) have achieved state-of-the-art performance on many diverse tasks, from machine translation to surgical activity recognition, yet training RNNs to capture long-term dependencies remains difficult. To date, the vast majority of successful RNN architectures alleviate this problem using nearly-additive connections between states, as introduced by long short-term memory (LSTM). We take an orthogonal approach and introduce MIST RNNs, a NARX RNN architecture that allows direct connections from the very distant past. We show that MIST RNNs 1) exhibit superior vanishing-gradient properties in comparison to LSTM and previously-proposed NARX RNNs; 2) are far more efficient than previously-proposed NARX RNN architectures, requiring even fewer computations than LSTM; and 3) improve performance substantially over LSTM and Clockwork RNNs on tasks requiring very long-term dependencies.

研究动机与目标

  • 解决循环神经网络中长期依赖学习的持续挑战,尤其是在梯度消失阻碍性能的情况下。
  • 克服标准RNN与LSTM在捕捉遥远时间依赖关系方面的局限性,尽管其架构有所创新。
  • 开发一种更高效、更有效的NARX RNN变体,可在不增加计算或参数复杂度的前提下,长期保持强梯度流动。
  • 通过启用直接的非相邻状态连接,而非依赖LSTM中的加法门机制,提出一种正交的梯度消失应对方法。
  • 证明基于NARX的架构可在长上下文任务中超越LSTM的性能,同时保持计算效率。

提出的方法

  • 提出MIST RNNs(混合历史RNNs),一种NARX RNN架构,引入来自过去时间步的直接非相邻连接至当前隐藏状态。
  • 设计架构使梯度衰减的指数降低 $2^{n_d - 1}$ 倍,其中 $n_d$ 为延迟数量,显著改善梯度流动。
  • 采用分层延迟结构,实现对过去状态的选择性、非连续访问,避免先前NARX RNN中出现的参数与计算量指数增长问题。
  • 将这些长程连接整合进标准RNN更新机制,保持RNN的简洁性,同时增强其保留长期上下文的能力。
  • 通过限制延迟连接数量并采用结构化稀疏连接模式,而非完整历史建模,保持计算效率。
  • 使用标准的时间反向传播进行模型训练,梯度同时通过标准循环路径与新引入的长程路径流动。

实验结果

研究问题

  • RQ1具有来自遥远过去的直接非相邻连接的NARX RNN架构,是否能比LSTM与先前的NARX RNN展现出更优的梯度消失特性?
  • RQ2在RNN中启用长程连接是否能提升对需要建模极长依赖关系任务的性能?
  • RQ3此类架构是否能在保持或降低计算与参数成本的同时,实现优于LSTM的性能?
  • RQ4与标准RNN和LSTM相比,MIST RNNs中的分层延迟结构如何影响梯度流动与训练稳定性?
  • RQ5MIST RNNs在具有长程依赖关系的真实序列建模任务中,相较于LSTM与Clockwork RNNs,能多大程度上实现性能超越?

主要发现

  • MIST RNNs使梯度衰减的指数降低 $2^{n_d - 1}$ 倍,与LSTM及先前的NARX RNN相比,显著改善了梯度流动。
  • 在外科手势识别任务中,MIST RNNs使用参数数量仅为LSTM一半的情况下达到相当的性能,展现出更优的参数效率。
  • 在MobiAct智能手机活动识别任务中,MIST RNNs实现29.0% ± 5.2%的测试误差率,优于LSTM(38.8% ± 1.5%)与LSTM+(37.8% ± 2.1%),且参数更少。
  • 在TIMIT音素识别任务中,MIST RNNs实现32.0% ± 0.3%的误差率,与LSTM性能(32.1% ± 0.2%)相当,但参数更少、计算量更低。
  • 对于相同数量的隐藏单元,MIST RNNs所需的计算量甚至少于LSTM,证实其计算效率。
  • 结果表明,MIST RNNs不仅在捕捉长期依赖关系方面更有效,而且在参数与计算方面均优于LSTM与先前的NARX RNN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。