[论文解读] RRA: Recurrent Residual Attention for Sequence Learning
本文提出RRA(循环残差注意力机制),通过在RNN中引入跨多个时间步的残差连接上的注意力机制,增强了长序列建模能力。通过允许误差信号直接通过这些残差路径反向传播,并学习过去隐藏状态的动态注意力权重,RRA在MNIST和IMDB情感分析等序列任务上实现了比标准LSTM更快的收敛速度、更稳定的训练过程以及更优的性能表现。
In this paper, we propose a recurrent neural network (RNN) with residual attention (RRA) to learn long-range dependencies from sequential data. We propose to add residual connections across timesteps to RNN, which explicitly enhances the interaction between current state and hidden states that are several timesteps apart. This also allows training errors to be directly back-propagated through residual connections and effectively alleviates gradient vanishing problem. We further reformulate an attention mechanism over residual connections. An attention gate is defined to summarize the individual contribution from multiple previous hidden states in computing the current state. We evaluate RRA on three tasks: the adding problem, pixel-by-pixel MNIST classification and sentiment analysis on the IMDB dataset. Our experiments demonstrate that RRA yields better performance, faster convergence and more stable training compared to a standard LSTM network. Furthermore, RRA shows highly competitive performance to the state-of-the-art methods.
研究动机与目标
- 解决RNN在学习跨时间步的长距离依赖时出现的梯度消失问题。
- 克服标准RNN和LSTM在显式捕捉非相邻序列元素之间语义关系方面的局限性。
- 提出一种新型的时间步残差连接上的注意力机制,以改善误差反向传播和上下文建模能力。
- 证明RRA在序列学习基准测试中优于标准LSTM,并与当前最先进方法具有竞争力。
- 为现有使用高阶递归或全局注意力的RNN方法提供一种更具灵活性且参数效率更高的替代方案。
提出的方法
- 在RNN中引入时间步之间的残差连接,使当前到远距离隐藏状态的训练误差信号可直接反向传播。
- 重新表述残差函数,使其包含对多个过去隐藏状态的注意力机制:$\mathbf{h}_t = \mathcal{M}(\mathbf{x}_t, \mathbf{h}_{t-1}) + \mathcal{F}(\mathbf{h}_{t-2}, \mathbf{h}_{t-3}, \dots, \mathbf{h}_{t-K-1}; \mathbf{W}_a)$,其中$\mathcal{F}$应用学习到的注意力权重$\mathbf{W}_a$。
- 定义一个注意力门控机制,动态控制每个过去隐藏状态对当前状态的相对贡献,从而实现对语义相关长距离依赖的有选择性关注。
- 采用可微分的注意力机制作用于残差连接,支持通过时间反向传播(BPTT)进行端到端训练。
- 保持标准RNN单元用于$\mathcal{M}(\mathbf{x}_t, \mathbf{h}_{t-1})$,同时增加注意力加权的残差组件。
- 可视化注意力权重,分析模型如何学习关注相关的时间步,例如在句子中捕捉非相邻词语之间的依赖关系。
实验结果
研究问题
- RQ1时间步之间的残差连接是否能改善梯度流动并缓解RNN中的梯度消失问题?
- RQ2对多个过去隐藏状态的注意力是否能增强序列数据中长距离依赖的建模能力?
- RQ3与标准LSTM相比,所提出的RRA机制是否能带来更快的收敛速度和更稳定的训练过程?
- RQ4在无需预训练或词嵌入的情况下,RRA在序列学习任务上的表现如何,相较于当前最先进方法?
- RQ5RRA在多大程度上能够捕捉序列中非相邻元素之间的语义依赖关系,如代词与其先行词之间的关系?
主要发现
- 在加法问题、逐像素MNIST和IMDB情感分析任务中,RRA相比标准LSTM实现了更快的收敛速度和更稳定的训练过程。
- 在加法问题中,当相关输入之间的间隔较大时,RRA成功学习了标准LSTM难以捕捉的长距离依赖关系。
- 在逐像素MNIST任务中,RRA的测试准确率高于LSTM,表明其具备更强的泛化能力和序列建模能力。
- 在IMDB情感分析任务中,RRA表现出与当前最先进方法相当的性能,即使未使用word2vec嵌入或预训练。
- 注意力权重的可视化显示,RRA学会了为语义相关的过去时间步分配更高的重要性,例如在预测代词'her'时关注'girl'。
- 尽管训练速度略慢(例如在K=5的打乱MNIST上每轮约760秒),但当应用早停策略时,RRA比LSTM更早达到收敛,表明其具有更好的样本效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。