[论文解读] Training Deeper Neural Machine Translation Models with Transparent Attention
本文提出透明注意力(Transparent Attention)方法,通过允许解码器关注所有编码器层输出的加权组合(而非仅顶层),增强了深度神经机器翻译模型中的梯度流动。该技术成功训练了更深的Transformer和双向RNN编码器(最多20层),在WMT’14 En→De和WMT’15 Cs→En基准测试中实现了稳定的0.7–1.1 BLEU提升,同时改善了优化稳定性与深层模型的性能。
While current state-of-the-art NMT models, such as RNN seq2seq and Transformers, possess a large number of parameters, they are still shallow in comparison to convolutional models used for both text and vision applications. In this work we attempt to train significantly (2-3x) deeper Transformer and Bi-RNN encoders for machine translation. We propose a simple modification to the attention mechanism that eases the optimization of deeper models, and results in consistent gains of 0.7-1.1 BLEU on the benchmark WMT'14 English-German and WMT'15 Czech-English tasks for both architectures.
研究动机与目标
- 为解决训练极深神经机器翻译模型(尤其是超过12层)的挑战,标准注意力机制因梯度流动不良而失效。
- 通过修改注意力机制以支持所有编码器层之间的直接梯度路径,提升深层Transformer和双向RNN编码器的优化稳定性。
- 探究尽管训练难度增加,更深的模型是否能比更宽的模型带来更好的翻译性能。
- 验证增强的梯度流动是否能在标准神经机器翻译基准上带来一致的性能提升。
提出的方法
- 引入一个可学习的权重矩阵 W,大小为 (N+1)×M,其中 N 为编码器层数,M 为解码器注意力头数量,用于在所有编码器层之间分配注意力权重。
- 对权重 W 应用 softmax 归一化,生成注意力分布 s_{i,j} = exp(W_{i,j}) / Σ_k exp(W_{k,j}),其中 j 为注意力头,i 为编码器层。
- 计算所有层 i 的编码器隐藏状态 h^i_t 的加权组合 z^j_t = Σ_i s_{i,j} h^i_t,解码器将注意力聚焦于此组合,而非仅顶层输出。
- 在 RNMT+ 中,于注意力计算前对加权组合应用投影,以保持与原始架构的兼容性。
- 训练过程中对权重矩阵 W 使用 dropout,以稳定学习过程并防止对注意力权重的过拟合。
- 使用 Adam 优化器,在八个 P100 GPU 上进行同步梯度更新,采用标准的 WMT’14 和 WMT’15 数据集,结合子词分词和共享的32k词汇表。
实验结果
研究问题
- RQ1当标准注意力机制在12层以上失效时,能否成功训练更深的Transformer和双向RNN编码器用于神经机器翻译?
- RQ2在所有编码器层之间引入可学习的加权注意力机制,是否能改善深层模型中的梯度流动与优化稳定性?
- RQ3在翻译质量与参数效率方面,采用透明注意力的更深模型相较于标准宽模型,其性能提升程度如何?
- RQ4注意力权重的分布如何随训练演化?其是否体现出类似模型集成的行为?
主要发现
- 原始Transformer模型在12层或以上编码器层数时无法训练,而透明注意力使20层编码器的训练成为可能。
- 透明注意力在所有深度设置下,均在WMT’14 En→De和WMT’15 Cs→En翻译任务中实现0.7–1.1 BLEU点的一致性提升。
- 20层编码器搭配透明注意力的模型,尽管参数量不足标准Transformer Big的一半,但性能仍更优。
- 注意力权重 s_{i,j} 的演化显示:训练初期低层(如嵌入层和早期层)获得更高注意力,而随着训练推进,深层(如16层和20层)逐渐获得更大权重,表明存在动态特征融合机制。
- 梯度范数比(r_t)曲线显示,透明注意力稳定了训练动态,其表现类似训练良好的RNMT+模型,有效缓解了梯度消失问题。
- 性能提升部分归因于隐式的集成效应:通过注意力机制动态组合多个编码器层的表示,类似于BERT等模型中的上下文嵌入机制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。