[论文解读] Multi-layer Representation Fusion for Neural Machine Translation
本文提出多层表示融合(MLRF)来在基于 Transformer 的神经机器翻译中密集连接所有堆叠层,使预测能够利用较低层表示通过三种融合函数,从而带来 BLEU 增益和正则化效应,包括在 IWSLT German-English 上达到的新 state-of-the-art。
Neural machine translation systems require a number of stacked layers for deep models. But the prediction depends on the sentence representation of the top-most layer with no access to low-level representations. This makes it more difficult to train the model and poses a risk of information loss to prediction. In this paper, we propose a multi-layer representation fusion (MLRF) approach to fusing stacked layers. In particular, we design three fusion functions to learn a better representation from the stack. Experimental results show that our approach yields improvements of 0.92 and 0.56 BLEU points over the strong Transformer baseline on IWSLT German-English and NIST Chinese-English MT tasks respectively. The result is new state-of-the-art in German-English translation.
研究动机与目标
- 在神经机器翻译中动机使用低层表示,以减少信息损失并改善训练。
- 提出一个密集连接的融合机制,能够访问所有低层表示。
- 开发并比较三种融合函数(avg-pooling、FNN、带跳数的自注意力)以实现有效融合。
- 在 German-English 与 Chinese-English 翻译任务上显示相较强基线 Transformer 的提升。
- 展示正则化效应并分析嵌入和注意力跳数对性能的影响。
提出的方法
- 引入一个融合层,与所有堆叠层相连,并为每个目标位置 j 学习一个融合表示 φ(Zj)。
- 将输出概率重新表述为依赖于 φ(Zj) 而不仅仅是顶层:Pr(yj|y<j,x)=Softmax(Wo·φ(Zj)+bo)。
- 比较三种融合策略:(i){zl j} 的 avg-pooling;(ii)拼接后再通过前馈网络(FNN)生成一个 d 维的融合向量;(iii)在增广的层表示上进行多跳自注意力,配合层嵌入形成一个二维表示。
- 探索带跳数的自注意力,包括把层嵌入 El 加到每层表示 ˜zl= zl+El,并用两层 FNN 计算注意力能量以获得跳数权重。
- 允许在编码器端、解码器端或两端进行融合;在融合层后应用层归一化以实现稳定训练。
- 在基于 Transformer 的 NMT 上以 3-layer/6-layer 设置(德英与中英)进行演示,并报告 BLEU 提升。
实验结果
研究问题
- RQ1在 Transformer 基于的 NMT 中,密集融合所有低层表示是否比仅使用顶层预测进一步提升翻译质量?
- RQ2哪种融合函数(avg-pooling、FNN、自注意力)能得到更好的翻译性能,且在编码器端、解码器端或两端进行融合是否重要?
- RQ3自注意力基础的融合中的跳数数量以及词嵌入和层嵌入的引入如何影响性能与训练稳定性?
- RQ4MLRF 是否起到正则化作用,减少深度 NMT 模型的过拟合?
- RQ5在使用多跳融合时,对层注意力的定性解释是什么?
主要发现
- MLRF 提升 Transformer 基线,在 IWSLT German-English 上比强基线 Transformer 提升 0.92 BLEU 点。
- MLRF 在 NIST Chinese-English 翻译上相较基线提升 0.56 BLEU 点。
- 解码端融合通常优于编码端融合,且在两端融合可根据融合函数带来额外增益。
- 报道的最佳配置是在编码端采用基于 FNN 的融合,在解码端采用基于自注意力的融合(Both-FNN-SA),在德英上比 3-layer 基线高出 0.92 BLEU。
- 自注意力多跳融合(Dec-SA)提供稳定的增益,并显示跳数增加在某个点之前(nhop < 6)可以提升性能,超过该点回报递减。
- 该方法显示出正则化效应,相较基线降低过拟合,如训练/验证动态和 dropout 分析所示。
- 层注意力可视化表明大多数预测的跳数关注于高层,而后续跳数在层之间扩散注意力,反映每次跳数捕捉到的不同方面。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。