[论文解读] Neural Machine Translation with Joint Representation
本文提出 Reformer,一种用于神经机器翻译的新型序列到序列框架,通过一种名为可分离注意力(Separable Attention)的新颖高效注意力机制,在源序列与目标序列之间实现联合表征。通过在保持计算效率的同时完全建模所有源-目标标记之间的交互,Reformer 在大规模翻译任务中相比 Transformer 域名基线模型性能提升最高达 1.9 BLEU 分,且参数量减少 50%,达到当前最先进水平。
Though early successes of Statistical Machine Translation (SMT) systems are attributed in part to the explicit modelling of the interaction between any two source and target units, e.g., alignment, the recent Neural Machine Translation (NMT) systems resort to the attention which partially encodes the interaction for efficiency. In this paper, we employ Joint Representation that fully accounts for each possible interaction. We sidestep the inefficiency issue by refining representations with the proposed efficient attention operation. The resulting Reformer models offer a new Sequence-to- Sequence modelling paradigm besides the Encoder-Decoder framework and outperform the Transformer baseline in either the small scale IWSLT14 German-English, English-German and IWSLT15 Vietnamese-English or the large scale NIST12 Chinese-English translation tasks by about 1 BLEU point.We also propose a systematic model scaling approach, allowing the Reformer model to beat the state-of-the-art Transformer in IWSLT14 German-English and NIST12 Chinese-English with about 50% fewer parameters. The code is publicly available at https://github.com/lyy1994/reformer.
研究动机与目标
- 为解决神经机器翻译中全联合表征的低效问题,该问题显式建模所有源-目标单元交互,但带来高昂的计算成本。
- 开发一种高效的注意力机制,能够完整捕捉源序列与目标序列之间的交互,克服标准注意力机制仅限制于单个序列内部交互的局限。
- 提出一种基于联合表征的新序列到序列建模范式,独立于传统的编码器-解码器框架。
- 实现系统化的模型缩放,以显著减少参数量的同时获得最先进性能。
- 通过增强上下文建模与长度预测准确性,提升翻译质量,尤其针对长序列与罕见词。
提出的方法
- 提出可分离注意力(Separable Attention),一种新型注意力机制,作用于联合表征空间 $\mathbb{R}^{S\times T\times H}$,实现源-目标标记之间的完整交互建模。
- 设计两种 Reformer 变体:Reformer-base 在 $O(1)$ 时间内可访问任意源或目标标记,以实现最大性能;Reformer-fast 在保持相近性能的前提下提升效率。
- 采用重新设计的自注意力机制,将计算拆分至源序列与目标序列,降低复杂度的同时保留完整交互建模能力。
- 应用残差连接与层归一化以稳定训练,遵循 Transformer 架构,但适配于联合表征空间。
- 提出一种系统化模型缩放方法,仅需 $O(2)$ 次运行即可生成增强模型,相较多项式复杂度的网格搜索更为高效。
- 在缩放模型间采用共享参数初始化策略,确保性能一致提升,无需耗时的超参数调优。
实验结果
研究问题
- RQ1基于全联合表征的序列到序列模型是否能在保持计算效率的同时,超越标准 Transformer 模型的翻译质量?
- RQ2可分离注意力在建模长距离依赖与罕见词预测方面,相较于标准自注意力有何表现?
- RQ3通过模型缩放可在更少参数下实现多大程度的性能提升?该可扩展方法是否比网格搜索更高效?
- RQ4联合表征是否能带来更优的长度预测与更少的翻译缺失(under-translation)现象,相较于标准注意力机制?
- RQ5Reformer 框架是否能在小规模与大规模翻译基准上均实现良好泛化?
主要发现
- 在 IWSLT14 德语-英语、英语-德语和 IWSLT15 越南语-英语任务上,Reformer-base 与 Reformer-fast 分别相较 Transformer 基线模型提升 1.3、0.8 和 0.7 BLEU 分。
- 在大规模 NIST12 中文-英语基准上,Reformer 相较于 Transformer 基线实现 1.9 BLEU 分的性能提升。
- 经过系统化模型缩放后,Reformer 在 IWSLT14 德语-英语任务上超越 SOTA 大型 Transformer 模型 0.7 BLEU,在 NIST12 中文-英语任务上提升 2.0 BLEU,且参数量减少约 50%。
- Reformer 模型生成的翻译长度更合理,长度比高于基线,有效减少翻译缺失现象。
- Reformer 在远距离目标位置与低频词上的预测准确率显著更高,表明其具备更强的上下文建模能力与长距离依赖捕捉能力。
- 可分离注意力的可视化结果表明,其在源序列与目标序列上均呈现动态、与标记相关的注意力分布,与标准自注意力中静态分布形成鲜明对比。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。