[论文解读] Non-Autoregressive Neural Machine Translation with Enhanced Decoder Input
本文提出两种方法,通过注入目标语言侧信息来增强非自回归神经机器翻译(NAT)中的解码器输入:(1)使用短语表查找实现从源端到目标端的直接词元翻译;(2)通过句子级对齐与词级对抗学习实现词嵌入映射。该方法在WMT14 En-De和WMT16 En-Ro上分别将BLEU提升5.11和4.72,达到当前最优的NAT性能。
Non-autoregressive translation (NAT) models, which remove the dependence on previous target tokens from the inputs of the decoder, achieve significantly inference speedup but at the cost of inferior accuracy compared to autoregressive translation (AT) models. Previous work shows that the quality of the inputs of the decoder is important and largely impacts the model accuracy. In this paper, we propose two methods to enhance the decoder inputs so as to improve NAT models. The first one directly leverages a phrase table generated by conventional SMT approaches to translate source tokens to target tokens, which are then fed into the decoder as inputs. The second one transforms source-side word embeddings to target-side word embeddings through sentence-level alignment and word-level adversary learning, and then feeds the transformed word embeddings into the decoder as inputs. Experimental results show our method largely outperforms the NAT baseline~\citep{gu2017non} by $5.11$ BLEU scores on WMT14 English-German task and $4.72$ BLEU scores on WMT16 English-Romanian task.
研究动机与目标
- 为解决非自回归翻译(NAT)模型因解码器输入信号微弱而导致的性能下降问题。
- 通过提供更强且更相关的上下文信息,降低NAT解码器的任务难度。
- 通过直接向解码器输入注入目标语言侧信息,在不牺牲推理速度的前提下提升NAT性能。
- 探索两种互补方法——短语表查找与学习到的嵌入映射——以生成高质量的解码器输入。
提出的方法
- 第一种方法使用预训练的SMT短语表,将源端词元直接翻译为目标端词元,并将其作为解码器输入。
- 第二种方法通过句子级对齐与词级对抗损失,学习从源端词嵌入到目标端嵌入的线性变换。
- 句子级对齐损失通过最小化映射后源端嵌入与目标端嵌入之间的L2距离,实现句子级别的对齐。
- 词级对抗损失确保映射后源端嵌入的分布与真实目标端嵌入的分布一致,从而提升泛化能力。
- 增强后的解码器输入 $\hat{y}$ 作为NAT解码器中的全局上下文使用:$y_t = \mathbb{D}(\hat{y}, \mathbb{E}(x))$,实现并行生成并获得更强的上下文信息。
- 整个模型端到端训练,使解码器能够受益于更准确且与目标相关联的输入信号。
实验结果
研究问题
- RQ1在NAT模型的解码器输入中注入目标语言侧信息,是否能显著提升翻译准确率?
- RQ2解码器输入信号的质量(如短语表与学习到的嵌入)如何影响NAT模型的性能?
- RQ3在嵌入映射方法中,句子级对齐与词级对抗学习的相对贡献分别是什么?
- RQ4所提出的方法是否能减少NAT模型的失败模式,如长句中的重复与漏词?
- RQ5所提出的方法是否能在多种语言对与不同数据集规模下实现良好泛化?
主要发现
- 与NAT基线模型相比,该方法在WMT14英语-德语翻译任务中将BLEU提升5.11分。
- 在WMT16英语-罗马尼亚语任务中,该方法相比基线模型实现4.72分的BLEU提升。
- 在较小且更干净的数据集(如IWSLT14 De-En)上,短语表查找表现更优,因其短语表质量更高(BLEU 15.69)。
- 在更大且更嘈杂的数据集(如WMT14 En-De和WMT16 En-Ro)上,嵌入映射优于短语表查找,因这些数据集的短语表质量较低(BLEU分别为6.03和9.16)。
- 消融实验证实,句子级对齐与词级对抗损失均不可或缺,二者结合可达到最高BLEU分数(IWSLT14 De-En上为24.13)。
- 该模型成功翻译了基线NAT模型无法处理的长句,有效避免了重复与漏词问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。