[论文解读] Improving Neural Machine Translation with Pre-trained Representation
本文提出一种双向自注意力语言模型(BSLM),通过单语数据学习句子级表征,并利用加权融合机制与知识迁移范式,将这些表征整合到基于Transformer的神经机器翻译模型的源端和目标端。该方法在中英和德英翻译任务上显著优于强基线模型,且在低资源英土翻译设置中取得更大提升。
Monolingual data has been demonstrated to be helpful in improving the translation quality of neural machine translation (NMT). The current methods stay at the usage of word-level knowledge, such as generating synthetic parallel data or extracting information from word embedding. In contrast, the power of sentence-level contextual knowledge which is more complex and diverse, playing an important role in natural language generation, has not been fully exploited. In this paper, we propose a novel structure which could leverage monolingual data to acquire sentence-level contextual representations. Then, we design a framework for integrating both source and target sentence-level representations into NMT model to improve the translation quality. Experimental results on Chinese-English, German-English machine translation tasks show that our proposed model achieves improvement over strong Transformer baselines, while experiments on English-Turkish further demonstrate the effectiveness of our approach in the low-resource scenario.
研究动机与目标
- 为解决神经机器翻译中单语数据的低效利用问题,特别是其句子级上下文知识的未充分利用。
- 探究预训练的句子表征是否能超越词级知识,提升神经机器翻译性能。
- 设计一种方法,有效将预训练表征整合到神经机器翻译模型的源端与目标端。
- 克服现有方法仅关注词级特征或无法建模句子表征中序列依赖关系的局限。
- 在高资源与低资源翻译场景中均验证该方法的有效性。
提出的方法
- 提出一种在单语数据上训练的双向自注意力语言模型(BSLM),以捕捉前向与后向的序列依赖关系,实现句子表征学习。
- 采用加权融合机制,通过学习每一Transformer层的分层融合权重,将BSLM表征融入编码器。
- 应用知识迁移范式,通过使用部分翻译输出进行微调,将BSLM中的任务特定知识迁移至解码器。
- 在BSLM中采用双流架构,分别设置前向与后向自注意力网络,更有效地建模序列上下文。
- 在不修改原始架构的前提下,将预训练表征集成到Transformer框架中,确保与多种神经机器翻译模型的兼容性。
- 在大规模单语句子上预训练BSLM,并端到端微调NMT模型,融合表征进行训练。
实验结果
研究问题
- RQ1能否利用单语数据中的句子级上下文表征提升神经机器翻译性能?
- RQ2如何有效将预训练的句子表征整合到神经机器翻译模型的编码器与解码器中?
- RQ3所提方法是否优于仅使用词级知识或基于单语源生成合成数据的现有方法?
- RQ4预训练表征的融合在低资源翻译设置中是否更具优势?
- RQ5双向自注意力模型是否能比单向或RNN-based模型更有效地捕捉神经机器翻译中句子表征的序列依赖关系?
主要发现
- 在中英翻译任务中,所提方法相比基线Transformer模型,BLEU得分提升1.22分。
- 在德英翻译任务中,模型相比Transformer基线,BLEU得分提升0.91分。
- 在低资源英土翻译设置中,模型实现显著的BLEU提升2.14分,展现出强大的泛化能力。
- 在源端应用知识迁移范式带来适度提升,而目标端采用加权融合机制时,若使用不完整的部分翻译结果,反而导致BLEU下降0.66分。
- 融合权重的可视化显示BSLM与Transformer各层之间存在强相关性,表明表征对齐与分层表征学习有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。