Skip to main content
QUICK REVIEW

[论文解读] Pretrained Language Models for Document-Level Neural Machine Translation

Liangyou Li, Xin Jiang|arXiv (Cornell University)|Nov 8, 2019
Natural Language Processing Techniques参考文献 14被引用 16
一句话总结

该论文提出了一种文档级神经机器翻译(NMT)系统,该系统利用单语预训练语言模型(BERT)初始化编码器,采用上下文操控技术——片段嵌入、反向位置嵌入和上下文掩码——以控制大上下文的影响,并引入多任务学习以实现正则化。在IWSLT数据集上的实验表明,该方法在Zh-En、Fr-En和Es-En任务上相比之前的工作取得了显著的BLEU分数提升(最高达3.11),证明了使用BERT初始化和上下文感知设计在长上下文NMT中的有效性。

ABSTRACT

Previous work on document-level NMT usually focuses on limited contexts because of degraded performance on larger contexts. In this paper, we investigate on using large contexts with three main contributions: (1) Different from previous work which pertrained models on large-scale sentence-level parallel corpora, we use pretrained language models, specifically BERT, which are trained on monolingual documents; (2) We propose context manipulation methods to control the influence of large contexts, which lead to comparable results on systems using small and large contexts; (3) We introduce a multi-task training for regularization to avoid models overfitting our training corpora, which further improves our systems together with a deeper encoder. Experiments are conducted on the widely used IWSLT data sets with three language pairs, i.e., Chinese--English, French--English and Spanish--English. Results show that our systems are significantly better than three previously reported document-level systems.

研究动机与目标

  • 为解决在使用大上下文时文档级NMT性能下降的问题,通过提升模型稳定性和相关性来改善性能。
  • 探索使用单语预训练语言模型(如BERT)而非句子级别的平行语料库来初始化编码器。
  • 设计架构上的修改,以显式控制大上下文序列对翻译输出的影响。
  • 通过多任务训练提升低资源文档级NMT的泛化能力并减少过拟合。

提出的方法

  • 使用在大规模单语语料库(如维基百科)上预训练的多语言或单语BERT模型初始化编码器。
  • 将源句与其前序上下文(最多512个token)拼接,并插入[SEP]标记以区分两者。
  • 引入片段嵌入以在编码器输入中区分输入句子及其上下文。
  • 用反向位置嵌入替代标准位置嵌入,以更好地建模从上下文到输入的依赖方向。
  • 在解码过程中应用上下文掩码,防止注意力机制关注上下文标记,确保仅使用输入句子进行生成。
  • 通过在编码器隐藏状态上添加掩码语言模型(MLM)目标,实现多任务学习目标,以正则化表示学习。

实验结果

研究问题

  • RQ1当用于初始化编码器时,像BERT这样的单语预训练语言模型是否能提升文档级NMT的性能?
  • RQ2如何有效整合大上下文输入(最多512个token),同时避免翻译质量下降?
  • RQ3诸如片段嵌入、反向位置嵌入和上下文掩码等架构修改是否有助于稳定训练并在长上下文上提升性能?
  • RQ4通过掩码语言模型进行多任务学习是否能增强文档级NMT的泛化能力并减少过拟合?

主要发现

  • 使用BERT进行编码器初始化,使Zh-En的基线BLEU分数提升1.04,Fr-En提升0.64,Es-En提升0.55,证明了在单语数据上预训练的价值。
  • 完整系统(包含BERT、上下文操控和多任务学习)相比之前的最先进系统,在Zh-En上实现3.11的BLEU提升,Es-En上为2.84,Fr-En上为2.06。
  • 在应用上下文操控技术后,小上下文与大上下文系统之间的性能差距缩小至仅0.2 BLEU,表明对上下文影响的控制效果良好。
  • 若无上下文操控,大上下文会导致性能下降(如训练发散),但通过这些方法,大上下文能持续带来性能增益。
  • 消融实验证实,每个组件——BERT、上下文操控和多任务学习——均对最终性能有逐步贡献。
  • 更深的编码器(12层)结合MLM预训练可进一步提升性能,Fr-En上最高提升达0.64 BLEU。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。