Skip to main content
QUICK REVIEW

[论文解读] Improving the Transformer Translation Model with Document-Level Context

Jiacheng Zhang, Huanbo Luan|arXiv (Cornell University)|Oct 8, 2018
Natural Language Processing Techniques被引用 15
一句话总结

本文提出了一种用于Transformer翻译模型的文档级上下文编码器,利用多头自注意力机制捕捉跨句子的长距离依赖关系。通过先在句子级别数据上进行训练,再在有限的文档级别数据上微调,该方法在中文-英文翻译中提升了1.96 BLEU,在法文-英文翻译中提升了0.89 BLEU,优于标准Transformer模型和基于缓存的基线模型。

ABSTRACT

Although the Transformer translation model (Vaswani et al., 2017) has achieved state-of-the-art performance in a variety of translation tasks, how to use document-level context to deal with discourse phenomena problematic for Transformer still remains a challenge. In this work, we extend the Transformer model with a new context encoder to represent document-level context, which is then incorporated into the original encoder and decoder. As large-scale document-level parallel corpora are usually not available, we introduce a two-step training method to take full advantage of abundant sentence-level parallel corpora and limited document-level parallel corpora. Experiments on the NIST Chinese-English datasets and the IWSLT French-English datasets show that our approach improves over Transformer significantly.

研究动机与目标

  • 为解决Transformer模型在处理指代消解和词汇衔接等话语现象方面的局限性,通过引入文档级上下文信息。
  • 通过在两步训练过程中利用丰富的句子级别平行语料,克服大规模文档级别平行语料稀缺的问题。
  • 扩展Transformer架构,引入一种上下文编码器,将文档级表征集成到编码器和解码器中,且计算开销几乎不变。
  • 在标准模型因缺乏上下文而表现欠佳的低资源文档级翻译设置下,提升翻译质量。

提出的方法

  • 提出一种基于多头自注意力机制的新上下文编码器,用于从源句中计算文档级上下文表征。
  • 通过多头注意力机制将文档级上下文信息整合到原始Transformer编码器和解码器中。
  • 采用两步训练策略:先在句子级别平行语料上预训练,然后在有限的文档级别平行语料上微调,同时保持句子级别参数固定。
  • 使用上下文门控机制动态控制文档级上下文的影响,替代残差连接以实现更优的特征融合。
  • 在解码过程中应用多头注意力机制,对整个源文档进行注意力计算,从而实现长距离依赖建模。
  • 通过依赖高度可并行化的注意力模块,保持计算效率,避免训练或推理阶段显著的速度下降。

实验结果

研究问题

  • RQ1文档级上下文能否显著提升Transformer在指代消解和词汇衔接等话语现象上的翻译性能?
  • RQ2当仅能获得有限的文档级别平行语料时,如何有效训练Transformer模型?
  • RQ3将文档级上下文信息最优地集成到Transformer架构的编码器和解码器中的方法是什么?
  • RQ4采用两步训练策略(即先在句子级别数据上预训练,再在文档级别数据上微调)是否优于在小规模文档数据上端到端训练?
  • RQ5上下文门控机制与残差连接相比,在控制文档级上下文信息流动方面表现如何?

主要发现

  • 在NIST中文-英文数据集上,所提方法在使用文档级上下文时,使Transformer翻译性能提升了1.96 BLEU点。
  • 在IWSLT法文-英文数据集上,模型相比标准Transformer模型实现了0.89 BLEU点的性能提升。
  • 将文档级上下文同时集成到编码器和解码器中可获得最高性能,达到47.51 BLEU,而仅增强编码器时性能为45.97 BLEU。
  • 与标准残差连接相比,上下文门控机制使翻译质量提升了0.38 BLEU点,表明其在控制上下文信息整合方面具有显著有效性。
  • 两步训练方法显著优于在小规模文档数据上的端到端训练,避免了先前研究中观察到的性能下降问题。
  • 消融实验确认,文档级上下文能够解决词义歧义和词汇衔接问题。案例研究表明,'yundong'(运动)在' saiche'(赛车)的上下文提示下被正确消歧为'sport'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。