[论文解读] Improving the Transformer Translation Model with Document-Level Context
本文提出了一种用于Transformer翻译模型的文档级上下文编码器,利用多头自注意力机制捕捉跨句子的长距离依赖关系。通过先在句子级别数据上进行训练,再在有限的文档级别数据上微调,该方法在中文-英文翻译中提升了1.96 BLEU,在法文-英文翻译中提升了0.89 BLEU,优于标准Transformer模型和基于缓存的基线模型。
Although the Transformer translation model (Vaswani et al., 2017) has achieved state-of-the-art performance in a variety of translation tasks, how to use document-level context to deal with discourse phenomena problematic for Transformer still remains a challenge. In this work, we extend the Transformer model with a new context encoder to represent document-level context, which is then incorporated into the original encoder and decoder. As large-scale document-level parallel corpora are usually not available, we introduce a two-step training method to take full advantage of abundant sentence-level parallel corpora and limited document-level parallel corpora. Experiments on the NIST Chinese-English datasets and the IWSLT French-English datasets show that our approach improves over Transformer significantly.
研究动机与目标
- 为解决Transformer模型在处理指代消解和词汇衔接等话语现象方面的局限性,通过引入文档级上下文信息。
- 通过在两步训练过程中利用丰富的句子级别平行语料,克服大规模文档级别平行语料稀缺的问题。
- 扩展Transformer架构,引入一种上下文编码器,将文档级表征集成到编码器和解码器中,且计算开销几乎不变。
- 在标准模型因缺乏上下文而表现欠佳的低资源文档级翻译设置下,提升翻译质量。
提出的方法
- 提出一种基于多头自注意力机制的新上下文编码器,用于从源句中计算文档级上下文表征。
- 通过多头注意力机制将文档级上下文信息整合到原始Transformer编码器和解码器中。
- 采用两步训练策略:先在句子级别平行语料上预训练,然后在有限的文档级别平行语料上微调,同时保持句子级别参数固定。
- 使用上下文门控机制动态控制文档级上下文的影响,替代残差连接以实现更优的特征融合。
- 在解码过程中应用多头注意力机制,对整个源文档进行注意力计算,从而实现长距离依赖建模。
- 通过依赖高度可并行化的注意力模块,保持计算效率,避免训练或推理阶段显著的速度下降。
实验结果
研究问题
- RQ1文档级上下文能否显著提升Transformer在指代消解和词汇衔接等话语现象上的翻译性能?
- RQ2当仅能获得有限的文档级别平行语料时,如何有效训练Transformer模型?
- RQ3将文档级上下文信息最优地集成到Transformer架构的编码器和解码器中的方法是什么?
- RQ4采用两步训练策略(即先在句子级别数据上预训练,再在文档级别数据上微调)是否优于在小规模文档数据上端到端训练?
- RQ5上下文门控机制与残差连接相比,在控制文档级上下文信息流动方面表现如何?
主要发现
- 在NIST中文-英文数据集上,所提方法在使用文档级上下文时,使Transformer翻译性能提升了1.96 BLEU点。
- 在IWSLT法文-英文数据集上,模型相比标准Transformer模型实现了0.89 BLEU点的性能提升。
- 将文档级上下文同时集成到编码器和解码器中可获得最高性能,达到47.51 BLEU,而仅增强编码器时性能为45.97 BLEU。
- 与标准残差连接相比,上下文门控机制使翻译质量提升了0.38 BLEU点,表明其在控制上下文信息整合方面具有显著有效性。
- 两步训练方法显著优于在小规模文档数据上的端到端训练,避免了先前研究中观察到的性能下降问题。
- 消融实验确认,文档级上下文能够解决词义歧义和词汇衔接问题。案例研究表明,'yundong'(运动)在' saiche'(赛车)的上下文提示下被正确消歧为'sport'。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。