Skip to main content
QUICK REVIEW

[论文解读] Context-Aware Learning for Neural Machine Translation

Sébastien Jean, Kyunghyun Cho|arXiv (Cornell University)|Mar 12, 2019
Natural Language Processing Techniques参考文献 25被引用 16
一句话总结

本文提出一种上下文感知学习算法,采用多层级成对排序损失,明确鼓励神经机器翻译模型利用额外上下文(如文档级翻译中的前文句子)。在基于Transformer的系统上评估,该方法显著提升了上下文敏感性,并带来可测量的BLEU提升,证明学习关注上下文与网络架构设计同样关键。

ABSTRACT

Interest in larger-context neural machine translation, including document-level and multi-modal translation, has been growing. Multiple works have proposed new network architectures or evaluation schemes, but potentially helpful context is still sometimes ignored by larger-context translation models. In this paper, we propose a novel learning algorithm that explicitly encourages a neural translation model to take into account additional context using a multilevel pair-wise ranking loss. We evaluate the proposed learning algorithm with a transformer-based larger-context translation system on document-level translation. By comparing performance using actual and random contexts, we show that a model trained with the proposed algorithm is more sensitive to the additional context.

研究动机与目标

  • 为解决神经机器翻译模型在有效利用更大上下文(如前文句子或图像)方面的局限性。
  • 开发一种学习算法,明确鼓励模型利用额外上下文,且独立于网络架构设计。
  • 通过使模型对正确上下文更敏感,即使上下文存在噪声或无关信息,从而提升翻译质量。
  • 在采用改进的Transformer架构的文档级翻译任务上,评估所提方法的有效性。

提出的方法

  • 引入一种多层级成对排序损失,为与正确上下文配对的翻译分配更高的对数概率,而非与错误或随机上下文配对的翻译。
  • 在三个层级应用正则化项:词粒度、句子粒度和批次粒度,以考虑不同粒度下上下文效用的差异。
  • 使用改进的Transformer模型,独立编码当前和前一句,然后在解码前融合其表征。
  • 采用对比学习目标,模型通过基于边距的排序损失学习区分正确与错误的上下文配对。
  • 使用标准最大似然损失结合所提出的正则化项进行模型训练,超参数通过验证性能调优。
  • 通过比较使用真实上下文与随机打乱上下文时的翻译质量,评估模型敏感性,以BLEU差异作为上下文感知能力的代理指标。

实验结果

研究问题

  • RQ1能否设计一种学习算法,使神经机器翻译模型在不修改网络架构的前提下,对额外上下文更加敏感?
  • RQ2多层级成对排序损失是否能有效提升模型在文档级翻译中对正确上下文的利用?
  • RQ3与标准最大似然训练相比,所提方法在多大程度上提升了翻译质量?
  • RQ4当使用所提损失训练时,模型对上下文的敏感性相较于标准训练有何变化?

主要发现

  • 使用所提正则化项训练的模型相比基线模型在BLEU分数上表现出显著提升,表明整体翻译质量更好。
  • 使用标准最大似然损失训练的模型未能有效利用前一句,表现为在使用错误上下文时BLEU仅下降极小(ΔBLEU = 0.40)。
  • 所提方法显著增强了模型对上下文的敏感性,对于能从上下文中受益的句子,正确与错误上下文配对的累积BLEU分数差距显著。
  • 使用所提损失训练的模型在比较正确与随机上下文时,ΔBLEU^test(θ)超过0.40,证实其上下文感知能力得到提升。
  • 该方法在多个粒度层级上均有效,如多层级损失设计所示,其在词、句子和批次层级均增强了上下文利用能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。