Skip to main content
QUICK REVIEW

[论文解读] Exploiting Linguistic Resources for Neural Machine Translation Using Multi-task Learning

Jan Niehues, Eunah Cho|arXiv (Cornell University)|Aug 3, 2017
Natural Language Processing Techniques参考文献 21被引用 15
一句话总结

本文提出一种多任务学习方法,将语言资源——特别是词性(POS)标签和命名实体——整合到端到端神经机器翻译(NMT)模型中。通过使用共享的编码器-解码器架构,联合训练NMT与POS标注和命名实体识别任务,该方法在翻译质量上最高提升1.5 BLEU分数,POS标注性能相对提升30–50%,尤其在低资源条件下表现更优。

ABSTRACT

Linguistic resources such as part-of-speech (POS) tags have been extensively used in statistical machine translation (SMT) frameworks and have yielded better performances. However, usage of such linguistic annotations in neural machine translation (NMT) systems has been left under-explored. In this work, we show that multi-task learning is a successful and a easy approach to introduce an additional knowledge into an end-to-end neural attentional model. By jointly training several natural language processing (NLP) tasks in one system, we are able to leverage common information and improve the performance of the individual task. We analyze the impact of three design decisions in multi-task learning: the tasks used in training, the training schedule, and the degree of parameter sharing across the tasks, which is defined by the network architecture. The experiments are conducted for an German to English translation task. As additional linguistic resources, we exploit POS information and named-entities (NE). Experiments show that the translation quality can be improved by up to 1.5 BLEU points under the low-resource condition. The performance of the POS tagger is also improved using the multi-task learning scheme.

研究动机与目标

  • 探究诸如POS标签和命名实体等语言资源是否能够提升神经机器翻译性能。
  • 探索多任务学习作为一种将外部语言知识整合到端到端NMT模型中的方法。
  • 评估设计选择(任务设置、训练调度、参数共享)对翻译性能和辅助任务性能的影响。
  • 确定在低资源条件下,较小的、领域不匹配的语言资源语料是否仍能提升NMT性能。

提出的方法

  • 采用基于注意力机制的序列到序列模型,使用共享编码器同时处理机器翻译和辅助NLP任务(POS标注、命名实体识别)。
  • 在平行的单语数据和来自不同领域(如TED演讲)的标注语言资源数据(POS、命名实体)上联合训练模型。
  • 采用多任务训练调度,同时反向传播所有任务的梯度,并支持可调节的损失加权。
  • 探索三种模型架构:完全参数共享、仅共享编码器、独立编码器,以评估参数共享的影响。
  • 在编码器中使用词嵌入和双向RNN,以捕捉上下文和句子结构信息。
  • 使用束搜索解码,翻译任务共享解码器头,而POS和命名实体预测任务使用特定输出头。

实验结果

研究问题

  • RQ1通过多任务学习整合POS和命名实体标注,能否提升神经机器翻译性能?
  • RQ2辅助任务的选择(POS标注、命名实体识别)如何影响翻译质量和模型泛化能力?
  • RQ3在多任务NMT框架中,平衡多任务性能的最优训练调度是什么?
  • RQ4任务间参数共享的程度如何影响翻译性能和辅助任务性能?

主要发现

  • 多任务学习使德语到英语的翻译性能最高提升1.5 BLEU分数和2 CharacTER分数,尤其在低资源条件下表现更优。
  • 尽管训练数据有限且领域不匹配,联合训练使POS标注器性能相对提升了30–50%。
  • 训练调度对最终性能影响最大,采用课程学习调度的训练策略效果最佳。
  • 仅在编码器层面共享参数的模型在翻译和POS标注任务上均取得最佳性能,表明在编码器层级进行共享表征学习最为有效。
  • 即使使用较小的、非平行的语言资源语料(如TED演讲),整合POS和命名实体仍显著提升了翻译质量。
  • 该模型在处理命名实体和罕见词方面表现更优,减少了诸如遗漏或错误复制姓名等翻译错误。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。