Skip to main content
QUICK REVIEW

[论文解读] Neural Machine Translation for Bilingually Scarce Scenarios: A Deep Multi-task Learning Approach

Poorya Zaremoodi, Gholamreza Haffari|arXiv (Cornell University)|May 11, 2018
Natural Language Processing Techniques被引用 4
一句话总结

本文提出一种深度多任务学习框架,通过在英语到目标语言的翻译任务之外联合训练语义解析、句法解析和命名实体识别等辅助任务,利用共享的深层堆叠编码器和解码器,显著提升了在双语资源稀缺场景下的神经机器翻译(NMT)性能。该方法通过参数共享和对抗性训练注入语言知识,有效保留共享表征,在英语到法语、英语到波斯语以及英语到越南语的翻译任务中,尤其在平行数据有限的情况下,显著提升了翻译质量。

ABSTRACT

Neural machine translation requires large amounts of parallel training text to learn a reasonable-quality translation model. This is particularly inconvenient for language pairs for which enough parallel text is not available. In this paper, we use monolingual linguistic resources in the source side to address this challenging problem based on a multi-task learning approach. More specifically, we scaffold the machine translation task on auxiliary tasks including semantic parsing, syntactic parsing, and named-entity recognition. This effectively injects semantic and/or syntactic knowledge into the translation model, which would otherwise require a large amount of training bitext. We empirically evaluate and show the effectiveness of our multi-task learning approach on three translation tasks: English-to-French, English-to-Farsi, and English-to-Vietnamese.

研究动机与目标

  • 解决在平行单语数据有限的双语稀缺语言对中,神经机器翻译性能不佳的挑战。
  • 探究经过筛选的单语语言资源(句法、语义、命名实体)在无需大规模平行双语语料的情况下,如何增强神经机器翻译性能。
  • 设计一种深层多任务学习架构,通过跨任务共享参数,将结构化和语义知识注入翻译模型。
  • 通过辅助任务作为归纳偏置,提升低资源设置下的泛化能力和翻译质量。
  • 通过多任务框架中的对抗性训练,防止特定任务的噪声污染共享表征。

提出的方法

  • 采用深层堆叠的编码器-解码器架构,其中编码器和解码器的顶层在主翻译任务与三个辅助任务(语义解析、句法解析、命名实体识别)之间共享。
  • 将所有任务建模为序列到序列(Seq2Seq)转换问题,从而实现在主NMT模型与辅助模型之间的参数共享。
  • 在共享的编码器和解码器组件之间实施参数共享,以实现辅助任务向翻译任务的知识迁移。
  • 在共享表征空间应用对抗性训练,以最小化特定任务特征对通用知识的污染。
  • 使用注意力机制的编码器-解码器网络端到端训练模型,编码器采用双向RNN,解码器采用单向RNN。
  • 为源语言和目标语言分别使用独立的词嵌入表,注意力机制动态对齐源端表征与目标端生成。

实验结果

研究问题

  • RQ1在低资源、双语稀缺的设置下,辅助语言学任务(句法解析、语义解析、NER)能否提升神经机器翻译的质量?
  • RQ2在堆叠的编码器和解码器之间深度共享参数,如何影响多任务NMT中的知识迁移与翻译性能?
  • RQ3对抗性训练是否能有效防止多任务NMT中特定任务噪声对共享表征的污染?
  • RQ4在源端单语语言资源的辅助下,能在多大程度上弥补神经机器翻译中平行训练数据的缺失?
  • RQ5与现有多任务学习方法相比,该方法在不同语言对上的翻译质量与鲁棒性如何?

主要发现

  • 所提出的多任务学习方法在英语到法语、英语到波斯语以及英语到越南语的翻译任务中,即使在平行数据有限的情况下,也显著提升了BLEU分数。
  • 将语义解析、句法解析和命名实体识别作为辅助任务,相比标准NMT基线模型,能实现更好的泛化能力与更高品质的翻译输出。
  • 采用部分参数共享的深层堆叠编码器与解码器架构,优于浅层结构与完全共享结构,表明模型架构设计对有效知识迁移至关重要。
  • 对抗性训练能有效减少特定任务特征对共享表征的污染,从而保持通用知识的质量。
  • 该方法在与英语差异程度各异的语言对中均表现出强有效性,显示出在低资源设置下的鲁棒性。
  • 实证结果证实,通过多任务学习注入语言知识,能显著提升在平行数据稀缺场景下的翻译性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。