Skip to main content
QUICK REVIEW

[论文解读] Predicting Target Language CCG Supertags Improves Neural Machine Translation

Maria Nădejde, Siva Reddy|arXiv (Cornell University)|Feb 3, 2017
Natural Language Processing Techniques参考文献 27被引用 4
一句话总结

本文提出在神经机器翻译(NMT)模型解码器中将CCG超标签与目标词交错排列,以显式建模目标语言语法。通过紧密耦合词与语法,该方法在德语→英语翻译中提升0.9 BLEU,在罗马尼亚语→英语翻译中提升1.2 BLEU,优于多任务训练,并在复杂句法现象(如介词短语依附)上表现出一致增益。

ABSTRACT

Neural machine translation (NMT) models are able to partially learn syntactic information from sequential lexical information. Still, some complex syntactic phenomena such as prepositional phrase attachment are poorly modeled. This work aims to answer two questions: 1) Does explicitly modeling target language syntax help NMT? 2) Is tight integration of words and syntax better than multitask training? We introduce syntactic information in the form of CCG supertags in the decoder, by interleaving the target supertags with the word sequence. Our results on WMT data show that explicitly modeling target-syntax improves machine translation quality for German->English, a high-resource pair, and for Romanian->English, a low-resource pair and also several syntactic phenomena including prepositional phrase attachment. Furthermore, a tight coupling of words and syntax improves translation quality more than multitask training. By combining target-syntax with adding source-side dependency labels in the embedding layer, we obtain a total improvement of 0.9 BLEU for German->English and 1.2 BLEU for Romanian->English.

研究动机与目标

  • 探究显式建模目标语言语法是否能提升神经机器翻译质量。
  • 比较通过交错排列实现的词与语法紧密耦合,与通过多任务训练实现的松散耦合的优劣。
  • 评估源端与目标端句法特征在NMT中的互补性。
  • 分析目标语法对各类句法现象和句子长度的影响。
  • 证明CCG超标签可被NMT模型有效预测,从而实现端到端的句法感知翻译。

提出的方法

  • 通过在序列中将CCG超标签与目标词交错排列,将CCG超标签——即编码了子分类、依附关系和词形变化的句法类别——引入解码器。
  • 训练一个序列到序列的NMT模型,以紧密耦合的方式联合预测目标词及其对应的CCG超标签。
  • 构建一个多任务基线模型,其中模型共享编码器和解码器组件,但分别对词翻译和超标签预测进行独立训练。
  • 将所提出的目标语法方法与Sennrich和Haddow(2016)的源端语言特征框架相结合,在嵌入层中整合依存标签和词性标注。
  • 使用CCGBank对CCG超标签进行标注,并评估超标签预测准确率,以验证模型对句法的理解能力。
  • 在WMT数据集上评估德语→英语和罗马尼亚语→英语的性能,测量BLEU分数,并分析在句子长度和句法现象上的增益。

实验结果

研究问题

  • RQ1显式建模目标语言语法是否能提升神经机器翻译质量?
  • RQ2通过交错排列实现的词与语法的紧密耦合,是否比通过多任务训练实现的松散耦合更有效?
  • RQ3目标语法整合对低资源和高资源语言对的翻译质量有何影响?
  • RQ4源端与目标端句法特征在NMT中互补性的程度如何?
  • RQ5目标语法的整合是否能提升特定句法现象(如介词短语依附和从句嵌入)的性能?

主要发现

  • 在解码器中将CCG超标签与目标词交错排列,使德语→英语翻译的BLEU提升0.9分,罗马尼亚语→英语翻译提升1.2分,优于基线NMT和多任务训练。
  • 通过交错排列实现的词与语法紧密耦合,带来的提升优于多任务训练中松散耦合的词与超标签预测方式。
  • 将目标语法与源端依存标签结合,带来的翻译质量提升超过单独使用任一信号,证明了其互补优势。
  • 提升效果在较长句子(超过35个词)中最为显著,特别是包含复杂句法结构(如从句和并列句)的句子。
  • 模型在CCG超标签预测上达到高准确率(德语→英语为95.6%,罗马尼亚语→英语为93.2%),表明其对句法信号的学习可靠。
  • 细粒度分析确认了在介词短语依附等句法现象上的一致增益,尤其在长句和结构复杂的句子中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。