Skip to main content
QUICK REVIEW

[论文解读] Domain Adaptation of Neural Machine Translation by Lexicon Induction

Junjie Hu, Mengzhou Xia|arXiv (Cornell University)|Jun 2, 2019
Natural Language Processing Techniques参考文献 34被引用 7
一句话总结

本文提出领域自适应词典归纳(Domain Adaptation by Lexicon Induction, DALI),一种无监督方法,通过从单语领域内数据中归纳领域特定词典,并利用逐词回译构建伪双语语料,从而提升神经机器翻译(NMT)在域外设置下的性能。该方法在未微调模型上实现最高14 BLEU的提升,且在强基线回译方法上实现最高2 BLEU的超越,且无需使用任何领域内双语句对。

ABSTRACT

It has been previously noted that neural machine translation (NMT) is very sensitive to domain shift. In this paper, we argue that this is a dual effect of the highly lexicalized nature of NMT, resulting in failure for sentences with large numbers of unknown words, and lack of supervision for domain-specific words. To remedy this problem, we propose an unsupervised adaptation method which fine-tunes a pre-trained out-of-domain NMT model using a pseudo-in-domain corpus. Specifically, we perform lexicon induction to extract an in-domain lexicon, and construct a pseudo-parallel in-domain corpus by performing word-for-word back-translation of monolingual in-domain target sentences. In five domains over twenty pairwise adaptation settings and two model architectures, our method achieves consistent improvements without using any in-domain parallel sentences, improving up to 14 BLEU over unadapted models, and up to 2 BLEU over strong back-translation baselines.

研究动机与目标

  • 解决神经机器翻译中的领域分布偏移问题,特别是新领域中未登录词(OOV)无法翻译的问题。
  • 克服现有基于无监督数据的自适应方法的局限性,这些方法缺乏对领域特定未登录词的直接监督。
  • 开发一种利用单语领域内数据改进未登录词翻译的方法,且无需使用领域内双语句对。
  • 证明对领域内未登录词的显式监督对于NMT中有效领域自适应至关重要。
  • 提供一种与模型无关、基于数据的方法,可与现有以流畅性为导向的方法(如回译)互补。

提出的方法

  • 使用有监督或无监督方法进行词典归纳,将源语言嵌入映射到目标语言空间,通过最近邻搜索实现对未见领域内词的翻译。
  • 利用来自域外双语句对的种子词典和词对齐,通过正交性约束训练有监督的嵌入映射函数。
  • 对于无监督词典归纳,采用对抗训练和迭代优化,学习跨语言词嵌入对齐,而无需双语监督。
  • 通过逐词回译构建伪双语领域内语料:使用归纳出的词典将领域内目标语言单语句翻译回源语言。
  • 在生成的伪双语领域内数据上微调预训练的域外NMT模型,使其适应新领域。
  • 将所提方法与标准回译结合,进一步提升性能,表明在流畅性与OOV翻译方面具有互补增益。

实验结果

研究问题

  • RQ1无监督词典归纳是否能在不使用任何领域内双语数据的情况下,有效提升NMT在领域内OOV词上的性能?
  • RQ2在跨领域NMT中,该方法相较于强基线回译方法在BLEU分数提升方面表现如何?
  • RQ3该方法在多大程度上与回译互补,从而提升翻译质量?
  • RQ4该方法在不同领域及不同NMT架构(如RNN与Transformer)中是否表现出一致的性能提升?
  • RQ5该方法带来的性能提升是否主要源于对OOV词的更好处理,而非一般性流畅性增强?

主要发现

  • 所提出的DALI方法在基于词典归纳回译构建的伪双语领域内语料上微调后,相较于未自适应的NMT模型,最高可实现14 BLEU的性能提升。
  • 在五个领域(医学、IT、法律、字幕、古兰经)的20组配对领域自适应设置中,该方法在不使用任何领域内双语句对的情况下,始终显著提升翻译性能。
  • 当与回译结合时,该方法带来额外4 BLEU的增益,表明其在OOV翻译与流畅性方面均具有互补性提升。
  • 该方法显著改善了领域内OOV词的翻译,而回译主要提升了源端句子的流畅性,表明二者具有正交性优势。
  • DALI的性能增益在翻译领域特定未登录词方面最为显著,证实对这些词的显式监督对领域自适应至关重要。
  • 该方法在基于RNN和Transformer的NMT架构上均表现出一致的性能提升,证明其泛化能力与模型无关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。