Skip to main content
QUICK REVIEW

[论文解读] Incorporating Bilingual Dictionaries for Low Resource Semi-Supervised Neural Machine Translation

Sreyashi Nag, Mihir Kale|arXiv (Cornell University)|Apr 5, 2020
Natural Language Processing Techniques参考文献 12被引用 8
一句话总结

本文提出了一种用于低资源半监督神经机器翻译的Word-on-Word(WoW)数据增强方法,通过利用高质量双语词典,从目标语单语数据中生成合成的源语句子。该方法显著提升了翻译性能——在de-en上达到13.31 BLEU,在es-en上达到13.79 BLEU——通过扩展词汇量并保留跨语言相关性,优于回译和基于复制的方法,尤其在低资源和分布外设置下表现更优。

ABSTRACT

We explore ways of incorporating bilingual dictionaries to enable semi-supervised neural machine translation. Conventional back-translation methods have shown success in leveraging target side monolingual data. However, since the quality of back-translation models is tied to the size of the available parallel corpora, this could adversely impact the synthetically generated sentences in a low resource setting. We propose a simple data augmentation technique to address both this shortcoming. We incorporate widely available bilingual dictionaries that yield word-by-word translations to generate synthetic sentences. This automatically expands the vocabulary of the model while maintaining high quality content. Our method shows an appreciable improvement in performance over strong baselines.

研究动机与目标

  • 为解决回译和基于复制的方法在低资源NMT中的局限性,特别是由于平行数据有限和未登录词(OOV)导致的性能不佳问题。
  • 通过整合广泛可用的双语词典,提升低资源设置下模型的鲁棒性和词汇覆盖范围。
  • 通过基于词典的翻译保留跨语言结构,实现利用不同领域单语数据进行有效的领域自适应。
  • 证明在平行数据稀缺时,基于词典的增强方法优于回译。
  • 探索WoW与其他增强技术(如COPY和回译)之间的协同效应。

提出的方法

  • WoW方法利用双语词典对目标语单语句子进行逐词翻译,转换为源语,生成合成的平行训练样本。
  • 将合成的源语句子与真实平行数据结合,用于训练神经机器翻译模型,从而增强词汇覆盖范围和跨语言对齐。
  • 该方法使用预先存在的高质量双语词典(例如Facebook的MUSE)以确保词级别翻译的准确性。
  • 该方法兼容标准NMT架构,采用基于注意力的编码器-解码器结构,使用束搜索解码和Adam优化。
  • 该技术在多种设置下进行评估:领域内、领域外,以及与其他增强策略(如COPY和回译)结合使用。
  • 单语数据以不同比例(1:1、1:2、1:4)使用,以评估可扩展性及随着数据量增加带来的性能提升。

实验结果

研究问题

  • RQ1与传统的回译相比,使用双语词典进行逐词翻译是否能提升低资源神经机器翻译的性能?
  • RQ2WoW是否能通过扩展源语和目标语词汇量,有效缓解低资源设置下的未登录词(OOV)问题?
  • RQ3当使用分布外的单语数据(如新闻领域)进行增强时,WoW的性能如何,特别是在领域自适应场景下?
  • RQ4WoW能否与COPY或回译等其他数据增强技术有效结合,以进一步提升性能?
  • RQ5在低资源设置下,WoW生成的合成数据质量是否优于低质量回译模型?

主要发现

  • 当使用10k条真实平行句并用10k条来自双语词典的合成句进行增强时,WoW在de-en上达到12.03 BLEU,在es-en上达到12.34 BLEU,优于回译(+10k BT:10.86和11.47 BLEU)和COPY(+10k COPY:11.24和11.49 BLEU)。
  • 将单语数据从10k增加到40k条合成句,使de-en的性能提升3.8 BLEU点,es-en提升4.3 BLEU点,超过增加10k条高质量平行句带来的增益(13.01和13.46 BLEU)。
  • 使用分布外单语数据(如新闻领域)进行增强时,性能与使用领域内平行数据相当:40k条分布外WoW在de-en上达到4.85 BLEU,在es-en上达到7.51 BLEU,与10k条领域内平行数据(9.46 BLEU)性能匹配。
  • 在领域自适应场景中,使用目标领域单语数据(如新闻)训练的WoW模型显著优于仅使用源领域数据(如TED Talks)训练的模型,展现出强大的领域泛化能力。
  • 将WoW与COPY结合使用的效果优于单独使用20k条WoW数据——es-en上达到13.03 BLEU,而单独使用20k条WoW仅达12.96 BLEU,表明两种方法具有互补优势。
  • 将WoW与回译结合使用导致性能下降(de-en上为11.46 BLEU),表明低质量回译模型无法提供互补增益,反而可能损害性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。