Skip to main content
QUICK REVIEW

[论文解读] Generalized Data Augmentation for Low-Resource Translation

Mengzhou Xia, Xiang Kong|arXiv (Cornell University)|Jun 10, 2019
Natural Language Processing Techniques参考文献 33被引用 8
一句话总结

本文提出了一种广义的数据增强框架,用于低资源神经机器翻译,通过利用高资源语言(HRL)作为桥梁。该方法采用两步流程:首先,通过从映射的词嵌入空间中生成的双语词典,将HRL中的词替换为低资源语言(LRL)对应词;然后,利用无监督机器翻译模型对输出结果进行优化。在四个低资源数据集上,该方法相较于有监督的回译基线模型,翻译性能提升了1.5至8 BLEU点。

ABSTRACT

Translation to or from low-resource languages LRLs poses challenges for machine translation in terms of both adequacy and fluency. Data augmentation utilizing large amounts of monolingual data is regarded as an effective way to alleviate these problems. In this paper, we propose a general framework for data augmentation in low-resource machine translation that not only uses target-side monolingual data, but also pivots through a related high-resource language HRL. Specifically, we experiment with a two-step pivoting method to convert high-resource data to the LRL, making use of available resources to better approximate the true data distribution of the LRL. First, we inject LRL words into HRL sentences through an induced bilingual dictionary. Second, we further edit these modified sentences using a modified unsupervised machine translation framework. Extensive experiments on four low-resource datasets show that under extreme low-resource settings, our data augmentation techniques improve translation quality by up to~1.5 to~8 BLEU points compared to supervised back-translation baselines

研究动机与目标

  • 为解决因并行训练数据不足而导致的低资源语言(LRL)翻译质量差的问题。
  • 通过利用相关高资源语言(HRL)的单语和并行数据,提升数据效率。
  • 开发一种广义的数据增强策略,结合基于词典的词替换与无监督机器翻译,以生成更优的LRL数据。
  • 通过同时利用英语单语数据和HRL-英语并行数据,在极端低资源设置下超越标准回译基线模型。

提出的方法

  • 利用从映射词嵌入空间中生成的双语词典,将LRL词汇注入HRL句子中。
  • 应用一种改进的无监督机器翻译(m-UMT)框架,对替换后的句子进行优化,使其在LRL中更具流畅性和自然性。
  • 同时使用英语单语数据和HRL-英语并行数据进行数据增强,实现双源数据扩展。
  • 实施双向和单向词典诱导方法,以评估词对选择对模型性能的影响。
  • 在原始LRL-英语数据和增强后的LRL-英语数据上联合训练翻译模型,以提升泛化能力。
  • 在极端低资源条件下,针对四个低资源语言对评估该框架。

实验结果

研究问题

  • RQ1通过高资源语言(HRL)作为桥梁,能否提升低资源机器翻译中的数据增强效果?
  • RQ2利用生成的双语词典进行逐词替换,在HRL数据上生成真实感强的LRL句子有多有效?
  • RQ3对词典替换后的句子应用无监督机器翻译,能在多大程度上提升生成的LRL数据质量?
  • RQ4结合来自英语单语数据和HRL-英语并行数据的增强,是否能带来比标准回译更大的性能提升?
  • RQ5在单向与双向词典诱导方法之间进行选择,对最终翻译性能有何影响?

主要发现

  • 所提出的两步桥梁法在极端低资源设置下,相较于有监督回译基线模型,翻译质量提升了1.5至8 BLEU点。
  • 双向词典诱导方法优于单向诱导,可能是因为减少了非互逆词对带来的噪声。
  • 同时从英语单语数据和HRL-英语并行数据进行增强,相比单源增强,额外提升了1.1 BLEU点。
  • 该方法通过将LRL词汇注入HRL句子,显著减轻了罕见词的影响,提升了模型鲁棒性。
  • 无监督优化步骤(m-UMT)相比原始替换,显著提升了生成LRL句子的流畅性和自然度。
  • 该框架在四个不同的低资源语言对上均表现出一致的性能提升,证明了其广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。