Skip to main content
QUICK REVIEW

[论文解读] Multi-Source Neural Machine Translation with Data Augmentation

Yuta Nishimura, Katsuhito Sudoh|arXiv (Cornell University)|Oct 16, 2018
Natural Language Processing Techniques参考文献 6被引用 14
一句话总结

本文提出了一种多源神经机器翻译(NMT)的数据增强方法,通过使用训练好的多源NMT模型生成的伪翻译来填补多语言语料库中缺失的翻译。与用 <NULL> 标记替换缺失数据的基线方法相比,该方法显著提升了翻译性能——最高提升2 BLEU分,尤其在源语言和目标语言相似时效果更明显。

ABSTRACT

Multi-source translation systems translate from multiple languages to a single target language. By using information from these multiple sources, these systems achieve large gains in accuracy. To train these systems, it is necessary to have corpora with parallel text in multiple sources and the target language. However, these corpora are rarely complete in practice due to the difficulty of providing human translations in all of the relevant languages. In this paper, we propose a data augmentation approach to fill such incomplete parts using multi-source neural machine translation (NMT). In our experiments, results varied over different language combinations but significant gains were observed when using a source language similar to the target language.

研究动机与目标

  • 为解决多源NMT中多语言平行语料库不完整的问题,即某些源语言缺乏人工标注的翻译。
  • 通过利用机器生成的伪翻译填补缺失数据,而非使用 <NULL> 标记,以提升翻译准确性。
  • 探究通过多源NMT进行数据增强是否能在低资源多语言翻译设置下超越现有方法。
  • 评估不同增强策略——'填充'、'填充并替换'、以及'填充并添加'——在多种语言对上的有效性。
  • 探索通过优化伪翻译进行迭代训练,以进一步提升模型性能。

提出的方法

  • 该方法使用预训练的多源NMT模型生成缺失源句的伪翻译,并将 <NULL> 标记替换为机器生成的翻译。
  • 提出三种增强策略:'填充'(仅填补缺失部分)、'填充并替换'(用伪翻译替换原始目标)、以及'填充并添加'(将伪翻译作为额外源添加)。
  • 该方法采用多编码器NMT架构并结合全局注意力机制,将多个源语言的编码器状态拼接后投影为解码器的初始隐藏状态和细胞状态。
  • 伪翻译通过在英语与每种目标语言之间训练的一对一NMT模型生成,随后用于增强多源NMT的训练数据。
  • 该方法在存在缺失翻译的多语言语料库上进行评估,尤其在TED演讲字幕中,由于依赖志愿者贡献,翻译常不完整。
  • 探索了迭代训练,即在反馈循环中使用更新后的伪翻译重新训练多源NMT模型。

实验结果

研究问题

  • RQ1能否通过多源NMT生成的伪翻译进行数据增强,来提升不完整多语言语料库上的翻译性能?
  • RQ2不同增强策略——'填充'、'填充并替换'、以及'填充并添加'——在不同语言对上的翻译准确性有何影响?
  • RQ3用于生成伪翻译的一对一NMT模型的质量是否会影响该增强方法的有效性?
  • RQ4通过多轮训练迭代优化伪翻译,能否进一步提升模型性能?
  • RQ5多语言语料库中非平行性(如某一语言缺失短语)在多大程度上影响翻译质量?该增强方法能否缓解此类不一致性?

主要发现

  • 所提出的增强方法相较于 <NULL> 基线方法,最高可提升2 BLEU分,尤其在源语言与目标语言相似的语言对中表现显著。
  • '填充并添加'策略在英语-越南语和英语-印度尼西亚语对中取得了最高的BLEU分数,可能是因为这些语料库中缺失数据率较低。
  • 如 '填充并替换' 和 '填充并添加' 等激进策略在克罗地亚语、塞尔维亚语、斯洛伐克语和捷克语对中导致BLEU分显著下降,表明噪声伪翻译会降低性能。
  • 使用更新后的伪翻译进行迭代训练导致BLEU分数逐渐下降,表明噪声累积超过了潜在收益。
  • 多语言语料库中的非平行性问题(如某一语言缺失短语)可通过伪翻译得到缓解,如在塞尔维亚语示例中,'Dozvolite mi' 被添加以补偿缺失内容。
  • 当用于增强的源语言与目标语言在语言上较接近时,该方法效果最佳,如在相似语言对中观察到的显著性能提升所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。