Skip to main content
QUICK REVIEW

[论文解读] Self-Training for Unsupervised Neural Machine Translation in Unbalanced Training Data Scenarios

Haipeng Sun, Rui Wang|arXiv (Cornell University)|Apr 9, 2020
Natural Language Processing Techniques参考文献 19被引用 4
一句话总结

本文提出自训练机制——ST-UT 和 ST-PT,用于在单语数据不平衡的场景下进行无监督神经机器翻译(UNMT),即一种语言的单语数据量显著少于另一种语言。通过利用回译生成的合成平行数据并迭代优化模型,所提方法在基线 UNMT 基础上将翻译性能提升 2–4 BLEU 分,尤其显著改善了低资源语言的翻译表现。

ABSTRACT

Unsupervised neural machine translation (UNMT) that relies solely on massive monolingual corpora has achieved remarkable results in several translation tasks. However, in real-world scenarios, massive monolingual corpora do not exist for some extremely low-resource languages such as Estonian, and UNMT systems usually perform poorly when there is not adequate training corpus for one language. In this paper, we first define and analyze the unbalanced training data scenario for UNMT. Based on this scenario, we propose UNMT self-training mechanisms to train a robust UNMT system and improve its performance in this case. Experimental results on several language pairs show that the proposed methods substantially outperform conventional UNMT systems.

研究动机与目标

  • 解决当一种语言的单语数据量显著少于另一种语言时,无监督神经机器翻译(UNMT)性能下降的问题,该场景被称为‘数据不平衡训练’。
  • 探究 UNMT 中模型过度拟合低资源语言而未能充分利用高资源语言大规模语料库的失败模式。
  • 开发自训练策略,有效利用高资源语言中丰富的单语数据,以提升低资源环境下的翻译质量。
  • 证明通过回译生成的合成平行数据可有效整合到 UNMT 训练中,从而增强模型的鲁棒性与性能。

提出的方法

  • 将数据不平衡训练场景定义为两种语言的单语数据量显著不同的设置,例如 5000 万句英文与 200 万句法文。
  • 提出 ST-UT(自训练与无监督训练):在下一轮训练中,将前一模型迭代生成的合成平行数据作为目标语仅数据使用。
  • 提出 ST-PT(自训练与伪监督训练):将合成平行数据同时作为源语和目标语用于训练目标,实现伪平行数据的更直接整合。
  • 将自训练机制集成到基于 Transformer 的 XLM 框架中,结合跨语言预训练与去噪自编码。
  • 使用回译损失进行模型训练:通过伪平行对最大化从目标语重建源语以及从源语重建目标语的期望对数似然。
  • 使用共享的 60,000 个子词 BPE 词汇表,并采用区分大小写的 4-gram BLEU 进行评估,覆盖多个语言对(En-Fr、En-Ro、En-Et)。

实验结果

研究问题

  • RQ1当一种语言的单语数据量相比另一种语言大幅减少时,UNMT 性能如何下降?
  • RQ2自训练机制能否有效利用高资源语言中的大规模单语语料库,以改善低资源语言的翻译表现?
  • RQ3将合成平行数据同时作为源语和目标语使用(ST-PT)是否优于仅作为目标语使用(ST-UT)?
  • RQ4自训练在多大程度上可缓解过拟合并改善数据不平衡 UNMT 场景下的收敛性?
  • RQ5与标准 UNMT 基线相比,所提方法在多种低资源语言对上的 BLEU 分数表现如何?

主要发现

  • 在数据不平衡设置下(例如 5000 万句英文 vs. 200 万句法文),UNMT 性能相比平衡的 5000 万/5000 万数据下降 4–5 BLEU 分,表明大型单语语料库未被有效利用。
  • ST-PT 策略平均优于 ST-UT 1 BLEU 分,证明合成数据的双重使用可增强模型学习能力。
  • 所提自训练机制在 En-Fr、En-Ro 和 En-Et 语言对上,将基线 UNMT 性能提升 2–4 BLEU 分。
  • 在仅提供 200 万句法文单语句子的 En-Fr 语对上,ST-PT 达到 31.84 的 BLEU 分数,显著优于基线的 30.91。
  • 案例研究显示,ST-PT 提升了流畅性与准确性:例如,将 'tööd ma ei karda' 正确翻译为 'I’m not afraid of work',而非 'work I’m not afraid of'。
  • 使用自训练后,模型在低资源语言上的收敛性更好,且能有效避免过拟合,尤其在 ST-PT 设置下,得益于对合成数据的更有效利用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。