Skip to main content
QUICK REVIEW

[论文解读] Low-Resource Machine Translation Training Curriculum Fit for Low-Resource Languages

Garry Kuwanto, Afra Feyza Akyürek|arXiv (Cornell University)|Mar 24, 2021
Natural Language Processing Techniques被引用 5
一句话总结

本文提出了一种低计算量、弱监督的训练课程,用于低资源神经机器翻译(NMT),利用可比的维基百科数据和代码切换进行预训练,即使在平行数据极少的情况下也能显著提升性能。在相同计算资源约束下,该方法在英语→古吉拉特语翻译中比监督NMT提升+12.2 BLEU,在英语→哈萨克语翻译中提升+3.7 BLEU,并在使用监督数据的情况下,于索马里语→英语翻译任务中达到29.3的新SOTA BLEU分数。

ABSTRACT

We conduct an empirical study of neural machine translation (NMT) for truly low-resource languages, and propose a training curriculum fit for cases when both parallel training data and compute resource are lacking, reflecting the reality of most of the world's languages and the researchers working on these languages. Previously, unsupervised NMT, which employs back-translation (BT) and auto-encoding (AE) tasks has been shown barren for low-resource languages. We demonstrate that leveraging comparable data and code-switching as weak supervision, combined with BT and AE objectives, result in remarkable improvements for low-resource languages even when using only modest compute resources. The training curriculum proposed in this work achieves BLEU scores that improve over supervised NMT trained on the same backbone architecture by +12.2 BLEU for English to Gujarati and +3.7 BLEU for English to Kazakh, showcasing the potential of weakly-supervised NMT for the low-resource languages. When trained on supervised data, our training curriculum achieves a new state-of-the-art result on the Somali dataset (BLEU of 29.3 for Somali to English). We also observe that adding more time and GPUs to training can further improve performance, which underscores the importance of reporting compute resource usage in MT research.

研究动机与目标

  • 为真正低资源语言在平行数据和计算资源均有限的情况下,解决有效NMT的差距问题。
  • 开发一种在低资源语言社区研究者实际面临约束条件下仍有效的训练课程。
  • 在不依赖高资源相关语言或大规模预训练的前提下,提升无监督和弱监督NMT的性能。
  • 证明可比单语数据和代码切换可作为低资源NMT的有效弱监督信号。
  • 强调NMT研究中计算资源使用影响的被低估程度,倡导透明化报告。

提出的方法

  • 使用Panlex词典在多语言维基百科中挖掘目标语言与英语之间的词汇重叠,以提取可比句子对。
  • 通过同一词典将新闻文章翻译为目标语言,生成代码切换的单语数据,以增强双语语言模型的预训练。
  • 设计多阶段训练课程,按顺序整合回译、自编码和可比数据训练目标。
  • 采用标准的Transformer架构NMT模型,仅使用极低计算量(1块32GB GPU),模拟低资源研究者的真实计算限制。
  • 采用一种课程策略,优先在代码切换数据上进行预训练,随后在弱监督的可比数据上微调,最后在任何可用的平行数据上进行微调。
  • 使用标准测试集上的BLEU分数评估性能,并通过消融研究分离各组件的贡献。

实验结果

研究问题

  • RQ1在低计算量设置下,通过词汇重叠从可比维基百科中挖掘的数据能否显著提升低资源NMT性能?
  • RQ2在预训练阶段引入代码切换是否能增强低资源语言弱监督NMT的有效性?
  • RQ3当两者使用相同主干网络和计算预算时,所提出的课程与监督NMT相比性能如何?
  • RQ4语言距离(如文字系统、词形变化、句法结构)在多大程度上影响该课程带来的性能增益?
  • RQ5计算时间延长和GPU使用量增加对性能的提升有多大?为何这一影响在NMT研究中常被低估?

主要发现

  • 在相同模型和计算设置下,所提出的课程在英语→古吉拉特语翻译中比监督NMT提升+12.2 BLEU,在英语→哈萨克语翻译中提升+3.7 BLEU。
  • 在索马里语→英语任务中,该课程在使用监督数据训练时达到29.3的新SOTA BLEU分数,优于先前方法。
  • 仅使用可比维基百科数据,弱监督NMT在哈萨克语上的性能即提升4.6至6.2 BLEU,尽管其词形复杂度较高。
  • 代码切换预训练在消融研究中对所有三种语言的性能均有显著贡献。
  • 延长训练时间并使用更多GPU可带来额外6.8 BLEU的增益,凸显了计算资源在NMT研究中被低估的影响。
  • 语言距离(通过句法向量、字符重叠和类型学特征衡量)与性能相关,尽管课程带来了增益,但语言距离最远的哈萨克语仍表现出最低得分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。