Skip to main content
QUICK REVIEW

[论文解读] Low-Resource Neural Machine Translation for Southern African Languages

Evander Nyoni, Bruce A. Bassett|arXiv (Cornell University)|Apr 1, 2021
Natural Language Processing Techniques参考文献 24被引用 9
一句话总结

本文提出多语言神经机器翻译(NMT)以通过利用相关班图语言间的共享表征,提升低资源英语到isiZulu翻译性能。通过联合训练英语到isiXhosa和英语到isiZulu的数据,该方法在基线模型基础上实现9.9 BLEU点的提升,达到18.6的新SOTA分数,显著优于迁移学习和零样本学习。

ABSTRACT

Low-resource African languages have not fully benefited from the progress in neural machine translation because of a lack of data. Motivated by this challenge we compare zero-shot learning, transfer learning and multilingual learning on three Bantu languages (Shona, isiXhosa and isiZulu) and English. Our main target is English-to-isiZulu translation for which we have just 30,000 sentence pairs, 28% of the average size of our other corpora. We show the importance of language similarity on the performance of English-to-isiZulu transfer learning based on English-to-isiXhosa and English-to-Shona parent models whose BLEU scores differ by 5.2. We then demonstrate that multilingual learning surpasses both transfer learning and zero-shot learning on our dataset, with BLEU score improvements relative to the baseline English-to-isiZulu model of 9.9, 6.1 and 2.0 respectively. Our best model also improves the previous SOTA BLEU score by more than 10.

研究动机与目标

  • 解决南非南部语言中低资源神经机器翻译(NMT)的挑战,特别是仅拥有30,000组平行语句对的isiZulu语言。
  • 研究零样本学习、迁移学习和多语言学习在班图语言低资源NMT设置下的有效性。
  • 评估语言相似性——尤其是Nguni语系内部——对翻译性能的影响。
  • 通过数据高效技术提升英语到isiZulu翻译的当前最先进(SOTA)BLEU分数。

提出的方法

  • 联合训练基于Transformer的多语言NMT模型,使用英语到isiXhosa(E-X)和英语到isiZulu(E-Z)的平行语料库,以在语言间共享表征。
  • 通过在低资源英语到isiZulu任务上微调预训练的英语到isiXhosa模型,应用迁移学习。
  • 通过利用多语言模型实现零样本学习,无需在该语对上进行直接训练即可实现英语到isiZulu翻译。
  • 采用Transformer架构,结合多头自注意力机制和位置前馈网络,通过最大化目标序列的条件对数似然进行训练。
  • 应用知识蒸馏和共享嵌入层,以提升在低资源语言对之间的泛化能力。
  • 通过在保留的测试集上计算BLEU分数评估性能,统计显著性通过标准误估计进行评估。

实验结果

研究问题

  • RQ1多语言学习在提升英语到isiZulu翻译质量方面,相较于迁移学习和零样本学习表现如何?
  • RQ2语言相似性——特别是isiXhosa和isiZulu等Nguni语言之间——在多大程度上影响迁移学习性能?
  • RQ3当使用较远的父模型(如英语到Shona)时,英语到isiZulu的零样本翻译是否能超越迁移学习?
  • RQ4共享多语言表征对低资源语言对BLEU分数提升有何影响?
  • RQ5多语言训练在低资源设置下是否显著优于从相关语言模型微调?

主要发现

  • 多语言学习在英语到isiZulu翻译中达到18.6 ± 1.0的BLEU分数,相较于基线模型提升9.9 BLEU点。
  • 该多语言模型将先前SOTA BLEU分数提升超过10分,创下英语到isiZulu翻译的新SOTA记录。
  • 使用英语到isiXhosa模型进行迁移学习,相较基线模型提升6.1 BLEU点;而使用英语到Shona模型进行迁移学习仅提升0.9 BLEU点,凸显语言相似性的重要性。
  • 以isiXhosa(6.6)和Shona(0.9)作为父模型的迁移学习BLEU差异为5.2,证实语言亲缘关系对性能有显著影响。
  • 零样本学习在BLEU上优于从Shona模型迁移学习1.0分,表明在零样本场景中,远距离父模型可能比无关模型更有效。
  • 与最佳迁移学习模型(E-X父模型)相比,多语言模型在BLEU上领先3.8点;与E-S父模型相比领先9.0点,充分证明其在低资源设置下的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。