[论文解读] Low-Resource Neural Machine Translation for Southern African Languages
本文提出多语言神经机器翻译(NMT)以通过利用相关班图语言间的共享表征,提升低资源英语到isiZulu翻译性能。通过联合训练英语到isiXhosa和英语到isiZulu的数据,该方法在基线模型基础上实现9.9 BLEU点的提升,达到18.6的新SOTA分数,显著优于迁移学习和零样本学习。
Low-resource African languages have not fully benefited from the progress in neural machine translation because of a lack of data. Motivated by this challenge we compare zero-shot learning, transfer learning and multilingual learning on three Bantu languages (Shona, isiXhosa and isiZulu) and English. Our main target is English-to-isiZulu translation for which we have just 30,000 sentence pairs, 28% of the average size of our other corpora. We show the importance of language similarity on the performance of English-to-isiZulu transfer learning based on English-to-isiXhosa and English-to-Shona parent models whose BLEU scores differ by 5.2. We then demonstrate that multilingual learning surpasses both transfer learning and zero-shot learning on our dataset, with BLEU score improvements relative to the baseline English-to-isiZulu model of 9.9, 6.1 and 2.0 respectively. Our best model also improves the previous SOTA BLEU score by more than 10.
研究动机与目标
- 解决南非南部语言中低资源神经机器翻译(NMT)的挑战,特别是仅拥有30,000组平行语句对的isiZulu语言。
- 研究零样本学习、迁移学习和多语言学习在班图语言低资源NMT设置下的有效性。
- 评估语言相似性——尤其是Nguni语系内部——对翻译性能的影响。
- 通过数据高效技术提升英语到isiZulu翻译的当前最先进(SOTA)BLEU分数。
提出的方法
- 联合训练基于Transformer的多语言NMT模型,使用英语到isiXhosa(E-X)和英语到isiZulu(E-Z)的平行语料库,以在语言间共享表征。
- 通过在低资源英语到isiZulu任务上微调预训练的英语到isiXhosa模型,应用迁移学习。
- 通过利用多语言模型实现零样本学习,无需在该语对上进行直接训练即可实现英语到isiZulu翻译。
- 采用Transformer架构,结合多头自注意力机制和位置前馈网络,通过最大化目标序列的条件对数似然进行训练。
- 应用知识蒸馏和共享嵌入层,以提升在低资源语言对之间的泛化能力。
- 通过在保留的测试集上计算BLEU分数评估性能,统计显著性通过标准误估计进行评估。
实验结果
研究问题
- RQ1多语言学习在提升英语到isiZulu翻译质量方面,相较于迁移学习和零样本学习表现如何?
- RQ2语言相似性——特别是isiXhosa和isiZulu等Nguni语言之间——在多大程度上影响迁移学习性能?
- RQ3当使用较远的父模型(如英语到Shona)时,英语到isiZulu的零样本翻译是否能超越迁移学习?
- RQ4共享多语言表征对低资源语言对BLEU分数提升有何影响?
- RQ5多语言训练在低资源设置下是否显著优于从相关语言模型微调?
主要发现
- 多语言学习在英语到isiZulu翻译中达到18.6 ± 1.0的BLEU分数,相较于基线模型提升9.9 BLEU点。
- 该多语言模型将先前SOTA BLEU分数提升超过10分,创下英语到isiZulu翻译的新SOTA记录。
- 使用英语到isiXhosa模型进行迁移学习,相较基线模型提升6.1 BLEU点;而使用英语到Shona模型进行迁移学习仅提升0.9 BLEU点,凸显语言相似性的重要性。
- 以isiXhosa(6.6)和Shona(0.9)作为父模型的迁移学习BLEU差异为5.2,证实语言亲缘关系对性能有显著影响。
- 零样本学习在BLEU上优于从Shona模型迁移学习1.0分,表明在零样本场景中,远距离父模型可能比无关模型更有效。
- 与最佳迁移学习模型(E-X父模型)相比,多语言模型在BLEU上领先3.8点;与E-S父模型相比领先9.0点,充分证明其在低资源设置下的优越性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。