Skip to main content
QUICK REVIEW

[论文解读] Rapid Adaptation of Neural Machine Translation to New Languages

Graham Neubig, Junjie Hu|arXiv (Cornell University)|Aug 13, 2018
Natural Language Processing Techniques参考文献 25被引用 14
一句话总结

本文提出一种针对低资源语言(LRLs)的神经机器翻译(NMT)快速适应方法,通过在目标LRL数据上微调一个预训练的、大规模多语言的‘种子模型’,同时利用高资源、语言类型相近的语言应用‘相似语言正则化’(SLR)。该方法在先前的适应技术基础上平均提升了1.7 BLEU分数,并在没有任何目标语言数据的情况下实现了非平凡的零样本翻译(最高达15.5 BLEU)。

ABSTRACT

This paper examines the problem of adapting neural machine translation systems to new, low-resourced languages (LRLs) as effectively and rapidly as possible. We propose methods based on starting with massively multilingual "seed models", which can be trained ahead-of-time, and then continuing training on data related to the LRL. We contrast a number of strategies, leading to a novel, simple, yet effective method of "similar-language regularization", where we jointly train on both a LRL of interest and a similar high-resourced language to prevent over-fitting to small LRL data. Experiments demonstrate that massively multilingual models, even without any explicit adaptation, are surprisingly effective, achieving BLEU scores of up to 15.5 with no data from the LRL, and that the proposed similar-language regularization method improves over other adaptation methods by 1.7 BLEU points average over 4 LRL settings. Code to reproduce experiments at https://github.com/neubig/rapid-adaptation

研究动机与目标

  • 解决危机情境下低资源语言(LRLs)对快速、准确机器翻译的迫切需求。
  • 在保持高翻译质量的同时,缩短新语言对的训练时间。
  • 探索利用多语言预训练与跨语言迁移的有效适应策略。
  • 评估在低资源环境下训练速度与翻译准确率之间的权衡。

提出的方法

  • 在目标低资源语言对上微调一个预训练的、大规模多语言NMT模型(在58种语言上训练)。
  • 引入‘相似语言正则化’(SLR),即模型同时在目标LRL和一个高资源、语言类型相近的语言上进行联合训练,以防止在小规模LRL数据上过拟合。
  • 比较不同的适应策略:仅在LRL上直接微调、使用SLR的微调,以及数据拼接与均衡采样。
  • 使用一个通用种子模型作为所有适应实验的起点,实现快速部署。
  • 通过在多个LRL上的开发集上计算BLEU分数来评估性能,涵盖零样本(无目标数据)和少样本(有限目标数据)场景。
  • 使用不同数据密度进行训练,并监控收敛速度以评估效率。

实验结果

研究问题

  • RQ1一个单一的、预训练的多语言模型是否能在没有任何目标语言训练数据的情况下,对新低资源语言实现非平凡的翻译性能?
  • RQ2与从零开始训练相比,在新低资源语言上微调一个通用多语言模型是否能提高翻译准确率?
  • RQ3当目标语言仅有有限并行数据时,相似语言正则化(SLR)在提升适应性能方面的有效性如何?
  • RQ4在适应新语言时,训练速度与最终翻译准确率之间的权衡是什么?

主要发现

  • 一个预训练的、大规模多语言NMT模型在无目标语言训练数据的情况下,对加利西亚语-英语语言对实现了高达15.5的BLEU分数,证明了其强大的零样本泛化能力。
  • 所提出的相似语言正则化(SLR)方法在四个低资源语言设置中,相比仅在目标语言上直接微调,平均提升了1.7个BLEU分数。
  • 从通用多语言种子模型进行适应,优于从单源或双源模型从零开始训练,即使在无目标数据的冷启动场景下也是如此。
  • 在冷启动和热启动设置中,语料拼接均优于均衡采样,表明来自相似语言的数据密度有助于提升适应效果。
  • 所有适配模型的收敛速度均快于从零开始训练的双源模型,证实了从种子模型微调可实现快速系统部署。
  • 无监督NMT方法在所测试的LRL中完全失败,BLEU分数接近零,原因是低资源语言缺乏高质量的单语数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。