Skip to main content
QUICK REVIEW

[论文解读] Application of Low-resource Machine Translation Techniques to Russian-Tatar Language Pair

Aidar Valeev, Ilshat Gibadullin|arXiv (Cornell University)|Oct 1, 2019
Natural Language Processing Techniques参考文献 13被引用 7
一句话总结

该论文将低资源神经机器翻译技术——特别是迁移学习、回译和浅层融合——应用于研究较少的俄语-鞑靼语语言对,使用仅32.4万句的平行语料。采用基于Transformer的模型,从相关哈萨克语-俄语对进行迁移学习取得了最佳效果,相较于基线模型,翻译质量分别提升了+2.89 BLEU(鞑靼语→俄语)和+2.57 BLEU(俄语→鞑靼语)。

ABSTRACT

Neural machine translation is the current state-of-the-art in machine translation. Although it is successful in a resource-rich setting, its applicability for low-resource language pairs is still debatable. In this paper, we explore the effect of different techniques to improve machine translation quality when a parallel corpus is as small as 324 000 sentences, taking as an example previously unexplored Russian-Tatar language pair. We apply such techniques as transfer learning and semi-supervised learning to the base Transformer model, and empirically show that the resulting models improve Russian to Tatar and Tatar to Russian translation quality by +2.57 and +3.66 BLEU, respectively.

研究动机与目标

  • 解决斯拉夫语与突厥语之间低资源神经机器翻译研究不足的问题,特别是俄语-鞑靼语语言对。
  • 在平行语料和单语语料均有限的情况下,提升俄语-鞑靼语翻译质量。
  • 评估在低资源环境下迁移学习、回译和语言模型融合的有效性。
  • 研究模型质量与回译效果之间的相互作用,特别是初始化质量的影响。

提出的方法

  • 在包含32.4万句俄语-鞑靼语句子对的小型平行语料上微调基于Transformer的神经机器翻译模型。
  • 通过使用相关哈萨克语-俄语语言对的预训练权重初始化模型,应用迁移学习,训练1或6个周期。
  • 通过使用初始神经机器翻译模型对单语鞑靼语和俄语语料进行生成,应用回译技术构建合成平行数据。
  • 使用浅层融合将预训练语言模型集成到神经机器翻译模型中,通过学习到的加权超参数结合神经机器翻译和语言模型的logits。
  • 在真实数据与合成数据的组合上训练最终模型,并通过仔细的验证避免过拟合。
  • 优化超参数,如浅层融合权重和合成数据与真实数据的比例,以提升泛化能力。

实验结果

研究问题

  • RQ1从相关低资源语言对(哈萨克语-俄语)迁移学习在提升俄语-鞑靼语翻译质量方面的效果如何?
  • RQ2回译是否在不同模型初始化阶段和不同翻译方向上均能持续提升性能?
  • RQ3在低资源环境下,通过预训练语言模型实现浅层融合是否能显著提升翻译质量?
  • RQ4初始模型的质量如何影响回译的有效性?
  • RQ5在低资源斯拉夫语-突厥语翻译中,最优的技术组合(迁移学习、回译、语言模型集成)是什么?

主要发现

  • 从1个周期的哈萨克语-俄语初始化开始进行迁移学习,使俄语→鞑靼语翻译质量提升+2.57 BLEU(区分大小写),鞑靼语→俄语提升+2.89 BLEU(不区分大小写)。
  • 将迁移学习扩展到6个周期进一步提升了结果,相较于基线模型,俄语→鞑靼语提升+2.89 BLEU(TT-RU),俄语→鞑靼语提升+2.57 BLEU(RU-TT)。
  • 回译仅在应用于质量较低的模型时才带来显著收益;当应用于6个周期初始化的模型时,其效果可忽略甚至出现负向提升。
  • 语言模型通过浅层融合集成未能提升性能,在最优超参数设置下仅获得+0.01 BLEU的微小增益。
  • 回译的有效性与底层模型质量呈负相关,表明初始化质量越高,收益越低,存在边际递减效应。
  • 最佳整体结果是在鞑靼语→俄语方向上,对1个周期哈萨克语初始化的模型应用回译,达到30.06 BLEU(不区分大小写)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。