Skip to main content
QUICK REVIEW

[论文解读] A Universal Parent Model for Low-Resource Neural Machine Translation Transfer

Mozhdeh Gheini, Jonathan May|arXiv (Cornell University)|Sep 14, 2019
Topic Modeling参考文献 31被引用 15
一句话总结

本文提出一种通用父模型神经机器翻译架构,采用固定多语言子词词汇表,可在无需重新训练或更新词汇表的情况下,实现对任意低资源语言对的快速微调。通过利用拼写统一与广泛覆盖的子词分词方法,该模型在多种语言家族中实现了最先进的性能,相较于以往的迁移学习方法,具备更快的部署速度与更高的翻译质量。

ABSTRACT

Transfer learning from a high-resource language pair `parent' has been proven to be an effective way to improve neural machine translation quality for low-resource language pairs `children.' However, previous approaches build a custom parent model or at least update an existing parent model's vocabulary for each child language pair they wish to train, in an effort to align parent and child vocabularies. This is not a practical solution. It is wasteful to devote the majority of training time for new language pairs to optimizing parameters on an unrelated data set. Further, this overhead reduces the utility of neural machine translation for deployment in humanitarian assistance scenarios, where extra time to deploy a new language pair can mean the difference between life and death. In this work, we present a `universal' pre-trained neural parent model with constant vocabulary that can be used as a starting point for training practically any new low-resource language to a fixed target language. We demonstrate that our approach, which leverages orthography unification and a broad-coverage approach to subword identification, generalizes well to several languages from a variety of families, and that translation systems built with our approach can be built more quickly than competing methods and with better quality as well.

研究动机与目标

  • 解决在紧急人道主义场景中,为每个新低资源语言对训练专用父模型的不切实际问题。
  • 克服在迁移至新子语言时,因词汇表重新训练与模型重新初始化导致的低效问题。
  • 开发一个单一、预训练的神经父模型,可天然地用于迁移至任意新语言对,且仅需极少配置。
  • 通过采用固定多语言子词词汇表,嵌入通用翻译不变性,以提升低资源神经机器翻译性能。
  • 通过消除预处理与重新训练的开销,实现在时间敏感应用中神经翻译系统的快速部署。

提出的方法

  • 设计一个在涵盖多种语言家族与书写系统的多语言并行语料上训练的通用父模型。
  • 应用通用罗马化方法以统一输入拼写,降低训练期间的语言多样性挑战。
  • 使用单一、固定的子词词汇表,在所有源语言上联合训练,避免针对每种语言的词汇表更新。
  • 在多语言语料上实施广覆盖子词分词方法(如 BPE),以确保对多样化语言的全面覆盖。
  • 仅使用目标语言的并行数据对通用父模型进行微调,而不修改父模型的词汇表或架构。
  • 确保父模型已在大规模多语言数据(如 WMT、TED、Europarl)上预训练,以捕捉通用翻译模式。

实验结果

研究问题

  • RQ1为何从高资源父模型进行迁移学习能提升低资源神经机器翻译性能?
  • RQ2单一、固定大小的子词词汇表是否能在多种语言家族与书写系统中有效运作?
  • RQ3与语言特定或动态更新的父模型相比,通用父模型在速度与翻译质量方面表现如何?
  • RQ4通用模型在无需语言特定预处理或词汇表适配的情况下,其泛化能力有多强?
  • RQ5即使后者在更大单语语料上训练,通用父模型是否仍能超越单语父模型?

主要发现

  • 该通用父模型在所有五个测试的低资源语言对(罗马尼亚语、印地语、立陶宛语、芬兰语、爱沙尼亚语)中均取得最高 BLEU 分数,优于单语法语父模型及其他多语言基线模型。
  • 使用包含 200 万句句子的父模型时,该通用方法已在除罗马尼亚语外的所有子语言上超越更大的(1100 万句)单语法语父模型的翻译质量。
  • 大尺寸通用父模型(1100 万句)在罗马尼亚语-英语翻译中取得 28.01 的 BLEU 分数,高于大尺寸法语父模型的 27.52,证明其更强的泛化能力。
  • 该模型在印地语-英语翻译中取得 9.10 的 BLEU 分数,显著优于法语父模型的 7.10,表明其在低资源、非印欧语系语言上亦表现强劲。
  • 通过消除每种新语言对的词汇表重新训练与定制父模型创建的需要,将部署时间从数天或数周缩短至数小时。
  • 该方法在语言家族之间泛化良好,涵盖印欧语系、芬兰-乌戈尔语系与伊朗语族,证实了通用子词与罗马化方法的稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。