Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Translation of German--Lower Sorbian: Exploring Training and Novel Transfer Methods on a Low-Resource Language

Lukas Edman, Ahmet Üstün|arXiv (Cornell University)|Sep 24, 2021
Natural Language Processing Techniques参考文献 11被引用 4
一句话总结

本文提出了一种针对德语-下索布语这一低资源语言对的新型无监督神经机器翻译系统,通过交替训练两种语言、引入从上索布语到下索布语的词汇迁移方法,并优化在线与离线后翻译的顺序。该方法取得了最先进性能,在WMT 2021共享任务中,DSB→DE排名并列第一,DE→DSB排名第三,通过词汇迁移最高提升4.0 BLEU,通过先使用在线后翻译提升2.76 BLEU。

ABSTRACT

This paper describes the methods behind the systems submitted by the University of Groningen for the WMT 2021 Unsupervised Machine Translation task for German--Lower Sorbian (DE--DSB): a high-resource language to a low-resource one. Our system uses a transformer encoder-decoder architecture in which we make three changes to the standard training procedure. First, our training focuses on two languages at a time, contrasting with a wealth of research on multilingual systems. Second, we introduce a novel method for initializing the vocabulary of an unseen language, achieving improvements of 3.2 BLEU for DE$ ightarrow$DSB and 4.0 BLEU for DSB$ ightarrow$DE. Lastly, we experiment with the order in which offline and online back-translation are used to train an unsupervised system, finding that using online back-translation first works better for DE$ ightarrow$DSB by 2.76 BLEU. Our submissions ranked first (tied with another team) for DSB$ ightarrow$DE and third for DE$ ightarrow$DSB.

研究动机与目标

  • 解决低资源语言(如低索布语)的无监督翻译挑战,其单语语料有限且无并行训练数据。
  • 探究在计算与数据资源受限条件下,同时微调两种语言是否优于多语言预训练。
  • 提出一种方法,通过从密切相关语言(上索布语)迁移知识,初始化未见低资源语言(下索布语)的词嵌入。
  • 确定结合在线与离线后翻译以最大化翻译质量的最优顺序。
  • 在受限访问预训练多语言模型的条件下,建立低资源环境下无监督翻译的基准。

提出的方法

  • 基于语言相似性,每次仅聚焦于两种语言进行训练——先从德语与捷克语开始,再依次为德语与上索布语,最后为德语与下索布语。
  • 提出一种新颖的词汇迁移方法,通过Levenshtein距离计算词相似性,并选取top-k候选词,将上索布语的词嵌入映射至下索布语。
  • 采用两阶段训练流程:首先在高资源语言对上进行预训练,然后在目标低资源对上进行无监督训练的微调。
  • 同时使用在线与离线后翻译,系统性地比较两种顺序:先在线后翻译 vs. 先离线后翻译,以确定最优序列。
  • 利用捷克语与上索布语的辅助单语数据,以及德语-捷克语的并行数据,以改善模型初始化与训练稳定性。
  • 进行消融实验,评估词汇迁移与后翻译顺序对BLEU分数的影响。

实验结果

研究问题

  • RQ1当数据与时间受限时,是预训练并微调多语言模型更优,还是每次仅聚焦于两种语言更优?
  • RQ2如何为未见的低资源语言(如低索布语)获得良好的词汇初始化?
  • RQ3在无监督训练中,结合在线与离线后翻译的最佳顺序是什么?

主要发现

  • 先使用在线后翻译再使用离线后翻译,相比反序,可使DE→DSB翻译性能提升2.76 BLEU,表明在线后翻译生成的更高质量合成数据能显著提升后续离线训练效果。
  • 所提出的从上索布语到下索布语的词汇迁移方法,使DE→DSB翻译提升3.2 BLEU,DSB→DE翻译提升4.0 BLEU,其中基于Levenshtein距离的相似性方法优于简单的top-1方法。
  • 消融实验证实,词汇迁移显著提升性能,Levenshtein方法带来最高增益,尤其在零样本DSB→DE翻译中,BLEU从3.15提升至21.27。
  • 当采用在线后翻译先于离线后翻译的顺序时,模型在DE→DSB上达到24.64 BLEU,在DSB→DE上达到27.89 BLEU,分别在WMT 2021共享任务中排名第三和并列第一。
  • 即使未在下索布语上进行任何微调,仅通过词汇迁移的模型在DSB→DE翻译中仍达到21.27 BLEU,凸显了初始化在低资源设置中的关键作用。
  • 结果表明,无监督训练在词汇初始化改进后显著受益,词汇迁移成功弥合了零样本性能中16-18 BLEU的差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。