Skip to main content
QUICK REVIEW

[论文解读] Translating Translationese: A Two-Step Approach to Unsupervised Machine Translation

Nima Pourdamghani, Nada Aldarrab|arXiv (Cornell University)|Jun 11, 2019
Natural Language Processing Techniques参考文献 28被引用 4
一句话总结

该论文提出了一种两步法无监督神经机器翻译框架,首先利用双语词典生成一种‘翻译语’释义,然后使用预训练模型将该释义翻译为流畅的目标语言文本。该方法在高资源语言上取得了最先进或具有竞争力的BLEU分数,并且在无需平行训练数据或为每种新源语言重新训练的情况下,为14种低资源语言生成了高质量的翻译。

ABSTRACT

Given a rough, word-by-word gloss of a source language sentence, target language natives can uncover the latent, fully-fluent rendering of the translation. In this work we explore this intuition by breaking translation into a two step process: generating a rough gloss by means of a dictionary and then `translating' the resulting pseudo-translation, or `Translationese' into a fully fluent translation. We build our Translationese decoder once from a mish-mash of parallel data that has the target language in common and then can build dictionaries on demand using unsupervised techniques, resulting in rapidly generated unsupervised neural MT systems for many source languages. We apply this process to 14 test languages, obtaining better or comparable translation results on high-resource languages than previously published unsupervised MT studies, and obtaining good quality results for low-resource languages that have never been used in an unsupervised MT scenario.

研究动机与目标

  • 开发一种快速、可扩展的无监督机器翻译系统,无需为新源语言重新训练。
  • 解决低资源语言翻译问题,即平行单语数据稀缺或不存在。
  • 通过模块化流水线将充分性(释义)与流畅性(翻译)解耦,提升翻译质量。
  • 仅使用现成工具和源语言到目标语言的词典,实现无监督MT系统的快速部署。
  • 在无监督设置下,展示在高资源语言和此前未测试的低资源语言上的优异性能。

提出的方法

  • 该方法使用在多样化平行数据上预训练的‘翻译语’到目标语言的翻译模型,其中源端通过双语词典转换为翻译语。
  • 使用现成的词嵌入和对齐技术按需构建源语言到目标语言的双语词典,无需平行句子级数据。
  • 利用词典将源文本释义为‘翻译语’——一种逐词对应的伪翻译——在保留语义内容的同时缺乏流畅性。
  • 预训练的翻译模型随后将翻译语转换为流畅、自然的目标语言输出。
  • 系统利用单语数据进行词嵌入训练,并通过跨语言嵌入对齐实现无监督词典学习。
  • 整个流水线在适配新源语言时避免重新训练或微调,实现快速部署。

实验结果

研究问题

  • RQ1结合词典释义与预训练翻译建模的两步流水线能否实现具有竞争力的无监督机器翻译性能?
  • RQ2该方法在先前未用于无监督MT系统的低资源语言上泛化能力如何?
  • RQ3该系统能否在无需平行训练数据或为目标语言进行语言特定调优的情况下实现高质量翻译?
  • RQ4初始翻译语释义的质量在多大程度上影响最终翻译输出?
  • RQ5该方法能否优于依赖回译或基于中间语言的现有无监督NMT方法?

主要发现

  • 在法语的新新闻测试2014(newstest2014)上,该方法取得了21.0的BLEU分数,优于所有先前的无监督NMT方法,仅低于Lample等人(2018c)的Transformer模型。
  • 在俄语上,该方法取得了12.0的BLEU分数,显著优于以往的无监督方法,且与最先进结果相当。
  • 在十种低资源语言(如印度尼西亚语、波兰语、葡萄牙语、加泰罗尼亚语)上,该方法取得了13.7至23.1之间的可接受BLEU分数,证明其在先前未测试语言上的可行性。
  • 在所有测试语言中,包括法语和德语,该系统均优于Kim等人(2018)的方法,后者是最接近的可比方法。
  • 仅翻译语阶段在法语上即取得了11.6的BLEU分数,表明释义步骤有效保留了充分的语义内容。
  • 当适配新源语言时,该方法无需重新训练或超参数调优,仅使用一个预训练模型即可在14种语言上实现快速部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。