Skip to main content
QUICK REVIEW

[论文解读] Integrating Unsupervised Data Generation into Self-Supervised Neural Machine Translation for Low-Resource Languages

Dana Ruiter, Dietrich Klakow|arXiv (Cornell University)|Jul 19, 2021
Natural Language Processing Techniques被引用 4
一句话总结

本文提出将无监督数据生成技术——回译和多语言去噪自编码——整合到自监督神经机器翻译(SSNMT)中,以提升低资源语言的翻译性能。通过结合在线句子对抽取、回译和多语言预训练,该方法在低资源及语言差异较大的语料对上取得最先进结果,相比自监督NMT和无监督NMT基线模型,BLEU分数最高提升+4.3分,且仅使用单语数据进行训练。

ABSTRACT

For most language combinations, parallel data is either scarce or simply unavailable. To address this, unsupervised machine translation (UMT) exploits large amounts of monolingual data by using synthetic data generation techniques such as back-translation and noising, while self-supervised NMT (SSNMT) identifies parallel sentences in smaller comparable data and trains on them. To date, the inclusion of UMT data generation techniques in SSNMT has not been investigated. We show that including UMT techniques into SSNMT significantly outperforms SSNMT and UMT on all tested language pairs, with improvements of up to +4.3 BLEU, +50.8 BLEU, +51.5 over SSNMT, statistical UMT and hybrid UMT, respectively, on Afrikaans to English. We further show that the combination of multilingual denoising autoencoding, SSNMT with backtranslation and bilingual finetuning enables us to learn machine translation even for distant language pairs for which only small amounts of monolingual data are available, e.g. yielding BLEU scores of 11.6 (English to Swahili).

研究动机与目标

  • 解决因平行语料稀缺或缺失而导致的低资源神经机器翻译挑战。
  • 探究无监督数据生成技术(如回译、去噪)是否可提升自监督NMT(SSNMT)的性能。
  • 探索在低资源环境下,结合多语言去噪自编码、回译和双语微调的有效性。
  • 在多种语言对(包括语言类型差异大且单语数据极少的低资源语言)上评估该方法。
  • 证明SSNMT可通过无监督数据增强和多语言预训练实现强大性能,即使完全不依赖平行数据。

提出的方法

  • 采用一种自监督NMT框架,通过在编码器嵌入上使用基于边际的相似性度量,联合学习翻译任务并从可比的单语语料中提取相似句子对。
  • 将回译作为无监督数据增强技术,通过自动编码与翻译循环生成合成平行数据。
  • 在少量多语言单语数据上进行多语言去噪自编码(MDAE)预训练,以提升跨语言的表征学习能力。
  • 通过双语微调对齐模型输出分布与目标语言特征,提升在低资源语料对上的泛化能力。
  • 以端到端、在线方式训练模型,通过共享的编码器-解码器架构迭代优化句子对抽取与翻译任务。
  • 利用共享的多语言编码器与语言特定的解码器,实现对远距离语言对的零样本和少样本迁移。

实验结果

研究问题

  • RQ1在低资源设置下,无监督数据生成技术(如回译和去噪)是否能提升自监督NMT的性能?
  • RQ2结合MDAE预训练、回译和双语微调对低资源及远距离语言对的翻译质量有何影响?
  • RQ3将UMT风格的数据增强整合到SSNMT中,是否能带来比单一方法更优的泛化性能?
  • RQ4SSNMT结合数据增强是否能在不使用任何平行单语数据的情况下,实现与基于提取平行数据训练的监督系统相媲美的性能?
  • RQ5语言类型和距离在该方法成功中的作用是什么?如何为远距离语言对优化多语言预训练?

主要发现

  • 所提出的UMT增强型SSNMT框架在阿非利卡语-英语翻译任务上相比SSNMT基线模型最高提升+4.3 BLEU,分别较统计UMT和混合UMT高出+50.8和+51.5 BLEU。
  • 在远距离语言对英语-斯瓦希里语上,仅使用66,000个单语句子即达到11.6的BLEU分数,证明其在极端低资源场景下的有效性。
  • 尽管训练过程中未使用任何平行数据,该方法仍超越了在Laser提取的平行句子上训练的监督NMT系统,适用于英语-阿非利卡语和英语-尼泊尔语任务。
  • 在英语-约鲁巴语任务中,仅使用501组平行句子即取得22.4的BLEU分数,优于无监督和自监督基线模型。
  • 多语言去噪自编码、回译和双语微调的结合,使得在以往无监督或自监督方法失败的语言对上成功实现训练。
  • 当源语言未出现在多语言预训练语料中时,模型性能下降,凸显在预训练中包含相关语言的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。