Skip to main content
QUICK REVIEW

[论文解读] SJTU-NICT's Supervised and Unsupervised Neural Machine Translation Systems for the WMT20 News Translation Task

Zuchao Li, Hai Zhao|arXiv (Cornell University)|Oct 11, 2020
Natural Language Processing Techniques参考文献 58被引用 6
一句话总结

本文介绍了上海交大-日本电信电话研究所(SJTU-NICT)在WMT20新闻翻译任务中提出的神经机器翻译系统,采用多种技术,包括文档增强的神经机器翻译、XLM预训练、双向翻译、基于参考语言的无监督神经机器翻译(UNMT)、依赖数据的高斯先验目标函数,以及BT-BLEU协同过滤。其系统在三个翻译方向中取得最先进性能,荣获第一名:英中、波-英和德-上索布语。

ABSTRACT

In this paper, we introduced our joint team SJTU-NICT 's participation in the WMT 2020 machine translation shared task. In this shared task, we participated in four translation directions of three language pairs: English-Chinese, English-Polish on supervised machine translation track, German-Upper Sorbian on low-resource and unsupervised machine translation tracks. Based on different conditions of language pairs, we have experimented with diverse neural machine translation (NMT) techniques: document-enhanced NMT, XLM pre-trained language model enhanced NMT, bidirectional translation as a pre-training, reference language based UNMT, data-dependent gaussian prior objective, and BT-BLEU collaborative filtering self-training. We also used the TF-IDF algorithm to filter the training set to obtain a domain more similar set with the test set for finetuning. In our submissions, the primary systems won the first place on English to Chinese, Polish to English, and German to Upper Sorbian translation directions.

研究动机与目标

  • 针对不同翻译场景(资源丰富、文档级和低资源)定制NMT技术,以适应各类设置。
  • 通过Longformer建模文档级上下文,利用BERT的NSP任务恢复文档结构,提升翻译质量。
  • 通过参考语言监督、跨语言预训练和协同过滤,增强无监督和低资源翻译性能。
  • 通过所提出的依赖数据的高斯先验目标函数(D2GPo),保持输出多样性并提升泛化能力。
  • 通过TF-IDF筛选训练数据以匹配测试集分布,优化微调阶段的领域对齐。

提出的方法

  • 提出基于Longformer的文档增强NMT,用于文档级上下文编码,并通过注意力机制将文档表征融合到编码器和解码器层。
  • 通过引入掩码语言建模和交叉注意力机制,增强XLM预训练语言模型的NMT性能,实现多语言表征学习。
  • 将双向翻译作为预训练策略,微调共享编码器-解码器以适应特定翻译方向。
  • 提出基于参考语言的无监督NMT(RUNMT),利用英德平行语料为德-上索布语翻译提供跨语言监督。
  • 采用BT-BLEU协同过滤自训练(CFST)方法,筛选高质量的反向翻译句子,提升模型鲁棒性。
  • 应用依赖数据的高斯先验目标函数(D2GPo),在训练过程中正则化潜在空间并保持输出多样性。

实验结果

研究问题

  • RQ1如何在神经机器翻译中有效建模文档级上下文以提升翻译质量?
  • RQ2像XLM这样的预训练多语言模型在低资源和高资源语言对上的监督NMT性能中能提升多少?
  • RQ3在德-上索布语等低资源设置下,参考语言监督能否显著提升无监督翻译性能?
  • RQ4基于BT-BLEU分数的协同过滤如何改善无监督和低资源NMT中的自训练效果?
  • RQ5使用TF-IDF进行数据过滤对NMT系统中的领域对齐和微调性能有何影响?

主要发现

  • 与基线相比,文档增强NMT模型在英中翻译任务中单模型性能提升超过1.5 BLEU。
  • XLM增强的NMT模型和双向翻译预训练策略在英-波翻译任务中各自为基线带来约2 BLEU的提升。
  • 最终系统在官方德-上索布语测试集上达到60.7 sacreBLEU,位居无监督赛道第一名。
  • RUNMT中结合RAT、RABT和XBT训练目标,使德-上索布语翻译的BLEU分数相比基线提升11.7分。
  • 在低资源赛道中引入CFST和D2GPo进一步提升了1.0–1.5 BLEU,表明二者贡献具有正交性且效果显著。
  • 集成与重排序技术使最终德-上索布语得分达到60.7(官方)和58.5(上索布语-德语),在所有方向中均位列第一。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。