Skip to main content
QUICK REVIEW

[论文解读] Impact of Corpora Quality on Neural Machine Translation

Matīss Rikters|arXiv (Cornell University)|Oct 19, 2018
Natural Language Processing Techniques参考文献 7被引用 6
一句话总结

本文提出了一套全面的过滤工具,通过从大规模平行语料库(如网络爬取所得)中去除低质量句子,以提升神经机器翻译(NMT)性能。通过应用针对重复、完全相同、对齐错误、非字母字符、重复标记和语言不匹配句子的过滤器,作者表明,过滤能显著提升NMT性能,尤其在词形丰富的语言(如爱沙尼亚语和拉脱维亚语)上表现突出,在去除78–85%的噪声数据后,英语-拉脱维亚语翻译的BLEU得分最高提升+1.60。

ABSTRACT

Large parallel corpora that are automatically obtained from the web, documents or elsewhere often exhibit many corrupted parts that are bound to negatively affect the quality of the systems and models that learn from these corpora. This paper describes frequent problems found in data and such data affects neural machine translation systems, as well as how to identify and deal with them. The solutions are summarised in a set of scripts that remove problematic sentences from input corpora.

研究动机与目标

  • 识别并系统性分类大规模自动收集的平行语料中常见的数据质量问题,这些语料用于NMT训练。
  • 开发一套实用的、开源的过滤器,用于在NMT训练前检测并移除低质量的句子对。
  • 评估这些过滤器在多个语种对上的NMT性能影响,尤其关注词形丰富的语言。
  • 证明过滤噪声语料可实现更快收敛并获得更高BLEU分数,尤其在清洁数据稀缺的情况下。
  • 提供一个可复用的、采用MIT许可证的工具包,适用于NMT流程中的平行语料和单语语料清洗,包括后翻译(back-translation)任务。

提出的方法

  • 作者定义并实现了针对特定数据质量问题的一系列过滤器:重复句子对、源-目标完全相同的句子、一对多或多数一的对齐问题、非字母字符过度使用、重复标记以及语言识别不匹配。
  • 过滤器应用于具有逐行对齐结构的平行语料,利用语言识别(fasttext)、字符分析和对齐检查来标记有问题的句子。
  • 过滤流水线与标准NMT工作流集成,包括Moses脚本用于分词、首字母大写转换(truecasing)以及子词NMT的字节对编码(BPE)。
  • 该工具包应用于WMT-18平行语料(英语-爱沙尼亚语、芬兰语、拉脱维亚语),使用Sockeye在Transformer架构(6层、8头、512维嵌入)上训练模型。
  • 通过开发集上的BLEU分数评估性能,比较过滤前后语料在两个翻译方向上的表现。
  • 该方法在真实系统中得到验证,包括在WMT18亚军NMT提交系统中的应用。

实验结果

研究问题

  • RQ1在大规模自动提取的平行语料中,常见的低质量句子类型有哪些?
  • RQ2各种过滤技术如何影响NMT模型的训练动态和最终性能?
  • RQ3在多大程度上,过滤噪声平行语料能提升NMT质量,尤其对词形丰富的语言?
  • RQ4为何尽管去除了64%的数据,过滤对芬兰语语对的性能提升不明显?
  • RQ5所提出的过滤流水线能否有效复用于后翻译和无监督MT中的单语语料清洗?

主要发现

  • 过滤后,英语-爱沙尼亚语平行语料缩减至原始大小的46.50%,其中80%的句子因语言不匹配和非字母字符问题被移除。
  • 经过过滤的爱沙尼亚语NMT系统相比未过滤模型,BLEU得分提升+0.35,收敛更快且性能无下降。
  • 对于拉脱维亚语,过滤去除了78%的数据(主要因语言不匹配和非字母字符内容),在英语-拉脱维亚语方向实现+1.60 BLEU的显著提升。
  • 芬兰语系统未因过滤获得显著性能提升,因为其最大且最清洁的语料成分(Europarl)主导了整体数据分布,掩盖了过滤的潜在收益。
  • 经过过滤的系统收敛速度明显快于未过滤系统,表明去除噪声可加速学习过程,且不损害最终性能。
  • 该工具包成功应用于WMT18亚军NMT系统,证明其在生产环境中的实际适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。