Skip to main content
QUICK REVIEW

[论文解读] Parallel Corpus Filtering via Pre-trained Language Models

Boliang Zhang, Ajay Nagesh|arXiv (Cornell University)|May 13, 2020
Natural Language Processing Techniques参考文献 28被引用 7
一句话总结

本文提出了一种新颖的并行语料库过滤方法,利用多语言 BERT 进行可接受性过滤,GPT 进行领域相关性过滤,在 WMT 2018 和新发布的日语-中文网络爬取语料库上显著优于基线方法,即使在与有监督方法相当的无监督设置下也达到了最先进水平。

ABSTRACT

Web-crawled data provides a good source of parallel corpora for training machine translation models. It is automatically obtained, but extremely noisy, and recent work shows that neural machine translation systems are more sensitive to noise than traditional statistical machine translation methods. In this paper, we propose a novel approach to filter out noisy sentence pairs from web-crawled corpora via pre-trained language models. We measure sentence parallelism by leveraging the multilingual capability of BERT and use the Generative Pre-training (GPT) language model as a domain filter to balance data domains. We evaluate the proposed method on the WMT 2018 Parallel Corpus Filtering shared task, and on our own web-crawled Japanese-Chinese parallel corpus. Our method significantly outperforms baselines and achieves a new state-of-the-art. In an unsupervised setting, our method achieves comparable performance to the top-1 supervised method. We also evaluate on a web-crawled Japanese-Chinese parallel corpus that we make publicly available.

研究动机与目标

  • 为解决训练高质量神经机器翻译系统时,从噪声网络爬取的并行语料库中进行过滤的挑战。
  • 开发一种在仅有有限或无干净并行数据的情况下仍能有效工作的过滤方法,使其适用于日语-中文等低资源语言对。
  • 通过结合多语言 BERT 进行句子对可接受性判断和 GPT 进行领域相关性判断,提升过滤性能,减少对大规模干净并行语料库的依赖。
  • 发布一个大规模、公开可用的日语-中文并行语料库,以支持非英语语言对翻译研究。

提出的方法

  • 在包含 30 万对高质量软件领域句子对的合成数据集上微调多语言 BERT,作为正样本,并使用等量的负样本对,以构建可接受性过滤器。
  • 使用 BERT 分类器的 softmax 输出作为得分,判断句子对是否为有效翻译对。
  • 在领域内中文文本上训练基于 GPT 的语言模型,并在噪声数据上使用 KenLM n-gram 模型,构建基于语言自然度的领域过滤器,对句子对进行打分。
  • 将可接受性得分与领域相关性得分结合,对句子对进行排序,然后根据开发集表现选择前 N 组句子对用于训练 NMT 模型。
  • 对 BERT 分类器的概率输出应用阈值(例如 0.9),以在过滤过程中平衡精确率与召回率。
  • 复现并对比强基线方法,如双重条件交叉熵过滤和基于边际的打分方法,涵盖有监督和无监督两种设置。

实验结果

研究问题

  • RQ1在合成数据上微调的多语言 BERT 分类器,能否有效识别噪声网络爬取语料库中的有效并行句子对?
  • RQ2在大规模噪声并行数据上训练神经机器翻译模型时,引入基于 GPT 的领域过滤器是否能提升过滤性能?
  • RQ3无监督过滤方法能否实现与依赖数百万个干净并行句子对的有监督方法相当的性能?
  • RQ4在精确率、召回率和下游 NMT BLEU 分数方面,该方法与现有过滤技术相比表现如何?

主要发现

  • 该方法在 WMT 2018 德语-英语并行语料库过滤共享任务中达到新的最先进水平,显著优于强基线方法。
  • 在 BERT 分类器的阈值设为 0.9 时,该方法在人工标注的日语-中文测试集上实现了 97.7% 的精确率和 66.9% 的召回率。
  • 该方法的无监督版本性能与使用数百万个干净并行句子对的顶级有监督方法相当。
  • 当模型可自主选择数据规模时,基于 GPT 的领域过滤器并未提升 NMT 性能,表明格式错误但并行的句子对既无害也无益。
  • 该方法在 WMT 2018 和自建的日语-中文过滤任务中,显著优于现有方法,如充分性(双重条件交叉熵)和 Chaudhary 等人(2019)的方法。
  • 作者发布了大规模、公开可用的网络爬取日语-中文并行语料库,预计将为未来非英语语言对翻译研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。