[论文解读] Unsupervised Parallel Corpus Mining on Web Data
本文提出了一种无监督的网页双语语料库挖掘流程,通过利用无监督机器翻译模型生成伪双语数据,从而无需依赖标注的双语数据即可训练分类器,从网络爬取内容中筛选出高质量的双语句子对。该方法在低资源语言对上取得了最先进性能(En-Ro的BLEU得分为39.81,Ro-En的BLEU得分为38.95),在WMT基准测试中达到或超过有监督系统的表现。
With a large amount of parallel data, neural machine translation systems are able to deliver human-level performance for sentence-level translation. However, it is costly to label a large amount of parallel data by humans. In contrast, there is a large-scale of parallel corpus created by humans on the Internet. The major difficulty to utilize them is how to filter them out from the noise website environments. Current parallel data mining methods all require labeled parallel data as the training source. In this paper, we present a pipeline to mine the parallel corpus from the Internet in an unsupervised manner. On the widely used WMT'14 English-French and WMT'16 English-German benchmarks, the machine translator trained with the data extracted by our pipeline achieves very close performance to the supervised results. On the WMT'16 English-Romanian and Romanian-English benchmarks, our system produces new state-of-the-art results, 39.81 and 38.95 BLEU scores, even compared with supervised approaches.
研究动机与目标
- 为解决训练神经机器翻译系统时人工标注双语语料库成本高昂且资源稀缺的问题。
- 实现在无需任何标注双语数据的前提下,大规模、低成本地从网络中挖掘双语语料库。
- 通过无监督挖掘方法提升神经机器翻译模型在低资源语言对上的性能。
- 开发一种可扩展且适用于任何缺乏双语数据的语言对的流程。
提出的方法
- 使用XLM风格的目标训练无监督机器翻译模型,包括去噪自编码和反向翻译。
- 从无监督翻译器生成的伪双语数据中提取种子词典,以指导网络爬取。
- 使用Bitextor爬虫进行文档和句子对齐,从多语言网站中提取原始双语句子对。
- 应用在伪双语数据上训练的分类器,从爬取的语料库中过滤掉低质量及噪声句子对。
- 将最终过滤后的语料库作为监督数据,微调神经机器翻译模型。
- 将该流程与无监督训练目标相结合,以在低资源环境下评估性能。
实验结果
研究问题
- RQ1能否利用无监督机器翻译系统在无需任何标注数据的情况下,自举式地从网络中挖掘出高质量双语语料库?
- RQ2与有监督方法相比,所提出的流程在提取可用双语数据方面的有效性如何?
- RQ3所挖掘的双语数据能否在低资源语言对上实现与完全有监督系统相当或更优的性能?
- RQ4过滤步骤对模型性能有何影响?模型训练对噪声数据的鲁棒性如何?
主要发现
- 所提出的流程在WMT’16英语-罗马尼亚语翻译基准上取得了39.81的BLEU得分,创下新的最先进结果。
- 在罗马尼亚语-英语翻译任务中,系统取得了38.95的BLEU得分,超过同一基准上最佳有监督结果(38.5 BLEU)。
- 在WMT’14英语-法语和WMT’16英语-德语基准上,使用挖掘数据训练的模型性能非常接近完全有监督系统的水平。
- 消融实验表明,尽管原始爬取数据的性能与过滤后数据相近,但低质量数据会显著降低性能,证实了分类器的有效性。
- 该方法减少了对标注数据的依赖,使得任何语言对(即使在低资源环境下)都能实现高质量双语语料库的挖掘。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。