[论文解读] JParaCrawl v3.0: A Large-scale English-Japanese Parallel Corpus
本文介绍了 JParaCrawl v3.0,这是一个大规模的英日平行语料库,包含超过 2100 万组唯一的句子对,通过使用更新的技术重新抓取网络数据构建而成,新增了 PDF 和 Word 文档。该语料库显著提升了跨多样化领域的神经机器翻译性能,尤其在近期话题(如 COVID-19)上表现优于以往版本,在多个基准测试集上表现更优。
Most current machine translation models are mainly trained with parallel corpora, and their translation accuracy largely depends on the quality and quantity of the corpora. Although there are billions of parallel sentences for a few language pairs, effectively dealing with most language pairs is difficult due to a lack of publicly available parallel corpora. This paper creates a large parallel corpus for English-Japanese, a language pair for which only limited resources are available, compared to such resource-rich languages as English-German. It introduces a new web-based English-Japanese parallel corpus named JParaCrawl v3.0. Our new corpus contains more than 21 million unique parallel sentence pairs, which is more than twice as many as the previous JParaCrawl v2.0 corpus. Through experiments, we empirically show how our new corpus boosts the accuracy of machine translation models on various domains. The JParaCrawl v3.0 corpus will eventually be publicly available online for research purposes.
研究动机与目标
- 为解决大规模、公开可用的英日平行语料库稀缺的问题,以提升翻译模型性能。
- 通过使用最新网络抓取内容扩展训练数据,提升低资源语言对的机器翻译质量。
- 通过增强的数据收集与过滤技术,对先前的 JParaCrawl 语料库进行更新与扩展。
- 通过实证方法验证新语料库在多样化领域与测试集上对翻译准确率的影响。
- 公开发布 JParaCrawl v3.0,以支持未来英日机器翻译的研究与开发。
提出的方法
- 重新抓取 CommonCrawl 归档以收集多语言网络内容,包括 PDF 和 Word 文档,扩展至非纯 HTML 页面。
- 应用多语言句子嵌入对齐方法,识别跨语言的平行句子对。
- 实施过滤流水线,去除噪声、低质量或非平行的句子对。
- 使用 32,000 词汇量的子词模型进行 sentencepiece 分词,准备训练数据。
- 使用 fairseq 工具包,基于小、基础和大配置的 Transformer 模型进行训练。
- 在多样化的测试集(包括 WMT、IWSLT、ASPEC、JESC 和商务对话)上,使用 sacreBLEU 进行模型评估,并采用 NFKC 正规化以确保一致性。
实验结果
研究问题
- RQ1更大、更及时的平行语料库是否能在多样化领域中显著提升英日与日英神经机器翻译性能?
- RQ2JParaCrawl v3.0 与以往版本及领域内训练数据相比,在 BLEU 分数提升方面表现如何?
- RQ3新语料库在处理新出现的专业术语(如与 COVID-19 相关的术语)方面,其翻译质量提升程度如何?
- RQ4该语料库是否能提升低资源领域(如新闻、字幕、科技论文和对话)的翻译性能?
- RQ5非 HTML 格式(如 PDF、Word)的包含是否对最终语料库的规模与质量有实质性贡献?
主要发现
- JParaCrawl v3.0 语料库包含 21,481,513 组唯一句子对,超过前一版本 v2.0 的两倍以上。
- 在 15 个英日测试集中的 13 个以及所有日英测试集中,基于 JParaCrawl v3.0 训练的模型均取得了最高的 BLEU 分数。
- v3.0 模型在 WMT2021 新闻翻译任务中表现尤为突出,可能是因为其包含了旧语料库中未充分体现的近期术语(如 'COVID-19')。
- 来自 WMT2021 测试集的一个翻译示例显示,v3.0 正确地将 '濃厚接触者' 翻译为 'close contacts',而 v1.0 和 v2.0 则错误地译为 'strong contact person'。
- 该语料库在多个领域(包括科技论文、字幕、新闻和对话)中均表现出一致的性能提升,证实了其广泛适用性。
- 作者确认,新语料库在捕捉当代语言使用方面尤为有效,支持了定期更新语料库的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。