[论文解读] JParaCrawl: A Large Scale Web-Based English-Japanese Parallel Corpus
本文提出了 JParaCrawl,一个大规模基于网络的英日平行语料库,包含超过 870 万个句子对,通过网络爬取和自动句子对齐构建而成。该语料库可有效用于神经机器翻译模型的预训练,显著缩短微调时间,同时在性能上达到或超越从零开始训练的模型,尤其在结合特定领域数据时表现更优。
Recent machine translation algorithms mainly rely on parallel corpora. However, since the availability of parallel corpora remains limited, only some resource-rich language pairs can benefit from them. We constructed a parallel corpus for English-Japanese, for which the amount of publicly available parallel corpora is still limited. We constructed the parallel corpus by broadly crawling the web and automatically aligning parallel sentences. Our collected corpus, called JParaCrawl, amassed over 8.7 million sentence pairs. We show how it includes a broader range of domains and how a neural machine translation model trained with it works as a good pre-trained model for fine-tuning specific domains. The pre-training and fine-tuning approaches achieved or surpassed performance comparable to model training from the initial state and reduced the training time. Additionally, we trained the model with an in-domain dataset and JParaCrawl to show how we achieved the best performance with them. JParaCrawl and the pre-trained models are freely available online for research purposes.
研究动机与目标
- 为解决公开可用的英日平行语料库稀缺的问题,该问题限制了神经机器翻译的发展。
- 开发一种可扩展的方法,从网络中挖掘高覆盖率、多领域分布的平行句子。
- 利用 JParaCrawl 训练神经机器翻译模型,以实现迁移学习,加速下游特定领域任务的微调。
- 证明与从零开始训练相比,基于 JParaCrawl 的预训练可提升翻译质量并减少训练时间。
- 将 JParaCrawl 和预训练模型作为开放资源发布,供研究使用。
提出的方法
- 对 Common Crawl 数据进行网络爬取,以识别可能包含英日平行内容的候选领域。
- 使用多语言句子嵌入模型和交叉注意力机制,在句子级别实现双语文本的对齐。
- 结合语言学特征、长度比例和对齐模型的置信度分数,对噪声句子对进行过滤。
- 在 JParaCrawl 上训练神经机器翻译模型,以创建可用于迁移学习的预训练模型。
- 在 ASPEC 等特定领域数据集上微调预训练模型,以适应专业领域。
- 使用 BLEU 分数在标准基准(包括 ASPEC)上进行评估,以比较不同训练策略下的性能表现。
实验结果
研究问题
- RQ1大规模网络挖掘的平行语料库能否提升英日等低资源语言对的神经机器翻译性能?
- RQ2在保持或提升翻译质量的前提下,基于 JParaCrawl 的预训练能在多大程度上减少微调时间?
- RQ3与从零开始训练相比,将 JParaCrawl 与特定领域语料库结合,在 BLEU 分数和训练效率方面表现如何?
- RQ4JParaCrawl 是否可作为强大的通用预训练模型,用于科学文本等专业领域的微调?
- RQ5仅在 JParaCrawl 上训练的模型在专业术语上的表现,与在领域内数据上微调的模型相比如何?
主要发现
- JParaCrawl 包含超过 870 万个句子对,是发布时最大的公开可用英日平行语料库。
- 在特定领域数据上微调基于 JParaCrawl 预训练的模型,显著缩短了训练时间,同时 BLEU 分数与从零开始训练的模型相当或更优。
- 在英译日方向,经 JParaCrawl 预训练后在 ASPEC 上微调的模型达到 43.5 的 BLEU 分数,优于仅使用 ASPEC 数据并采用数据过采样方法的模型(44.3 分)。
- 在日译英方向,微调后的模型达到 29.3 的 BLEU 分数,优于仅使用 ASPEC 的模型(28.7 分)。
- 仅在 JParaCrawl 上训练的模型无法正确翻译如 'large eddy simulation' 等专业术语,表明领域知识无法仅通过通用网络数据捕获。
- 结合 JParaCrawl 与领域内数据(ASPEC)并采用预训练/微调策略,实现了最高性能,证明了 JParaCrawl 在迁移学习中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。