[论文解读] Building a Large Japanese Web Corpus for Large Language Models
本论文从2020–2023年间的21个Common Crawl快照中提取并优化,构建了一个大规模、高质量的日语文本语料库,包含3121亿个字符(1.73亿页)。通过应用语言特定的清洗与去重技术,该语料库在多个大语言模型(LLM)上实现了6.6–8.1分的性能提升,包括Llama 2 13B和Mixtral 8x7B Instruct在内的模型均取得了当前最优(SOTA)结果。
Open Japanese large language models (LLMs) have been trained on the Japanese portions of corpora such as CC-100, mC4, and OSCAR. However, these corpora were not created for the quality of Japanese texts. This study builds a large Japanese web corpus by extracting and refining text from the Common Crawl archive (21 snapshots of approximately 63.4 billion pages crawled between 2020 and 2023). This corpus consists of approximately 312.1 billion characters (approximately 173 million pages), which is the largest of all available training corpora for Japanese LLMs, surpassing CC-100 (approximately 25.8 billion characters), mC4 (approximately 239.7 billion characters) and OSCAR 23.10 (approximately 74 billion characters). To confirm the quality of the corpus, we performed continual pre-training on Llama 2 7B, 13B, 70B, Mistral 7B v0.1, and Mixtral 8x7B Instruct as base LLMs and gained consistent (6.6-8.1 points) improvements on Japanese benchmark datasets. We also demonstrate that the improvement on Llama 2 13B brought from the presented corpus was the largest among those from other existing corpora.
研究动机与目标
- 解决开源大语言模型(LLM)缺乏高质量、日语特异性训练数据的问题,这些数据通常源自多语言语料库,日语文本质量欠佳。
- 从原始Common Crawl数据中构建大规模、高保真的日语文本语料库,以支持日语大语言模型的有效预训练。
- 通过在多种基础大语言模型上持续预训练,验证该语料库的有效性,实现在日语文本基准任务上的持续性能提升。
- 建立可复现、公开发布的语料库及微调模型,以支持未来日语自然语言处理(NLP)与负责任的大语言模型发展研究。
提出的方法
- 使用trafilatura从21个Common Crawl快照(2020–2023)中提取原始文本,总计约634亿页。
- 采用基于MinHash的去重方法,以约0.9的Jaccard系数阈值,在字符5-gram级别上去除近似重复内容。
- 实施针对日语的语言特定质量过滤器,检测并移除低质量内容,如过度重复、表情符号密度过高以及功能词过少等。
- 使用自定义的日语文本质量评估器,过滤掉低概率或格式错误的文本,提升语料整体连贯性与实用性。
- 使用清洗后的语料库对五种基础大语言模型(Llama 2 7B、13B、70B;Mistral 7B v0.1;Mixtral 8x7B Instruct)进行持续预训练。
- 在标准日语文本基准数据集上评估性能,以量化下游自然语言处理任务中的性能提升。

实验结果
研究问题
- RQ1能否通过语言特定的过滤与去重技术,从原始Common Crawl数据中有效构建大规模、高质量的日语文本语料库?
- RQ2在所提出的语料库上进行持续预训练,能在多大程度上提升不同大语言模型架构在日语文本基准任务上的性能?
- RQ3与mC4、CC-100和OSCAR等现有语料库相比,本语料库在日语文本任务上的性能提升程度如何?
- RQ4在包含该清洗后日语文本语料库的情况下,是否会导致跨语言任务(如日英翻译)性能下降?
- RQ5该语料库能否用于从零开始训练大语言模型?这对模型泛化能力与安全性有何影响?
主要发现
- 所提出的语料库包含3121亿个字符(1.73亿页),是目前可用于日语大语言模型训练的最大语料库,超过mC4(2397亿)、CC-100(258亿)和OSCAR(740亿)。
- 在该语料库上进行持续预训练,在多个日语文本基准数据集上实现了6.6–8.1分的稳定性能提升,其中Llama 2 13B在所有对比语料库中表现提升最大。
- 该语料库在所有评估模型规模(7B、13B、8x7B和70B)上均取得了最先进(SOTA)结果,证实其在不同模型规模下的有效性。
- 与任何其他现有语料库相比,该语料库在Llama 2 13B上的性能提升最大,表明其在日语NLP任务中具有更优的质量与相关性。
- 该语料库提升了英日翻译任务的性能,但在反向(日英)任务中略有下降,提示需在数据构建中保持语言平衡。
- 所有微调模型与基准数据集均已公开发布于Hugging Face,确保实验结果的完全可复现性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。