[论文解读] The Nordic Pile: A 1.2TB Nordic Dataset for Language Modeling
Nordic Pile 是一个 1.2TB 的多语言数据集,包含丹麦语、冰岛语、挪威语、瑞典语和英语的高质量文本,专为在低资源北日耳曼语言中训练大型语言模型(LLMs)而策划。该数据集采用多阶段管道进行数据收集、去重、过滤和质量控制——受 The Pile 和 OSCAR 启发——最终形成一个多样化、具有代表性且符合 GDPR 的语料库,专为训练最先进的北欧 LLM 而优化。
Pre-training Large Language Models (LLMs) require massive amounts of text data, and the performance of the LLMs typically correlates with the scale and quality of the datasets. This means that it may be challenging to build LLMs for smaller languages such as Nordic ones, where the availability of text corpora is limited. In order to facilitate the development of the LLMS in the Nordic languages, we curate a high-quality dataset consisting of 1.2TB of text, in all of the major North Germanic languages (Danish, Icelandic, Norwegian, and Swedish), as well as some high-quality English data. This paper details our considerations and processes for collecting, cleaning, and filtering the dataset.
研究动机与目标
- 为解决北日耳曼语言缺乏大规模、高质量文本数据的问题,该问题阻碍了高效大型语言模型(LLMs)的发展。
- 创建一个具有代表性、多样化且高质量的多语言语料库,涵盖主要北日耳曼语言和英语,适用于大规模 LLM 的预训练。
- 通过系统性地过滤低质量、重复及个人身份信息内容,确保数据质量和符合 GDPR。
- 为未来的北欧 NLP 研究和 LLM 开发提供透明、可复现且可扩展的数据处理管道。
- 推动开发高性能、多语言 LLM,以适应北欧地区的语言和文化背景。
提出的方法
- 从多样化来源收集数据,包括 Common Crawl 衍生数据(如 mC4、OSCAR)、Wikipedia 备份、公共代码仓库、学术论文、书籍、论坛(如 Reddit)以及经筛选的任务特定数据集。
- 使用 fastText 进行语言识别,以过滤和分类文档的语言,确保涵盖丹麦语、冰岛语、挪威语、瑞典语和英语。
- 实施多阶段数据处理管道,包括内容过滤、文本提取、使用 Kneser-Ney 语言模型进行质量过滤,以及重复内容去除。
- 采用 MinHash 局部敏感哈希(MinHash LSH)进行文档级去重,以减少冗余并提高训练效率。
- 应用自定义过滤管道,排除低质量内容,如计算机生成文本、PDF 提取噪声以及存在高个人身份信息风险的数据。
- 最终数据集以 JSON Lines 格式组织,格式一致并附有全面元数据,以确保可复现性和可用性。
实验结果
研究问题
- RQ1如何系统性地构建大规模、高质量的多语言数据集,以支持低资源北日耳曼语言?
- RQ2哪些数据收集与过滤策略能在最大程度上提升代表性、多样性与质量,同时最小化冗余与隐私风险?
- RQ3经过筛选、去重和清理的数据集在多大程度上能提升北日耳曼语言 LLM 的性能?
- RQ4在欧洲大规模网络数据收集背景下,如何实现 GDPR 合规?
- RQ5在训练高效的北欧 LLM 时,数据量、语言多样性与领域代表性之间应如何达到最佳平衡?
主要发现
- Nordic Pile 包含 1.2TB 经清洗、过滤和去重的文本,涵盖五种语言:英语占 40.24%,瑞典语占 26.02%,挪威语占 11.55%,丹麦语占 10.8%,冰岛语占 1.59%。
- 数据集中包含 114.5GB 的代码(Bash、JavaScript、Python 和 SQL),以及 159.55GB 的其他类型数据,包括并行数据集和任务特定数据集。
- Web CC(基于 Common Crawl 的数据)贡献最大,达 461.47GB,其次为 Wikipedia(16.71GB)和 Articles(150.77GB)。
- 数据集经过严格的质量控制,已排除低质量来源,如 PDF 提取文本和计算机生成内容(如 YouTube 字幕)。
- 尽管经过精心策划,作者指出当前欧洲立法仍禁止公开分发处理后的数据集,凸显了未来北欧 LLM 发展中的关键监管障碍。
- 最终数据集旨在支持训练具有多亿参数规模的 LLM,具备在不同领域、语言和文本风格之间强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。