[论文解读] Towards a Cleaner Document-Oriented Multilingual Crawled Corpus
本文提出了一种基于 OSCAR 21.09 重构的文档导向、多语言网络语料库,通过重新设计 Ungoliant 流水线,将语言分类从行级别提升至文档级别,从而保留文档完整性,并通过新型自动标注实现更优的过滤。主要贡献为 OSCAR 22.01,一个 12GB 的多语言语料库,具备去重、行过滤及元数据标注功能,支持质量感知的过滤,显著提升了自然语言处理与数字人文研究的可用性。
The need for raw large raw corpora has dramatically increased in recent years with the introduction of transfer learning and semi-supervised learning methods to Natural Language Processing. And while there have been some recent attempts to manually curate the amount of data necessary to train large language models, the main way to obtain this data is still through automatic web crawling. In this paper we take the existing multilingual web corpus OSCAR and its pipeline Ungoliant that extracts and classifies data from Common Crawl at the line level, and propose a set of improvements and automatic annotations in order to produce a new document-oriented version of OSCAR that could prove more suitable to pre-train large generative language models as well as hopefully other applications in Natural Language Processing and Digital Humanities.
研究动机与目标
- 解决现有如 OSCAR 这类多语言网络语料库中行级别语言分类的局限性,后者导致文档碎片化并损害可读性。
- 通过在网页抓取和处理过程中保留文档级别的完整性,提升下游自然语言处理任务的数据质量和可用性。
- 通过自动标注(如文档长度、成人内容、去重标记)减少噪声并提升过滤能力。
- 提升大规模抓取语料库在训练生成式语言模型及支持低资源语言应用方面的有效性。
- 通过分析基于黑名单的标注局限性,缓解成人内容检测中的偏见与过度过滤问题,特别是针对 LGBQTI+ 内容。
提出的方法
- 重新设计 Ungoliant 流水线,将语言分类从行级别改为文档级别,确保文档边界的连贯性。
- 实施行过滤,仅保留长度超过 100 个字符的连续行,以保持文档结构与可读性。
- 添加元数据标注,包括文档长度(短、中、长)、基于 URL 黑名单的成人内容分类,以及去重标记。
- 在文档和行两个层级应用去重,以减少冗余,尤其在英语等高资源语言中效果显著。
- 采用基于黑名单的成人内容过滤器对潜在敏感内容进行标注,并在法语文本样本上进行验证。
- 评估硬性阈值(如最少 5 行)对文档分类及数据质量感知的影响。
实验结果
研究问题
- RQ1将语言分类从行级别转向文档级别,对自然语言处理任务中的语料质量与可用性有何影响?
- RQ2自动标注(如长度与成人内容过滤)在多大程度上提升了大规模抓取语料库中可用文档的可发现性与质量?
- RQ3硬性阈值(如最低行数)对文档分类与感知数据质量有何影响?
- RQ4基于黑名单的成人内容标注系统在识别敏感内容时,是否会造成对非敏感或 LGBQTI+ 相关内容的过度过滤?
- RQ5去重与基于文档的处理能否显著减少冗余,同时保持低资源语言的语料多样性?
主要发现
- 新构建的 OSCAR 22.01 语料库通过过滤短而零散的行,保留了文档完整性,使文档更连贯、更易读。
- 该语料库包含一个 12GB 的多语言数据集,其中英文内容已去重,并提供行级去重工具,显著减少了冗余。
- 在法语文本样本中,约 3.2% 的成人内容标注文档被发现与 LGBQTI+ 相关,表明基于黑名单的标注存在潜在过度过滤与代表性偏差。
- 在 100 份抽样文档中,成人内容检测出现 21 例误报,包括非敏感的教育类内容及曾用于成人内容的网站。
- 基于长度的标注显示,捷克语文本中约 50% 的文档被标记为“长”,提示在中高资源语言中可能存在质量缺陷或行长度不一致问题。
- 流水线识别出德语文本中存在 30MB 的阿勒曼尼语德语内容,提示存在将区域性变体合并或作为独立语言资源处理的机会。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。