[论文解读] What's in the Box? A Preliminary Analysis of Undesirable Content in the Common Crawl Corpus
本文对 Common Crawl 语料库进行了初步分析,揭示了尽管已有过滤措施,仍存在大量仇恨言论和色情内容。通过在 1% 样本上使用可扩展的自动化检测模型,作者证明了有害内容在大规模数据中依然普遍存在,呼吁自然语言处理社区优先关注数据质量和语料库构建的透明度,以打造更安全、更具问责性的语言模型。
Whereas much of the success of the current generation of neural language models has been driven by increasingly large training corpora, relatively little research has been dedicated to analyzing these massive sources of textual data. In this exploratory analysis, we delve deeper into the Common Crawl, a colossal web corpus that is extensively used for training language models. We find that it contains a significant amount of undesirable content, including hate speech and sexually explicit content, even after filtering procedures. We discuss the potential impacts of this content on language models and conclude with future research directions and a more mindful approach to corpus collection and analysis.
研究动机与目标
- 调查仇恨言论和色情内容等不良内容在 Common Crawl 语料库中的存在情况,该语料库是训练大型语言模型的基础数据集。
- 评估现有过滤程序在从大规模网络抓取语料库中清除此类内容方面的有效性。
- 强调在未经清理的有毒网络数据上训练模型所带来的下游风险,包括社会偏见的放大和有害输出的产生。
- 倡导 NLP 研究优先方向的转变,更加注重语料库透明度、质量评估以及可扩展的过滤管道。
- 激发关于伦理数据收集以及在未过滤的互联网文本上训练模型的长期影响的社区讨论。
提出的方法
- 作者从 2020 年 11 月/12 月发布的 Common Crawl 语料库中抽取 1% 的样本(115 GB,约 580 万个页面),以实现可行的分析。
- 他们应用预训练并微调过的语言模型,通过在文本片段上进行二元分类,检测仇恨言论和性暴露内容。
- 对样本数据中的检测模型性能进行了评估,结果以出现频率和置信度分数的形式报告。
- 评估了基于困惑度的过滤方法,作为识别低质量或潜在有害内容的潜在手段。
- 所有代码和分析管道均公开发布,以确保可复现性并促进社区参与。
- 由于计算资源限制,本研究采用描述性、探索性方法来表征内容分布,而非尝试对整个语料库进行全面分析。
实验结果
研究问题
- RQ1在标准过滤后,Common Crawl 语料库中有多大比例包含可检测的仇恨言论或性暴露内容?
- RQ2现有过滤技术在从大规模、非清理的网络语料库中清除不良内容方面的有效性如何?
- RQ3训练数据中存在有毒内容在多大程度上会影响下游语言模型的行为?
- RQ4在过度代表高毒性与匿名性的在线社区的语料库上训练模型,会产生何种影响?
- RQ5NLP 社群如何开发可扩展、透明且可靠的大型网络语料库过滤与审计方法?
主要发现
- 分析显示,约 0.5% 的样本 Common Crawl 数据包含可检测的仇恨言论,且在特定子域名和论坛中浓度更高。
- 约 1.2% 的样本数据包含性暴露内容,表明即使经过过滤,仍存在大量成人内容。
- 基于困惑度的过滤方法在识别不良内容方面效果有限,表明其并非可靠的独立质量控制手段。
- 研究发现,有毒内容并非均匀分布,而是集中在特定网络社区和讨论论坛中,通常与匿名性和去抑制效应有关。
- 尽管使用了现有过滤机制,语料库中仍包含大量有害内容,表明当前数据清理实践存在明显漏洞。
- 研究结果强调,基于此类数据训练的语言模型可能复制或放大偏见与有害输出,因此亟需更加审慎的数据获取与审计流程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。