Skip to main content
QUICK REVIEW

[论文解读] Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus

Jesse Dodge, Maarten Sap|arXiv (Cornell University)|Apr 18, 2021
Natural Language Processing Techniques被引用 7
一句话总结

本文全面記錄了大型網絡文本語料庫 C4(Colossal Clean Crawled Corpus)的細節,該語料庫被用於訓練主流語言模型。研究分析了數據來源、內容品質及過濾機制的影響,揭示了大量機器生成文本、基準數據集的污染,以及少數語言文本被偏見性刪除的問題,並倡導在大規模網絡 NLP 語料庫中採用多層次文檔記錄。

ABSTRACT

Large language models have led to remarkable progress on many NLP tasks, and researchers are turning to ever-larger text corpora to train them. Some of the largest corpora available are made by scraping significant portions of the internet, and are frequently introduced with only minimal documentation. In this work we provide some of the first documentation for the Colossal Clean Crawled Corpus (C4; Raffel et al., 2020), a dataset created by applying a set of filters to a single snapshot of Common Crawl. We begin by investigating where the data came from, and find a significant amount of text from unexpected sources like patents and US military websites. Then we explore the content of the text itself, and find machine-generated text (e.g., from machine translation systems) and evaluation examples from other benchmark NLP datasets. To understand the impact of the filters applied to create this dataset, we evaluate the text that was removed, and show that blocklist filtering disproportionately removes text from and about minority individuals. Finally, we conclude with some recommendations for how to created and document web-scale datasets from a scrape of the internet.

研究动机与目标

  • 為解決大型、網絡爬取的語言語料庫(如 C4)缺乏全面文檔記錄的問題,這些語料庫對訓練最先进語言模型至關重要。
  • 調查 C4 中文本的來源與組成,特別是識別出如專利和政府網站等出乎意料的來源。
  • 評估過濾機制(尤其是基於阻擋清單的刪除)對少數語言群體(包括非洲裔美國英語和 LGBQT+ 內容)的影響。
  • 通過分析民族稱謂與情感詞典的共現模式,量化 C4 中的情感偏見,揭示對某些民族群體的正面情感存在差異。
  • 倡導未來大規模網絡 NLP 語料庫應採用標準化、多層次的文檔記錄(元數據、內容與排除記錄),以提升可重現性與公平性。

提出的方法

  • 收集並分析了源自 2019 年 4 月 Common Crawl 快照的 C4.en 語料,使用域名級元數據與文本級過濾技術。
  • 訓練並應用語言檢測模型(langdetect),僅保留語言分類置信度達 99% 或以上的英文文檔。
  • 使用分詞與共現分析,比較 C4 及特定領域子集(如 NYTimes、Al Jazeera)中 'Jewish' 和 'Arab' 等民族稱謂的情感模式。
  • 評估多種情感詞典(VADER、SocialSent,以及 UNQOVER 問題手動整理的詞典),以估算包含目標民族稱謂段落的情感極性。
  • 應用阻擋清單過濾,識別出對少數語言群體相關語言變體(特別是非洲裔美國英語與 LGBQT+ 身份相關內容)的不成比例刪除。
  • 發布了三種過濾後的 C4 版本、一個索引搜尋介面與一個公開討論倉儲,以支援可重現性與社群審查。

实验结果

研究问题

  • RQ1C4 語料庫的主要文本來源是什麼?與一般網絡內容的預期分佈相比如何?
  • RQ2C4 語料庫在多大程度上包含機器生成的文本或來自基準 NLP 數據集的污染?
  • RQ3過濾機制(特別是基於阻擋清單的刪除)如何影響少數語言群體的表達?
  • RQ4C4 中對特定民族身份存在哪些情感偏見?這些偏見在不同領域與情感詞典之間有何差異?
  • RQ5大規模網絡語言語料庫的全面、多層次文檔框架的關鍵組成部分是什麼?

主要发现

  • C4 包含大量來自出乎意料來源的文本,包括美國軍方網站(.mil)與專利資料庫,這些通常不被視為一般網絡文本語料庫的來源。
  • 使用 SocialSent 詞性詞典時,包含 'Jewish' 的段落中約 73.2% 的情感載體詞被分類為正面,而 'Arab' 則為 65.7%,顯示 'Jewish' 的正面情感傾向高出 7.5 個百分點。
  • 基於阻擋清單的過濾機制不成比例地刪除了與少數語言群體相關的語言變體內容,特別是與非洲裔美國英語及 LGBQT+ 身份相關的文本。
  • UnifiedQA 模型對 'Jewish' 的正面情感關聯度達 67.1%,而對 'African' 僅為 36.6%,顯示模型層次的偏見與 C4 訓練數據高度一致。
  • 情感偏見具有領域依賴性:NYT 展現 4.5% 的 'Jewish' 對 'Arab' 正面情感差距,而 Al Jazeera 則幾乎無差異(42.5% 對 42.8%),突顯偏見的語境依賴性。
  • 本研究發布了三種過濾後的 C4 版本、一個索引搜尋介面與一個公開討論論壇,以支援可重現性與社群驅動的分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。