Skip to main content
QUICK REVIEW

[論文レビュー] What's in the Box? A Preliminary Analysis of Undesirable Content in the Common Crawl Corpus

Alexandra Sasha Luccioni, Joseph D. Viviano|arXiv (Cornell University)|May 6, 2021
Hate Speech and Cyberbullying Detection参考文献 71被引用数 18
ひとこと要約

この論文は、既存のフィルタリングにもかかわらず、大量の嫌がらせ発言や性的に露骨なコンテンツが含まれていることを見出す、Common Crawlコーパスの予備的分析を実施している。1%のサンプルに対してスケーラブルで自動化された検出モデルを用いて、著者たちは、望ましくないコンテンツがスケールして依然として存在することを示している。これは、NLPコミュニティが、より安全で説明責任のある言語モデルを構築するための、データ品質とコーパス管理の透明性を最優先にすべきであると訴えている。

ABSTRACT

Whereas much of the success of the current generation of neural language models has been driven by increasingly large training corpora, relatively little research has been dedicated to analyzing these massive sources of textual data. In this exploratory analysis, we delve deeper into the Common Crawl, a colossal web corpus that is extensively used for training language models. We find that it contains a significant amount of undesirable content, including hate speech and sexually explicit content, even after filtering procedures. We discuss the potential impacts of this content on language models and conclude with future research directions and a more mindful approach to corpus collection and analysis.

研究の動機と目的

  • 大規模言語モデルの訓練に用いられる基盤的データセットであるCommon Crawlコーパスに、望ましくないコンテンツ(特に嫌がらせ発言や性的に露骨な内容)が存在するかどうかを調査すること。
  • 大規模でウェブスクリーピングされたコーパスからこのようなコンテンツを除去するための、既存のフィルタリング手順の有効性を評価すること。
  • 未処理で有毒なウェブデータを用いてモデルを訓練することによる、下流のリスク、特に社会的バイアスや有害な出力を強化することの影響を浮き彫りにすること。
  • コーパスの透明性、品質評価、スケーラブルなフィルタリングパイプラインへの研究の優先順位の転換を提唱すること。
  • 未フィルタリングのインターネットテキストを用いてモデルを訓練する際の倫理的収集と長期的影響についてのコミュニティディスカッションを促すこと。

提案手法

  • 著者たちは、2020年11月/12月リリースのCommon Crawlコーパスから1%のサンプル(115 GB、約580万ページ)を抽出し、分析を可能にするために使用した。
  • テキストセグメントを用いた二値分類により、事前学習済みでファインチューニングされた言語モデルを用いて、嫌がらせ発言および性的に露骨なコンテンツの検出を実施した。
  • サンプルデータにおける検出モデルのパフォーマンスを評価し、出現頻度と信頼度スコアの観点から結果を報告した。
  • パープレキシティベースのフィルタリングが、低品質または有害なコンテンツを同定するための潜在的な手法として評価された。
  • すべてのコードと分析パイプラインは、再現可能性とコミュニティ参加を確保するために公開された。
  • 計算制約のため、大規模なコーパス全体の分析を試みるのではなく、内容の分布を記述的に探索的に特徴づけるアプローチを採用した。

実験結果

リサーチクエスチョン

  • RQ1標準的なフィルタリングを経た後でも、Common Crawlコーパスのどの程度が検出可能な嫌がらせ発言や性的に露骨なコンテンツを含んでいるか?
  • RQ2大規模で非キュレーションされたウェブコーパスから望ましくないコンテンツを除去するための、既存のフィルタリング技術はどの程度効果的か?
  • RQ3訓練データに有毒なコンテンツが存在する場合、その影響が下流の言語モデルの挙動にどの程度及ぶか?
  • RQ4毒性と匿名性の高いオンラインコミュニティが過剰に代表されるコーパスを用いてモデルを訓練することは、どのような意味を持つのか?
  • RQ5NLPコミュニティは、大規模なウェブコーパスのフィルタリングと監査に、スケーラブルで透明性があり信頼性のある方法をどのように開発できるか?

主な発見

  • 分析の結果、サンプルされたCommon Crawlデータの約0.5%が検出可能な嫌がらせ発言を含んでおり、特定のサブドメインやフォーラムで濃度が高まっていることが判明した。
  • サンプルデータの約1.2%が性的に露骨なコンテンツを含んでおり、フィルタリング後でも成人向けコンテンツが顕著に存在していることが示された。
  • パープレキシティベースのフィルタリングは、望ましくないコンテンツを同定するうえで限定的な有効性しか示さず、品質管理のための単独手法としては信頼できないことが示唆された。
  • 研究では、有毒なコンテンツが均等に分布しているのではなく、しばしば匿名性や抑制の欠如に起因する特定のウェブコミュニティやディスカッションフォーラムに集中していることが分かった。
  • 既存のフィルタリングメカニズムを用いても、コーパスには依然として顕著な有害コンテンツが存在しており、これは現在のデータキュレーション実践におけるギャップを示している。
  • これらの発見は、このようなデータを用いて訓練された言語モデルがバイアスや有害な出力を再現・強化するリスクを強調しており、より配慮あるデータソース選定と監査が不可欠であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。