Skip to main content
QUICK REVIEW

[論文レビュー] RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models

Samuel Gehman, Suchin Gururangan|arXiv (Cornell University)|Sep 23, 2020
Natural Language Processing Techniques被引用数 16
ひとこと要約

この論文は、Webテキストから抽出された自然な文レベルのプロンプト10万件から成るRealToxicityPromptsというデータセットを紹介している。各プロンプトはPERSPECTIVE APIによる毒性スコアとペairedされている。研究では、GPT-2のような事前学習済み言語モデルで、毒性スコアが0.5未満の非毒性プロンプトですら、非常に毒性の強い出力を引き起こすことがあることが明らかになった。これは、『神経的毒性劣化』が持続的であることを示している。データや計算リソースを多く使う手法(例:非毒性データでの微調整)は毒性を軽減するが、完全に排除はできない。著者らは、OpenWebText や OpenAI WebText といった事前学習コーパスに顕著な毒性コンテンツが存在することを特定し、言語モデルの学習におけるデータ選別とキュレーションの改善の必要性を強調している。

ABSTRACT

Pretrained neural language models (LMs) are prone to generating racist, sexist, or otherwise toxic language which hinders their safe deployment. We investigate the extent to which pretrained LMs can be prompted to generate toxic language, and the effectiveness of controllable text generation algorithms at preventing such toxic degeneration. We create and release RealToxicityPrompts, a dataset of 100K naturally occurring, sentence-level prompts derived from a large corpus of English web text, paired with toxicity scores from a widely-used toxicity classifier. Using RealToxicityPrompts, we find that pretrained LMs can degenerate into toxic text even from seemingly innocuous prompts. We empirically assess several controllable generation methods, and find that while data- or compute-intensive methods (e.g., adaptive pretraining on non-toxic data) are more effective at steering away from toxicity than simpler solutions (e.g., banning "bad" words), no current method is failsafe against neural toxic degeneration. To pinpoint the potential cause of such persistent toxic degeneration, we analyze two web text corpora used to pretrain several LMs (including GPT-2; Radford et. al, 2019), and find a significant amount of offensive, factually unreliable, and otherwise toxic content. Our work provides a test bed for evaluating toxic generations by LMs and stresses the need for better data selection processes for pretraining.

研究の動機と目的

  • 事前学習済み言語モデルにおける毒性劣化のリスクを体系的に評価すること。
  • 見かけ上非毒性のプロンプトが、高毒性の出力を引き起こす可能性があるかどうかを特定すること。
  • 毒性出力を防ぐために、制御可能な生成手法の有効性を評価すること。
  • OpenWebText や OpenAI WebText といった主要な事前学習コーパスにおける毒性レベルを分析すること。
  • 言語モデルの事前学習におけるデータ選別とキュレーションの改善の緊急性を強調すること。

提案手法

  • PERSPECTIVE API による毒性スコア評価で非毒性とされた、英語のWebテキストから抽出した文レベルのプロンプト10万件を含む RealToxicityPrompts を構築した。
  • PERSPECTIVE API を用いて各プロンプトに毒性スコアを割り当て、0.5以上を毒性ありとラベル付けした。
  • 毒性制御トークン、スワーワードフィルタ、非毒性データでの微調整など、複数の制御可能な生成手法の、毒性出力を防ぐ能力を評価した。
  • PERSPECTIVE API を用いて、複数の毒性ラベルを用いて OpenWebText Corpus (OWTC) と OpenAI WebText (OPENAI-WT) における大規模な毒性分析を実施した。
  • OWTC と OPENAI-WT 間の類似度を推定するために、局所性に敏感なハッシュ(LSH)とジャカード距離を用いた。
  • 攻撃的コンテンツの出典を特定するために、毒性のあるドキュメントに関連するサブレdditコミュニティやドメインを分析した。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み言語モデルは、非毒性とされる自然な文の接頭語を提示された場合でも、高毒性のテキストを生成できるか?
  • RQ2フィルタリングや微調整などのさまざまな制御生成技術は、毒性劣化の防止にどの程度効果的か?
  • RQ3OpenWebText や OpenAI WebText といった広く使われている事前学習コーパスに、どの程度の毒性コンテンツが存在するか?
  • RQ4禁止または隔離されたサブレdditコミュニティは、LMの事前学習に使われる毒性Webコーパスにおいて、顕著に過剰に存在しているか?
  • RQ5プロンプトにアイデンティティ関連語や下品語が含まれている場合、言語モデルが毒性出力を生成する確率が高くなるか?

主な発見

  • PERSPECTIVE API で非毒性(TOXICITY < 0.5)とラベル付けされたプロンプトでも、GPT-2モデルが生成する出力の46%が毒性と分類された。
  • GPT-2モデルでは、プロンプトの毒性と生成物の毒性の間に強い相関関係が認められた(r = 0.43, p < 0.001)、また、プロンプトの下品語と生成物の下品語の間にも相関が見られた(r = 0.169, p < 0.001)。
  • プロンプトにマイノリティのアイデンティティ表現が含まれている場合、マジョリティのアイデンティティ表現よりも、生成物にコピーされる傾向が高かった(rmin. = 0.13 対 rmaj. = 0.08, p < 0.001)、これはバイアスの拡散を示している。
  • OpenWebText Corpus (OWTC) と OpenAI WebText (OPENAI-WT) には顕著な毒性コンテンツが含まれており、OWTCでは5.5%のドキュメントが「アイデンティティ攻撃」、5.5%が「脅威」とラベル付けされた。
  • 禁止または隔離されたサブレdditコミュニティは、OWTCの毒性ドキュメントのうち10%を占めており、顕著に過剰に存在していた。
  • 高度な緩和手法を用いても、いかなる手法も万全ではなかった。最も効果的な手法(例:非毒性データでの微調整)でも、特定のプロンプトに対しては高毒性の出力を生成していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。