Skip to main content
QUICK REVIEW

[論文レビュー] Toxicity Detection with Generative Prompt-based Inference

Yau-Shian Wang, Yingshan Chang|arXiv (Cornell University)|May 24, 2022
Software Engineering Research被引用数 12
ひとこと要約

本稿では、微調整を伴わずに、自己診断能力を活用する大規模言語モデルを用いて、ゼロショットの中毒性検出のための生成的プロンプトベースの推論手法を提案する。3つのソーシャルメディア中毒性データセットにおいて、生成的分類が判別的アプローチを上回ることを示し、マクロ-F1スコアが高く、内面的中毒性の検出性能も向上し、偏りのある誤った相関関係への依存を低減した。

ABSTRACT

Due to the subtleness, implicity, and different possible interpretations perceived by different people, detecting undesirable content from text is a nuanced difficulty. It is a long-known risk that language models (LMs), once trained on corpus containing undesirable content, have the power to manifest biases and toxicity. However, recent studies imply that, as a remedy, LMs are also capable of identifying toxic content without additional fine-tuning. Prompt-methods have been shown to effectively harvest this surprising self-diagnosing capability. However, existing prompt-based methods usually specify an instruction to a language model in a discriminative way. In this work, we explore the generative variant of zero-shot prompt-based toxicity detection with comprehensive trials on prompt engineering. We evaluate on three datasets with toxicity labels annotated on social media posts. Our analysis highlights the strengths of our generative classification approach both quantitatively and qualitatively. Interesting aspects of self-diagnosis and its ethical implications are discussed.

研究の動機と目的

  • 生成的プロンプトベースの推論が、タスク固有の微調整を伴わず中毒性コンテンツを効果的に検出できるかどうかを調査すること。
  • 内面的で繊細な中毒性を検出する文脈において、生成的分類と判別的分類の性能を比較評価すること。
  • 二値ラベルの監視を避けることで、マイノリティのグループの言及と中毒性ラベルの間の誤った相関関係への依存を低減すること。
  • 大規模言語モデルの自己診断能力が中毒性検出において持つ倫理的影響を検討すること。
  • プロンプトの表現方法が、ゼロショット中毒性検出におけるモデルの行動と解釈可能性にどのように影響するかを分析すること。

提案手法

  • 本手法は、GPT-2などの大規模言語モデルを用い、中毒性の側面(例:「このテキストは攻撃的ですか?」「このテキストの中毒的バージョンを生成してください。」など)を指定するプロンプトに条件づけられた応答を生成する。
  • 中毒性検出を生成的タスクとして定式化する。モデルは、タスクを条件付き生成として定式化したプロンプトに従い、入力が中毒的かどうかを反映するテキストスパンを生成する。
  • 事前学習済みモデルが保持する中毒的コンテンツおよび関連する判断に関する内部知識を活用し、ラベル付きデータや微調整の必要を回避する。
  • プロンプト工学は、内面的バイアスや繊細な中毒性を検出するのを支援する「社会的バイアスフレーム(SBF)」に従う。
  • モデルの出力を、生成されたテキストが中毒性ラベルと整合するかどうかに基づき、しきい値による分類またはトークンベースの分類戦略を用いて、中毒的または非中毒的と分類する。
  • 評価にはマクロ-F1、ポジティブおよびネガティブクラスのF1スコア、およびLIMEによる質的分析(予測へのトークンレベルの寄与度の評価)を用いる。

実験結果

リサーチクエスチョン

  • RQ1生成的プロンプトベースの推論は、ゼロショット中毒性検出において、判別的プロンプトベースの手法を上回ることができるか?
  • RQ2生成的アプローチは、キーワードベースの手法では捉えきれない内面的で繊細な中毒性の形態をどのように処理するか?
  • RQ3生成的アプローチは、マイノリティのグループの言及と中毒性ラベルの間の誤った相関関係への依存をどの程度低減するか?
  • RQ4プロンプトの表現方法は、モデルの検出行動と解釈可能性にどのように影響するか?
  • RQ5大規模言語モデルの自己診断能力が中毒性検出において持つ倫理的リスクは何か?

主な発見

  • 生成的分類アプローチは、すべての3つのデータセット(SBIC、HateXplain、SemEval 2019)において、判別的分類を上回るマクロ-F1スコアを達成した。
  • SBICデータセットでは、最大のGPT-2モデルが生成的分類でマクロ-F1 0.62を達成し、判別的ベースラインを上回った。
  • 生成的アプローチは、スラーや明確な攻撃的語彙が存在しないケースにおいても、内面的中毒性の検出において優れた性能を示した。
  • 質的分析の結果、モデルの予測は攻撃的キーワードに対してより頑健であり、LIMEの分析では、非攻撃的トークンが正しく分類に寄与するケースが多かった。
  • 二値ラベルの監視を避けることで、マイノリティのグループの言及と中毒性ラベルの間の誤った相関関係の利用リスクが低減された。
  • 倫理的懸念として、二重用途の悪用の可能性や、事前学習データから中毒的コンテンツおよび関連判断を除去した場合の自己診断の脆弱性が指摘された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。