Skip to main content
QUICK REVIEW

[論文レビュー] Towards Auditing Large Language Models: Improving Text-based Stereotype Detection

Wu Zekun, Sahan Bulathwela|arXiv (Cornell University)|Nov 23, 2023
Natural Language Processing Techniques被引用数 5
ひとこと要約

本稿では、性別、人種、職業、宗教の4つの分野にまたがる52,751件のインスタンスを含む新しいマルチグレインステレオタイプデータセットを紹介し、英語テキスト向けのマルチクラスステレオタイプ分類器を提案する。モデルは1対多のバイナリベースラインを上回り、XAIツールを用いた一貫した特徴量の重要度の評価が可能であり、GPTファミリーのモデルにおいて時間経過に伴い偏見が有意に減少していることが明らかになった。これにより、LLMのステレオタイプ的バイアスを監査するための堅牢なフレームワークが確立された。

ABSTRACT

Large Language Models (LLM) have made significant advances in the recent past becoming more mainstream in Artificial Intelligence (AI) enabled human-facing applications. However, LLMs often generate stereotypical output inherited from historical data, amplifying societal biases and raising ethical concerns. This work introduces i) the Multi-Grain Stereotype Dataset, which includes 52,751 instances of gender, race, profession and religion stereotypic text and ii) a novel stereotype classifier for English text. We design several experiments to rigorously test the proposed model trained on the novel dataset. Our experiments show that training the model in a multi-class setting can outperform the one-vs-all binary counterpart. Consistent feature importance signals from different eXplainable AI tools demonstrate that the new model exploits relevant text features. We utilise the newly created model to assess the stereotypic behaviour of the popular GPT family of models and observe the reduction of bias over time. In summary, our work establishes a robust and practical framework for auditing and evaluating the stereotypic bias in LLM.

研究の動機と目的

  • 大規模言語モデル(LLM)の偏った学習データに起因するステレオタイプ的出力に関する増大する倫理的懸念に対処すること。
  • 性別、人種、職業、宗教の多様な側面を網羅的に捉える、包括的でマルチグレインのデータセットを構築すること。
  • 従来の1対多バイナリアプローチを上回る、新規のステレオタイプ分類器を開発すること。
  • LLMにおけるステレオタイプ的バイアスの評価と監視を可能にする実用的で監査可能なフレームワークを提供すること。
  • GPTファミリーのような人気のあるLLMにおけるバイアスの進化を、時間経過に伴って分析すること。

提案手法

  • 性別、人種、職業、宗教の4つのステレオタイプカテゴリーにまたがる52,751件の人的アノテーション付きインスタンスを含むマルチグレインステレオタイプデータセットの構築。
  • 新規データセット上で学習されたマルチクラスステレオタイプ分類器の設計。この分類器は、英語テキスト内のステレオタイプ的関連性を検出することを目的としている。
  • 複数の説明可能なAI(XAI)ツールを用いて特徴量の重要度信号を検証し、モデルの解釈可能性を保証すること。
  • 比較的評価のため、分類器をマルチクラスおよび1対多バイナリ設定でそれぞれ訓練すること。
  • 訓練済み分類器をGPTファミリーの複数のバージョンに適用し、バイアスの進化を追跡するための監査に応用すること。
  • モデルのパフォーマンスとバイアスのトレンドを比較するための標準化された評価プロトコルの採用。

実験結果

リサーチクエスチョン

  • RQ1マルチクラスステレオタイプ分類器は、従来の1対多バイナリ分類器を上回ってテキストベースのステレオタイプを検出できるか?
  • RQ2複数のXAIツールから一貫した特徴量の重要度信号が得られるか?これは、モデルが信頼できる方法で動作していることを示唆する。
  • RQ3GPTファミリーのモデルにおけるステレオタイプ的バイアスは、異なる世代やバージョンにわたってどのように変化するか?
  • RQ4新規のマルチグレインステレオタイプデータセットは、交差的ステレオタイプ(交差性)の検出をどの程度向上させるか?
  • RQ5提案されたフレームワークは、実装済みのLLMにおけるバイアスの監査と監視に実用的なツールとして利用可能か?

主な発見

  • マルチクラス分類器は1対多バイナリベースラインを上回る優れたパフォーマンスを達成し、一括でのステレオタイプ検出の利点を示した。
  • 複数のXAIツールが一貫した特徴量の重要度信号を生成し、モデルが職業や性別を示す代名詞といった関連する言語的手がかりに依存していることを確認した。
  • モデルはGPTファミリーの後続バージョンにわたってステレオタイプ的出力の有意な減少を検出しており、バイアス低減の進展が示された。
  • マルチグレインステレオタイプデータセットは、性別、人種、職業、宗教にわたる多様で交差的なステレオタイプを効果的に捉えている。
  • 提案されたフレームワークにより、LLMにおけるステレオタイプ的バイアスの体系的監査が可能となり、スケーラブルで解釈可能な評価パイプラインが提供された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。