Skip to main content
QUICK REVIEW

[論文レビュー] Probing Explicit and Implicit Gender Bias through LLM Conditional Text Generation

Xiangjue Dong, Yibo Wang|arXiv (Cornell University)|Nov 1, 2023
Topic Modeling被引用数 7
ひとこと要約

本稿は、事前定義された性別に関するフレーズやステレオタイプに依存せずに、大規模言語モデル(LLM)における明示的および暗黙的性別バイアスを調査するための条件付きテキスト生成フレームワークを提案する。テンプレートベース、LLMによる生成、自然に得られた入力の3つのアプローチを用いることで、明示的な性別的キーワードが存在しない状況下でも、LLMがログティスおよび生成テキストにおいて顕著な性別バイアスを示すことが明らかになった。モデルサイズの増大が公平性を保証するものではない。

ABSTRACT

Large Language Models (LLMs) can generate biased and toxic responses. Yet most prior work on LLM gender bias evaluation requires predefined gender-related phrases or gender stereotypes, which are challenging to be comprehensively collected and are limited to explicit bias evaluation. In addition, we believe that instances devoid of gender-related language or explicit stereotypes in inputs can still induce gender bias in LLMs. Thus, in this work, we propose a conditional text generation mechanism without the need for predefined gender phrases and stereotypes. This approach employs three types of inputs generated through three distinct strategies to probe LLMs, aiming to show evidence of explicit and implicit gender biases in LLMs. We also utilize explicit and implicit evaluation metrics to evaluate gender bias in LLMs under different strategies. Our experiments demonstrate that an increased model size does not consistently lead to enhanced fairness and all tested LLMs exhibit explicit and/or implicit gender bias, even when explicit gender stereotypes are absent in the inputs.

研究の動機と目的

  • 従来の性別バイアス評価手法が事前定義された性別フレーズやステレオタイプに依存するという限界を是正すること。
  • 入力に直接的な性別的参照やステレオタイプが存在しない場合でも、LLMにおける明示的および暗黙的性別バイアスを検出すること。
  • 多様な入力戦略を用いた、隠れたバイアスを解明するためのプロービングフレームワークの開発。
  • 異なるモデルサイズにおける公平性を評価し、より大きなモデルが本質的にバイアスが少ないかどうかを特定すること。
  • 明示的な性別的キーワードが存在しない状況下でも、ログティスおよび生成テキストに性別バイアスが生じることを示すこと。

提案手法

  • 3つの異なるプロービング戦略を設計:テンプレートベース(職業、趣味、色などステレオタイプ的属性を用いる)、LLM生成(モデル出力を入力として使用)、自然に得られた(STS-Bコーパスからの)。
  • これらの入力をもとにLLMを条件づけ、ジェンダーニックネームの使用と分布上の不均衡に注目して継続生成を行う。
  • 明示的指標(例:彼女 vs 彼のジェンダーニックネームの共起比)と暗黙的指標(ジェンダーニック語のログティスにおけるJensen-Shannon発散(JSD))を用いる。
  • ログティスを分析することで、テキスト生成の前段階でのバイアスを検出。出力テキストに見えない、潜在的なバイアスを明らかにする。
  • 複数のLLM(例:LLaMAバリアント)にこのフレームワークを適用し、モデルサイズによる公平性の比較を行う。
  • 事例研究を通じてバイアスパターンを可視化。生成テキストが中立に見える場合でも、ログティスにバイアスが存在することが示された。

実験結果

リサーチクエスチョン

  • RQ1入力に明示的な性別関連フレーズやステレオタイプが存在しない場合でも、LLMにおける性別バイアスを検出できるか?
  • RQ2テンプレートベース、LLM生成、自然に得られた入力という異なるプロービング戦略が、明示的および暗黙的性別バイアスの検出にどのように影響するか?
  • RQ3モデルサイズの増大が、性別バイアス軽減において一貫して公平性を向上させるのか?
  • RQ4性別バイアスはどの程度、モデルのログティスと最終的な生成テキストに反映されているか?
  • RQ5職業、趣味、性格など、どの属性がLLM出力において最も高いレベルの性別バイアスを示すか?

主な発見

  • 入力に明示的な性別ステレオタイプが存在しない状況下でも、LLaMA-7B や LLaMA-70B-chat といったLLMは、ニックネームの使用とログティスにおいて顕著な性別バイアスを示す。
  • ジェンダーニック語の分布のJSDスコアは、モデルやプロービング戦略によって変動し、モデルサイズと公平性の間に一貫した関係は認められない。
  • LLaMA-70B-chat は、テンプレートベースおよびLLM生成入力において、最高のJSDスコアを示し、これらの設定でより強いバイアス検出が可能であることを示した。
  • 属性の中で特に高い性別バイアスを示したのは、「看護師」「整備士」「大工」「手芸」「木工」「洗練された」などであった。
  • 「友達が電話で話している」といった性別に中立的な文脈でも、モデルは女性関連のニックネーム(例:彼女、彼女の)をより高い確率で割り当てる傾向がある。
  • 一部の事例では、ログティスにバイアスが存在するが、最終的な生成テキストにはバイアスが現れないことがあり、これはモデル内部の分析が表面的な出力だけでは不十分であることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。