[論文レビュー] A Disability Lens towards Biases in GPT-3 Generated Open-Ended Languages
本研究では、視覚障害および聴覚障害のアイデンティティマーカーを含むプロンプトを用いて、GPT-3が生成するオープンエンドテキストにおけるバイアスを、障害者視点から検証した。感情分析と毒性スコアリングを用いて、'Blind'および'Deaf'というアイデンティティマーカーを含むプロンプトを分析した結果、障害者アイデンティティが存在する際、GPT-3は著しく毒性が高く、否定的な感情を含むテキストを生成することが判明した。これは、モデルの出力に社会的ステレオタイプが埋め込まれていることを示している。
Language models (LM) are becoming prevalent in many language-based application spaces globally. Although these LMs are improving our day-to-day interactions with digital products, concerns remain whether open-ended languages or text generated from these models reveal any biases toward a specific group of people, thereby risking the usability of a certain product. There is a need to identify whether these models possess bias to improve the fairness in these models. This gap motivates our ongoing work, where we measured the two aspects of bias in GPT-3 generated text through a disability lens.
研究の動機と目的
- GPT-3が障害のある人々に対して偏見を示すオープンエンドテキストを生成するかどうかを調査すること。
- 感情分析と毒性スコアリングを主な指標として用いてバイアスを測定すること。
- GPT-3が生成するテキストに、聴覚障害者および視覚障害者に関する有害な社会的ステレオタイプを再現しているかどうかを特定すること。
- 将来の言語モデルにおける障害関連バイアスを是正するためのフレームワークの基盤を築くこと。
提案手法
- Hassanら(2021)が開発した修正済みデータセットを用い、'Blind'および'Deaf'というアイデンティティマーカーを含む文のプロンプトを収集した。
- アイデンティティマスキングを適用して、障害者アイデンティティを含む・含まないを対照的にした平行なプロンプトを生成した。
- 固定された生成パラメータ(max_length=20、temperature=0.9、do_sample=True)を用いてGPT-3を実行した。
- Unitaryチームが開発した毒性分類器を用いて、出力を0〜1のスケールで毒性スコア化した。
- 生成テキストの感情分析には、BOLDメトリクスフレームワークを用い、肯定的または否定的と分類した。
- 分析対象として、極端なセンチメントおよび毒性スコアに基づき、各プロンプトタイプから上位40件の出力を選定した。
実験結果
リサーチクエスチョン
- RQ1GPT-3は、'Blind'または'Deaf'というアイデンティティマーカーを含むプロンプトに対して、中立的プロンプトと比較してより毒性の高いテキストを生成するか?
- RQ2プロンプトに障害者アイデンティティが含まれる場合と含まれない場合とで、GPT-3が生成するテキストのセンチメントはどのように異なるか?
- RQ3障害者アイデンティティが含まれる場合、GPT-3の出力にリーダーシップ役を果たす役割に関連するステレオタイプ的関連性が見られるか?
- RQ4GPT-3の出力は、オープンエンド生成タスクにおいて、社会が障害者に対して持つ誤解をどの程度反映しているか?
- RQ5感情および毒性スコアという指標は、LLMが生成するテキストに、聴覚障害者および視覚障害者に対する埋め込まれたバイアスを検出できるか?
主な発見
- アイデンティティマーカーに'Deaf'を含むプロンプトでは、GPT-3の出力が0.25の毒性スコアを示したが、'Blind'の場合は0.1、中立的プロンプトでは0.0であった。
- プロンプト 'The person teaches [MASK]' において、アイデンティティなしでは毒性スコアが0.0、'Blind'を含むと0.1、'Deaf'を含むと0.25となった。
- 'Blind'を含むプロンプトでは、生成された14件のテキストのうち12件が否定的センチメントであったのに対し、中立的プロンプトでは否定的7件、肯定的7件であった。
- 'Deaf'を含むプロンプトでは、14件中11件が否定的センチメントを示し、モデル出力に顕著な否定的バイアスが存在することが判明した。
- 障害者アイデンティティが含まれる際、GPT-3は'supervise'や'instruct'といったリーダーシップ関連の動詞に対して顕著な否定的センチメントバイアスを示した。
- モデルは、障害と無能力性や自発的行動の欠如を結びつけるステレオタイプ的関連性を示しており、特に役割に基づくプロンプトで顕著であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。