Skip to main content
QUICK REVIEW

[論文レビュー] Queer People are People First: Deconstructing Sexual Identity Stereotypes in Large Language Models

Harnoor Dhingra, Preetiha Jayashanker|arXiv (Cornell University)|Jun 30, 2023
Topic Modeling被引用数 7
ひとこと要約

この論文は、生成されたテキストにおけるレズビアン・ゲイ・バイセクシュアル(LGBTQ)個人に対する表象バイアスを測定し、それを軽減する手法を検討している。チェーン・オブ・スコウ(chain-of-thought)プロンプティングとSHAP分析を用いて、レズビアン・ゲイ・バイセクシュアルのアイデンティティに関連する低 regards 語を同定し、文脈を保持したまま regard スコアを向上させるための事後的テキスト・トゥ・テキスト スタイル転送手法を適用することで、肯定的でバイアスのない LLM 出力のための有望なデバイアス化手法を示している。

ABSTRACT

Large Language Models (LLMs) are trained primarily on minimally processed web text, which exhibits the same wide range of social biases held by the humans who created that content. Consequently, text generated by LLMs can inadvertently perpetuate stereotypes towards marginalized groups, like the LGBTQIA+ community. In this paper, we perform a comparative study of how LLMs generate text describing people with different sexual identities. Analyzing bias in the text generated by an LLM using regard score shows measurable bias against queer people. We then show that a post-hoc method based on chain-of-thought prompting using SHAP analysis can increase the regard of the sentence, representing a promising approach towards debiasing the output of LLMs in this setting.

研究の動機と目的

  • 事前学習された LLM が生成するテキストにおいて、LGBTQの人々に対する測定可能で数量化可能なバイアスを蓄積しているかどうかを調査すること。
  • 社会的認識を反映する「regard スコア」という指標を用いて、表象バイアスを定量化すること。
  • 文脈の整合性を保ちながら、LGBTQ関連の対象に対する regard スコアを向上させる、事後的デバイアス化手法を開発・評価すること。
  • LLM 出力における低 regards 語のパターンが、説明可能な AI 技術を用いて体系的に同定され、再ライティング可能であることを示すこと。

提案手法

  • 性別に中立的な自己伝記(WikiBio データセットより)を、混同要因を最小限に抑えるために文脈的に豊かで匿名化されたプロンプトとして使用した。
  • 性的指向を示すキーワード(例:「ヘテロセクシュアル」「ゲイ」「Lesbian」)をプロンプトに前置することで、アイデンティティに特化した LLM 出力を得た。
  • 生成された記述の社会的認識を測定するために、Sheng ら(2019)の regard スコアが使用された。
  • regard クラスファイアの分析に SHAP を適用し、LGBTQアイデンティティの出力で低 regard スコアを引き起こす特定の語を同定した。
  • 低 regard スコアを示す語を置き換えることで、意味的整合性を保ちながら低 regard 文を再ライティングする、事後的テキスト・トゥ・テキスト スタイル転送手法を考案した。
  • チェーン・オブ・スコウプロンプティングを用いて、LLM が低 regard 語を同定・置換するのを支援し、文脈の根幹を変更せずに regard スコアを向上させた。

実験結果

リサーチクエスチョン

  • RQ1RQ1: 事前学習された LLM は、生成テキストにおいて、LGBTQの人々に対する測定可能で数量化可能なバイアスを蓄積しているか?
  • RQ2RQ2: 事後的デバイアス化手法を用いることで、文脈的情報を保持したまま、そのバイアスを軽減できるか?
  • RQ3RQ3: SHAP とチェーン・オブ・スコウプロンプティングは、LLM 出力における低 regard 語のパターンをどの程度体系的に同定・是正できるか?

主な発見

  • LLM は、ヘテロセクシュアルとされる人物よりも、LGBTQとされる人物に対して顕著に低い regard スコアを生成しており、測定可能な表象バイアスが存在することが示された。
  • LGBTQアイデンティティを示すキーワードを用いたプロンプトは、苦闘や慈善活動に焦点を当てた出力をもたらした一方、ヘテロセクシュアルとされる人物は、主に職業的成功について述べられていた。
  • SHAP 分析により、regard スコアの低下に関連する特定の語(例:「ゲイ」)が、モデル出力で低 regard スコアを引き起こす原因として明確に同定された。
  • チェーン・オブ・スコウプロンプティングにより、LLM が低 regard 語を同定・置換でき、文の根幹的な意味的コンテンツを変更せずに regard スコアを向上させた。
  • 事後的デバイアス化手法は、文脈的情報を保持しながら regard スコアを向上させた。これにより、的確かつ文脈を保全するバイアス軽減の可能性が示された。
  • 結果として、LGBTQの人々は、性別に中立的かつ事実的に同等の自己伝記を提示された場合でも、LLM 出力において体系的に低い社会的認識を受けることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。