Skip to main content
QUICK REVIEW

[論文レビュー] WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models

Virginia K. Felkner, Ho-Chun Herbert Chang|arXiv (Cornell University)|Jun 26, 2023
Hate Speech and Cyberbullying Detection被引用数 5
ひとこと要約

WinoQueer は、LGBTQ+コミュニティからのアンケート駆動のステレオタイプテンプレートを用いて、大規模言語モデルにおけるLGBTQ+差別的バイアスを測定するコミュニティ・イン・ザ・ループ型ベンチマークを導入した。この研究では、複数のLLMに顕著な反クィアバイアスが存在することが明らかになり、特にソーシャルメディアのテキストを含むコミュニティが生成したコンテンツで微調整を行うことで、こうしたバイアスを軽減できることが示された。

ABSTRACT

We present WinoQueer: a benchmark specifically designed to measure whether large language models (LLMs) encode biases that are harmful to the LGBTQ+ community. The benchmark is community-sourced, via application of a novel method that generates a bias benchmark from a community survey. We apply our benchmark to several popular LLMs and find that off-the-shelf models generally do exhibit considerable anti-queer bias. Finally, we show that LLM bias against a marginalized community can be somewhat mitigated by finetuning on data written about or by members of that community, and that social media text written by community members is more effective than news text written about the community by non-members. Our method for community-in-the-loop benchmark development provides a blueprint for future researchers to develop community-driven, harms-grounded LLM benchmarks for other marginalized communities. Note: This version corrects a bug found in evaluation code after publication. General findings have not changed, but tables 5 and 6 and figure 1 have been corrected.

研究の動機と目的

  • LLMのバイアス評価において、LGBTQ+コミュニティが経験する現実の害に根ざしたベンチマークが不足しているという問題に対処すること。
  • LGBTQ+個人の生活経験と自らが報告するステレオタイプを核とするバイアス評価フレームワークの開発。
  • LGBTQ+コミュニティが作成したコンテンツ、またはそれについてのコンテンツでLLMを微調整することで、反クィアバイアスを軽減できるかどうかの調査。
  • 他の疎外されたアイデンティティに対してスケーラブルでコミュニティ主導のバイアスベンチマークを構築するための方法論の確立。
  • 現在のベンチマークがLGBTQ+コミュニティ内の交差的アイデンティティや非バイナリー性別の表現を十分に捉えていないという限界を浮き彫りにすること。

提案手法

  • LGBTQ+個人を対象にアンケートを実施し、有害で一般的に広まっている反LGBTQ+ステレオタイプを同定することで、新しいコミュニティ・イン・ザ・ループ手法を開発。
  • アンケートの回答に基づいて文のテンプレートを生成し、それらをWinogradスタイルの共参照タスクに埋め込み、モデルの予測をテスト。
  • 9つのLGBTQ+アイデンティティのサブグループを用いてWinoQueerベンチマークを構築。名前と代名詞は西洋的・ヘテロセクシュアル的・セクシュアル・コンフォーマティーな基準を反映。
  • 独自のスコアリング関数を用いて、7つの代表的なLLM(BERT、RoBERTa、ALBERT、BART、GPT2、OPT、BLOOM)を評価し、モデル予測におけるバイアスを測定。
  • 2つのコーパスでモデルを微調整:LGBTQ+コミュニティに関するニュース記事(Media Cloud)と、LGBTQ+個人によるソーシャルメディア投稿(Twitter)、そのバイアス軽減効果を比較。
  • WinoQueerスコア(0〜100の範囲)を用いてバイアスを定量化。50がバイアスなしを示し、50を超えるスコアはLGBTQ+個人に否定的ステレオタイプを適用する傾向があることを示す。
Figure 1: Difference in WQ score between baseline and finetuned models, for both QueerNews and QueerTwitter finetuning data. Results are averaged across all 16 models we finetuned and separated by LGBTQ+ identity groups.
Figure 1: Difference in WQ score between baseline and finetuned models, for both QueerNews and QueerTwitter finetuning data. Results are averaged across all 16 models we finetuned and separated by LGBTQ+ identity groups.

実験結果

リサーチクエスチョン

  • RQ1オフ・ザ・シェルフのLLMは、コミュニティが報告した反LGBTQ+ステレオタイプをどの程度内蔵しているか?
  • RQ2LGBTQ+個人が作成したコンテンツで微調整することで、LGBTQ+ジャーナリストでない人々が作成したコンテンツで微調整するのと比べて、反クィアバイアスをより効果的に軽減できるか?
  • RQ3ニュースメディアとソーシャルメディアという、異なる種類の訓練データが、LLMにおける反LGBTQ+バイアスの軽減にどのように影響するか?
  • RQ4現在のベンチマークは、どのようにして交差的アイデンティティや非西洋的性別・性的指向アイデンティティを捉えていないか?
  • RQ5WinoQueerスコアが50未満である場合の意味は何か。このようなスコアは、モデルの公平性という観点からどのように解釈すべきか?

主な発見

  • 評価されたすべてのLLMが顕著な反クィアバイアスを示しており、WinoQueerスコアが著しく50を超えており、LGBTQ+アイデンティティに否定的特徴を関連づける強い傾向があることが示された。
  • LGBTQ+個人が書いたソーシャルメディアのテキストで微調整することで、非LGBTQ+ジャーナリストが書いたニュース記事で微調整するのと比べて、バイアス軽減効果が顕著に高まった。
  • コミュニティが生成したコンテンツで微調整されたモデルは、WinoQueerスコアの向上が明確に認められ、訓練データにおける表現の多様性が有害なステレオタイプの軽減に寄与することを示した。
  • 一部の微調整済みモデルはWinoQueerベンチマークで50未満のスコアを記録しており、ヘテロセクシュアルおよびセクシュアル・コンフォーマティーな個人に否定的ステレオタイプを適用する可能性が高まっていることを示し、意図しないバイアスのシフトに関する懸念を呈した。
  • ベンチマークは非西洋的名前、非バイナリー代名詞、交差的アイデンティティの表現を十分にカバーできていないため、現在のカバレッジにおけるギャップを浮き彫りにした。
  • 本研究は、従来のクラウドソーシング手法ではコミュニティ固有の害を捉えきれないことから、バイアスベンチマーク開発におけるコミュニティ参加の重要性を強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。