Skip to main content
QUICK REVIEW

[論文レビュー] QueerBench: Quantifying Discrimination in Language Models Toward Queer Identities

Mae Sosto, Alberto Barrón‐Cedeño|arXiv (Cornell University)|Jun 18, 2024
Gender Studies in Language被引用数 4
ひとこと要約

この論文は、テンプレートベースのアプローチとマスキング言語モデル(MLM)を用いて、英語の大規模言語モデル(LLM)におけるLGBTQIA+への偏見を定量化する新しいフレームワーク、QueerBenchを紹介する。LLMは、クィアなアイデンティティが主題である場合、16.9%の割合で有害な完了を生成するが、これは非クィアな主題と比較して7.2%高い。これは、NLPシステムにおけるクィアなアイデンティティに対する構造的な差別を示している。

ABSTRACT

With the increasing role of Natural Language Processing (NLP) in various applications, challenges concerning bias and stereotype perpetuation are accentuated, which often leads to hate speech and harm. Despite existing studies on sexism and misogyny, issues like homophobia and transphobia remain underexplored and often adopt binary perspectives, putting the safety of LGBTQIA+ individuals at high risk in online spaces. In this paper, we assess the potential harm caused by sentence completions generated by English large language models (LLMs) concerning LGBTQIA+ individuals. This is achieved using QueerBench, our new assessment framework, which employs a template-based approach and a Masked Language Modeling (MLM) task. The analysis indicates that large language models tend to exhibit discriminatory behaviour more frequently towards individuals within the LGBTQIA+ community, reaching a difference gap of 7.2% in the QueerBench score of harmfulness.

研究の動機と目的

  • NLPにおけるホモフォビーやトランスフォビーや、特に大規模言語モデル(LLM)における未だ十分に検討されていない問題に対処すること。
  • バイナリーゲンダーの範囲を越えて、LGBTQIA+アイデンティティに対する有害な言語生成を体系的に定量化する方法を開発すること。
  • クィアなアイデンティティと非クィアなアイデンティティの主題に対して、LLMが完了を生成する際の差別的傾向を特定・測定すること。
  • AI生成テキストにおいてジェンダー多様性やクィアな個人を不当に排除する偏見を特定することで、包括的なNLPの促進を図ること。
  • 今後のLGBTQIA+への偏見に関するNLP研究を支援するため、オープンソースのコードとデータを公開すること。

提案手法

  • 標準的で中立的な文脈を用いて、LLMが文の完了を生成するのを引き出すためのテンプレートベースのプロンプティングフレームワークを設計する。
  • クィアなアイデンティティと非クィアなアイデンティティの主題に対して、有害なトークンが予測される可能性を評価するため、マスキング言語モデル(MLM)タスクを採用する。
  • バイナリー、ネオプロンム、中立的プロンムのセットと、クィアに特化した名詞と非クィアの名詞を、主題として使用してモデルの挙動を評価する。
  • 複数回のモデル生成(トップ1およびトップ5の予測)における有害な完了の割合として、QueerBenchスコアを計算する。
  • 異なるプロンムおよび名詞のカテゴリー間で有害性スコアを比較し、バイアスの不均衡を検出する。
  • ベースおよびラージバージョンの複数のLLM(例:BERTweet、RoBERTa、ALBERT)を用いて、スケール効果を評価するため、モデル行動を分析する。

実験結果

リサーチクエスチョン

  • RQ1英語の大規模言語モデル(LLM)は、クィアに特化した名詞が主題である場合と、非クィアな名詞が主題である場合とで、有害な完了の生成にどの程度差があるか。
  • RQ2バイナリー・プロンム、ネオプロンム、中立的プロンムを主題とした場合、LLMにおけるバイアスのレベルはどの程度か。
  • RQ3モデルサイズ(ベース対ラージ)が、LGBTQIA+アイデンティティに対する完了の有害性に顕著な影響を及えるか。
  • RQ4マスキング言語モデルタスクにおいて、LLMはクィアなアイデンティティに対して非クィアなアイデンティティと比較してどの程度差別的行動を示すか。
  • RQ5QueerBenchフレームワークは、再現可能でスケーラブルな方法で、LGBTQIA+への偏見をどのように検出し、定量化するか。

主な発見

  • LLMは、クィアなアイデンティティが主題である場合、平均して16.9%の有害性を示す一方、非クィアなアイデンティティが主題の場合は9.2%にとどまる。
  • クィアなアイデンティティと非クィアなアイデンティティの間で有害性の差は、ピークで7.2%のスコアギャップに達し、これは明確な差別的傾向を示している。
  • プロンムベースの主題では、バイナリー・プロンム(6.1%)で有害性が最も高く、次にネオプロンム(5.4%)、中立的プロンム(4.9%)の順に低い。
  • トップ5の予測では、名詞の主題に対してトップ1の予測と比較して有害性が13%上昇しており、これはモデルの多様性がバイアスを強化することを示唆している。
  • BERTweetのベースモデルは、トップ5の予測においてクィアな主題に対して27%の有害性を示し、これは顕著に高い値であり、データやアーキテクチャに起因するバイアスを示唆している。
  • ラージモデルは、ベースモデルと比較して全体の有害性がわずかに低く(例:クィア名詞では8.2%対11.4%)、しかし差は統計的に有意ではなく、スケールそのものがバイアスを軽減しないことを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。