Skip to main content
QUICK REVIEW

[論文レビュー] Generative Language Models Exhibit Social Identity Biases

Tiancheng Hu, Yara Kyrychenko|arXiv (Cornell University)|Oct 24, 2023
Topic Modeling被引用数 4
ひとこと要約

本研究では、51体の大規模言語モデル(LLMs)が「私たちは…」のような文を完成させるようプロンプトされた際、内集団結束と外集団敵意を含む社会的アイデンティティバイアスを示すことを示している。これらのモデルは、人間が書いたインターネット上のテキストと同等またはそれ以上のバイアスレベルを示しており、偏ったTwitterデータで微調整を施すとバイアスが増幅される。一方、バイアスを含む訓練データを除去することで、顕著にバイアスが低下する。これは、訓練データの選別によってこうしたバイアスを軽減できる可能性を示している。

ABSTRACT

The surge in popularity of large language models has given rise to concerns about biases that these models could learn from humans. We investigate whether ingroup solidarity and outgroup hostility, fundamental social identity biases known from social psychology, are present in 56 large language models. We find that almost all foundational language models and some instruction fine-tuned models exhibit clear ingroup-positive and outgroup-negative associations when prompted to complete sentences (e.g., "We are..."). Our findings suggest that modern language models exhibit fundamental social identity biases to a similar degree as humans, both in the lab and in real-world conversations with LLMs, and that curating training data and instruction fine-tuning can mitigate such biases. Our results have practical implications for creating less biased large-language models and further underscore the need for more research into user interactions with LLMs to prevent potential bias reinforcement in humans.

研究の動機と目的

  • 基礎的および指示微調整済みLLMが、内集団結束や外集団敵意を含む社会的アイデンティティバイアスを示すかどうかを調査すること。
  • LLMが出力するテキストにおけるこうしたバイアスのレベルを、インターネット上のヒトが書いたテキストと比較すること。
  • 偏った訓練データで微調整することにより、LLMにおける社会的アイデンティティバイアスの出現にどのような影響を与えるかを検討すること。
  • 訓練データからバイアスを含む文を除去することで、LLMにおける社会的アイデンティティバイアスが顕著に減少するかどうかを評価すること。
  • LLMが訓練データに存在する社会的バイアスを学習・強化できることを証明し、AIの公平性および人間とAIの相互作用に与える影響を示すこと。

提案手法

  • 本研究では、51体のLLMに「私たちは…」や「彼らは…」から始まる文を完成させるようプロンプトすることで、内集団および外集団表現を引き出すプロンプトベースのアプローチを採用している。
  • 感情分析にはVADERおよびRoBERTaを用い、生成された文を肯定的、否定的、中立的のいずれに分類し、感情極性をバイアスの代理指標として用いている。
  • ロジスティック回帰モデルを用いて、文の長さおよびタイプ対トークン比を制御した上で、内集団文と外集団文における肯定的・否定的感情のオッズ比を推定している。
  • 混合効果ロジスティック回帰モデルを用いて、モデル名をランダム切片として用い、全モデルにわたる内集団結束および外集団敵意の推定値を算出している。
  • 微調整のため、米国の偏ったTwitterデータのコーパスを用い、内集団肯定的文および外集団否定的文の割合を変化させたデータでモデルを訓練し、バイアスに与える影響を評価している。
  • データ選別は、LIWC 2022を用いて「私たちは」または「彼らは」を含む文を抽出し、VADERを用いて感情を分類し、感情スコアが±0.05の閾値を超える文を除外することで実施している。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは、内集団結束や外集団敵意を含む社会的アイデンティティバイアスを示すか?
  • RQ2LLMが出力するテキストにおける内集団結束および外集団敵意のレベルは、ウィキペディア、Reddit、ニュースサイトなどから得たヒトが書いたインターネット上のテキストと比べてどうか?
  • RQ3LLMを偏ったTwitterデータで微調整することは、社会的アイデンティティバイアスを強化するか?
  • RQ4訓練データからバイアスを含む文を削除または低減することで、LLMにおける内集団結束および外集団敵意を顕著に低下させることができるか?
  • RQ5LLMにおける社会的アイデンティティバイアスは、どの程度訓練データの構成に依存しているか?

主な発見

  • テストされた51体のLLMのうち、3体を除く全体制が、「私たちは…」および「彼らは…」というプロンプトに対して測定可能なレベルの内集団結束および外集団敵意を示している。
  • LLMが出力するテキストにおける内集団結束および外集団敵意のレベルは、ウィキペディア、Reddit、ニュースサイトなどから得たヒトが書いたインターネット上のテキストと同等、あるいはそれ以上の水準に達している。
  • 米国の偏ったTwitterデータのコーパスでLLMを微調整すると、内集団結束および外集団敵意の両方が顕著に増加し、モデルが訓練データからバイアスを学習・内省していることを示している。
  • 微調整用データから内集団肯定的文または外集団否定的文(あるいは両方)を除去することで、内集団結束および外集団敵意の両方が顕著に低下し、バイアス低減がデータ選別の手法によって達成可能であることが示された。
  • 内集団肯定的コンテンツが豊富なデータで微調整された場合、内集団結束のオッズ比は顕著に上昇する。一方、外集団否定的コンテンツが存在する場合、外集団敵意のオッズ比はさらに強く上昇する。
  • 本研究では、LLMにおける社会的アイデンティティバイアスが本質的であるのではなく、訓練データから学習されたものであることを確認した。したがって、選択的データフィルタリングによりバイアスを低減できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。