Skip to main content
QUICK REVIEW

[論文レビュー] I Am Not Them: Fluid Identities and Persistent Out-group Bias in Large Language Models

Wenchao Dong, Assem Zhunis|arXiv (Cornell University)|Feb 16, 2024
Computational and Text Analysis Methods被引用数 4
ひとこと要約

本研究では、西洋語と東洋語の両方で、個人主義的または集団主義的アイデンティティを大規模言語モデル(LLM)に与えることで、LLMにおける他集団バイアスを調査する。検証済みの文化的・政治的アンケートを用いて、LLMは他集団価値に対して顕著に否定的であることが判明した。これは、内的グループへの肯定性の約3倍に達する。これは、中立的なプロンプトでも継続的な心理的他集団差別が生じることを示している。

ABSTRACT

We explored cultural biases-individualism vs. collectivism-in ChatGPT across three Western languages (i.e., English, German, and French) and three Eastern languages (i.e., Chinese, Japanese, and Korean). When ChatGPT adopted an individualistic persona in Western languages, its collectivism scores (i.e., out-group values) exhibited a more negative trend, surpassing their positive orientation towards individualism (i.e., in-group values). Conversely, when a collectivistic persona was assigned to ChatGPT in Eastern languages, a similar pattern emerged with more negative responses toward individualism (i.e., out-group values) as compared to collectivism (i.e., in-group values). The results indicate that when imbued with a particular social identity, ChatGPT discerns in-group and out-group, embracing in-group values while eschewing out-group values. Notably, the negativity towards the out-group, from which prejudices and discrimination arise, exceeded the positivity towards the in-group. The experiment was replicated in the political domain, and the results remained consistent. Furthermore, this replication unveiled an intrinsic Democratic bias in Large Language Models (LLMs), aligning with earlier findings and providing integral insights into mitigating such bias through prompt engineering. Extensive robustness checks were performed using varying hyperparameter and persona setup methods, with or without social identity labels, across other popular language models.

研究の動機と目的

  • 大規模言語モデル(LLM)が、社会的アイデンティティ理論に従い、特定の文化的アイデンティティが与えられた際に他集団バイアスを示すかどうかを調査すること。
  • このようなバイアスが、西洋(個人主義的)と東洋(集団主義的)の言語グループ間で言語的・文化的境界を超えて継続するかどうかを検討すること。
  • 米国政治文化に整合した文脈特化プロンプトを用いて、政治的分野における他集団バイアスの頑健性を評価すること。
  • 特に、相反するアイデンティティ(例:リーパブリカンをリーダーシップに持つモデルに対して民主党的アイデンティティを提示)を用いたプロンプト工学が、LLMに内在するイデオロギー的バイアスを軽減できるかどうかを検討すること。
  • 標準化されたアンケート道具とアイデンティティベースのプロンプトを用いた、LLMにおける社会的・文化的バイアスを測定するためのメソドロジカルフレームワークを提供すること。

提案手法

  • ChatGPT、Gemini、LlamaのLLMに、6ヶ国語(英語、ドイツ語、フランス語[西洋]、中国語、日本語、韓国語[東洋])で、ロールベースのプロンプトを用いて個人主義的または集団主義的アイデンティティを埋め込む。
  • 個人主義対集団主義を測定する検証済みの文化的アンケート質問を適用し、モデルの回答における内的グループおよび他集団価値への整合性を定量化する。
  • 米国政治文化に適合した適応版Political Compassテストの質問を用いて、政治的分野におけるバイアスを評価する。
  • ハイパーパramータ、アイデンティティ定義、および明示的な社会的アイデンティティラベルの有無を変えて、広範な頑健性チェックを実施する。
  • バイアスは、内的グループと他集団価値に対する回答スコアの差として測定され、負のスコアは他集団差別を示す。
  • 反対のアイデンティティ(例:リベラル寄りのモデルに対してリーパブリカンのアイデンティティ)を用いた逆プロンプトを実施し、事前に存在するイデオロギー的バイアスの緩和可能性を評価する。

実験結果

リサーチクエスチョン

  • RQ1社会的アイデンティティ理論に基づく文化的アイデンティティがプロンプトされた際、LLMはどの程度他集団バイアスを示すか?
  • RQ2個人主義的および集団主義的文化的枠組みにおいて、多言語LLMにおいて他集団バイアスの大きさが内的グループ好意より大きいとされるか?
  • RQ3政治的分野において他集団バイアスは再現可能か?また、その大きさと方向性は文化的バイアスと比べてどう異なるか?
  • RQ4相反するアイデンティティを用いたプロンプト工学は、LLMに内在する事前のイデオロギー的バイアスを効果的に低減または中和できるか?
  • RQ5これらのバイアスパターンは、異なる言語モデルおよび言語的状況(西洋語対東洋語)において一貫性を示すか?

主な発見

  • LLMは内的グループ好意よりも顕著に強い他集団バイアスを示しており、他集団差別の大きさは内的グループ肯定性の平均で最大3倍に達する。
  • 西洋語で個人主義的アイデンティティが与えられた際、ChatGPTは集団主義(他集団)に対してより否定的な反応を示し、個人主義(内的グループ)への肯定より顕著に低いスコアを示した。
  • 東洋語では、集団主義的アイデンティティが与えられた場合、個人主義(他集団)に対する評価が否定的であり、集団主義(内的グループ)への肯定より顕著に低いスコアを示した。これは、対称的なバイアスパターンを確認した。
  • 政治的分野における再現実験では、継続的な他集団バイアスが確認され、LLMは先行研究と一致する明確な民主党寄りバイアスを示した。
  • リベラル寄りのモデルに対してリーパブリカンのアイデンティティを用いた逆プロンプトにより、事前のイデオロギー的バイアスは軽減されたが、完全には解消されなかった。
  • 頑健性チェックにより、ハイパーパramータ、アイデンティティ定義、および明示的アイデンティティラベルの有無に関わらず、一貫したバイアスパターンが確認され、これはアーティファクトではなくシステム的バイアスであることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。