Skip to main content
QUICK REVIEW

[论文解读] I Am Not Them: Fluid Identities and Persistent Out-group Bias in Large Language Models

Wenchao Dong, Assem Zhunis|arXiv (Cornell University)|Feb 16, 2024
Computational and Text Analysis Methods被引用 4
一句话总结

本研究通过在西方与东方语言中为大型语言模型(LLMs)赋予个人主义或集体主义人格,探究了其在群体外偏见方面的问题。利用经过验证的文化与政治调查问卷,研究发现LLMs对群体外价值观表现出显著更强的负面偏见——其程度最高可达对群体内积极态度的三倍,凸显了即使在中性提示下,心理上的群体外歧视依然存在。

ABSTRACT

We explored cultural biases-individualism vs. collectivism-in ChatGPT across three Western languages (i.e., English, German, and French) and three Eastern languages (i.e., Chinese, Japanese, and Korean). When ChatGPT adopted an individualistic persona in Western languages, its collectivism scores (i.e., out-group values) exhibited a more negative trend, surpassing their positive orientation towards individualism (i.e., in-group values). Conversely, when a collectivistic persona was assigned to ChatGPT in Eastern languages, a similar pattern emerged with more negative responses toward individualism (i.e., out-group values) as compared to collectivism (i.e., in-group values). The results indicate that when imbued with a particular social identity, ChatGPT discerns in-group and out-group, embracing in-group values while eschewing out-group values. Notably, the negativity towards the out-group, from which prejudices and discrimination arise, exceeded the positivity towards the in-group. The experiment was replicated in the political domain, and the results remained consistent. Furthermore, this replication unveiled an intrinsic Democratic bias in Large Language Models (LLMs), aligning with earlier findings and providing integral insights into mitigating such bias through prompt engineering. Extensive robustness checks were performed using varying hyperparameter and persona setup methods, with or without social identity labels, across other popular language models.

研究动机与目标

  • 探究当大型语言模型(LLMs)被赋予特定文化身份时,是否表现出群体外偏见,依据社会身份理论。
  • 检验此类偏见是否在语言与文化边界之间持续存在,尤其是西方(个人主义)与东方(集体主义)语言群体之间。
  • 评估在政治领域中群体外偏见的稳健性,使用与美国政治文化一致的上下文特定提示。
  • 探索提示工程——特别是使用对立人格——是否能缓解LLMs中既有的意识形态偏见。
  • 提供一种使用标准化调查工具和人格提示法测量LLMs中社会文化偏见的方法论框架。

提出的方法

  • 通过在六种语言中使用基于角色的提示,为LLMs(ChatGPT、Gemini、Llama)赋予个人主义或集体主义人格:英语、德语、法语(西方语言)以及中文、日语、韩语(东方语言)。
  • 应用经过验证的文化调查问题,衡量个人主义与集体主义,以量化模型回应中对群体内与群体外价值观的一致性。
  • 在政治领域复现实验,使用改编的《政治光谱测试》问题(英语),以评估意识形态偏见。
  • 通过调整超参数、人格定义,以及是否明确标注社会身份标签,进行广泛的稳健性检验。
  • 将偏见度量为群体内与群体外价值观响应得分的差异,负分表示对群体外的歧视。
  • 通过使用对立人格(如为倾向自由主义的模型使用共和党人格)进行反向提示,评估缓解潜力,以中和既有的偏见。

实验结果

研究问题

  • RQ1在社会身份理论的定义下,LLMs在被提示文化身份时,其群体外偏见的程度如何?
  • RQ2在个人主义与集体主义文化框架下,多语言LLMs中群体外偏见的强度是否超过对群体内的偏爱?
  • RQ3群体外偏见是否可在政治领域中复现?其强度与方向与文化偏见相比如何?
  • RQ4使用对立人格的提示工程是否能有效减少或中和LLMs中既有的意识形态偏见?
  • RQ5这些偏见模式在不同语言模型与语言环境(西方 vs. 东方语言)中的一致性如何?

主要发现

  • LLMs表现出显著强于对群体内偏爱的群体外偏见,群体外歧视的强度平均可达对群体内积极态度的三倍。
  • 在西方语言中,当为ChatGPT赋予个人主义人格时,其对集体主义(群体外)的回应更为负面,而对个人主义(群体内)的回应则更为正面。
  • 在东方语言中,赋予集体主义人格导致模型对个人主义(群体外)的评价更为负面,而对集体主义(群体内)的评价更为正面,证实了对称的偏见模式。
  • 政治领域的复现结果确认了持续存在的群体外偏见,LLMs表现出与先前发现一致的可测量的民主党倾向。
  • 通过使用对立人格(如为倾向自由主义的模型使用共和党人格)进行提示工程,可减少但无法完全消除既有的意识形态偏见。
  • 稳健性检验确认了在不同超参数、人格定义,以及是否明确标注社会身份标签的情况下,偏见模式保持一致,表明这是一种系统性偏见而非人为产物。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。