[论文解读] Generative Language Models Exhibit Social Identity Biases
本研究表明,当被提示完成如“我们是……”之类的句子时,51个大型语言模型(LLMs)表现出社会身份偏见,包括内群体团结和外群体敌意。这些模型表现出的偏见水平与人类撰写的网络文本相当或更高,而在部分党派立场的推特数据上进行微调会加剧这些偏见——而通过移除有偏见的训练数据则能显著降低偏见,表明训练数据的筛选可以缓解此类偏见。
The surge in popularity of large language models has given rise to concerns about biases that these models could learn from humans. We investigate whether ingroup solidarity and outgroup hostility, fundamental social identity biases known from social psychology, are present in 56 large language models. We find that almost all foundational language models and some instruction fine-tuned models exhibit clear ingroup-positive and outgroup-negative associations when prompted to complete sentences (e.g., "We are..."). Our findings suggest that modern language models exhibit fundamental social identity biases to a similar degree as humans, both in the lab and in real-world conversations with LLMs, and that curating training data and instruction fine-tuning can mitigate such biases. Our results have practical implications for creating less biased large-language models and further underscore the need for more research into user interactions with LLMs to prevent potential bias reinforcement in humans.
研究动机与目标
- 调查基础模型和指令微调的LLM是否表现出内群体团结和外群体敌意等社会身份偏见。
- 将LLM生成文本中的这些偏见水平与互联网上的人类写作文本进行比较。
- 考察在部分党派立场的训练数据上进行微调如何影响LLM中社会身份偏见的出现。
- 评估从训练数据中移除有偏见的句子是否能显著降低LLM中的社会身份偏见。
- 提供证据表明LLM能够学习并放大其训练数据中存在的社会偏见,这对人工智能公平性和人机交互具有影响。
提出的方法
- 本研究采用基于提示的方法,要求51个LLM完成以“我们是……”和“他们……”开头的句子,以引出内群体和外群体的表达。
- 使用VADER和RoBERTa进行情感分析,将生成的句子分类为正面、负面或中性,情感极性用作偏见的代理指标。
- 使用逻辑回归模型估算控制句子长度和类型-词元比率后,内群体与外群体句子为正面或负面情感的几率。
- 使用混合效应逻辑回归模型估算模型整体的内群体团结和外群体敌意,模型名称作为随机截距。
- 在微调中,模型在包含美国党派立场推特数据的语料上进行训练,通过不同比例地移除内群体正面和外群体负面句子,以评估其对偏见的影响。
- 数据筛选通过LIWC 2022识别包含“我们”或“他们”的句子,使用VADER进行情感分类,并移除情感极性高于或低于±0.05阈值的句子。
实验结果
研究问题
- RQ1大型语言模型是否表现出内群体团结和外群体敌意等社会身份偏见?
- RQ2LLM生成文本中的内群体团结和外群体敌意水平与人类撰写的网络文本相比如何?
- RQ3在部分党派立场的推特数据上微调LLM是否会加剧社会身份偏见?
- RQ4通过减少或从训练数据中移除有偏见的句子,是否能显著降低LLM中的内群体团结和外群体敌意?
- RQ5LLM中的社会身份偏见在多大程度上由其训练数据的构成所决定?
主要发现
- 在51个测试LLM中,除三个外,其余均在被提示“我们是……”和“他们……”时表现出可测量的内群体团结和外群体敌意水平。
- LLM生成文本中的内群体团结和外群体敌意水平与人类撰写的网络文本(如维基百科、Reddit和新闻网站)相当,甚至在某些情况下更高。
- 在包含美国党派立场推特数据的语料上对LLM进行微调,导致内群体团结和外群体敌意显著增加,表明模型能够从其训练数据中学习并内化偏见。
- 从微调数据中移除内群体正面或外群体负面句子(或两者)可显著降低内群体团结和外群体敌意,表明通过数据筛选可实现偏见缓解。
- 当模型在富含内群体正面内容的数据上进行微调时,内群体团结的几率比显著增加;当存在外群体负面内容时,外群体敌意的几率比增加得更为显著。
- 本研究证实,LLM中的社会身份偏见并非固有,而是从训练数据中学到的,因此可通过选择性地过滤数据来降低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。