[论文解读] Intersectional Bias in Causal Language Models
本文通过从结合性别、宗教和残疾类别的提示中生成文本并分析情感,研究了因果语言模型(GPT-2 和 GPT-NEO)中的交叉偏见。研究发现,偏见在单一类别和交叉类别中均持续存在,对模型规模和上下文具有鲁棒性,并以不可预测且非加法的方式表现,因此需要超越单一类别方法的针对性缓解策略。
To examine whether intersectional bias can be observed in language generation, we examine \emph{GPT-2} and \emph{GPT-NEO} models, ranging in size from 124 million to ~2.7 billion parameters. We conduct an experiment combining up to three social categories - gender, religion and disability - into unconditional or zero-shot prompts used to generate sentences that are then analysed for sentiment. Our results confirm earlier tests conducted with auto-regressive causal models, including the \emph{GPT} family of models. We also illustrate why bias may be resistant to techniques that target single categories (e.g. gender, religion and race), as it can also manifest, in often subtle ways, in texts prompted by concatenated social categories. To address these difficulties, we suggest technical and community-based approaches need to combine to acknowledge and address complex and intersectional language model bias.
研究动机与目标
- 调查当多个社会类别(性别、宗教、残疾)在提示中组合时,因果语言模型中是否会出现交叉偏见。
- 评估这些模型中的偏见是否对模型规模增加和训练数据多样性提升具有鲁棒性。
- 评估针对单一类别的偏见缓解技术在应用于交叉社会身份时的局限性。
- 探讨在 NLP 系统中检测和应对复杂交叉偏见所需的工程技术与社区参与方法。
提出的方法
- 本研究使用参数范围从 1.24 亿到 27 亿的 GPT-2 和 GPT-NEO 模型,通过零样本、无条件提示生成文本,提示中组合最多三个社会类别:性别、宗教和残疾。
- 使用自动化分类方法对生成的文本进行情感分析,以衡量不同社会类别组合下的偏见水平。
- 通过比较单一类别及其交集的 sentiment 分数,识别出非加法或定性不同的偏见模式。
- 应用主题建模以检查生成内容中可能支撑情感差异的定性变化。
- 评估提示变化和上下文对偏见表达的影响,包括微小提示变化如何改变情感排名。
- 提出技术与社区参与相结合的策略,例如标准化偏见报告、魔法提示(magic prompts)以及社区对训练数据的验证,以提升公平性。
实验结果
研究问题
- RQ1与单一类别相比,多个社会类别(如‘女性穆斯林且有残疾’)的组合如何影响语言模型输出的情感?
- RQ2因果语言模型中的交叉偏见在多大程度上对模型规模和训练数据多样性提升具有鲁棒性?
- RQ3当社会类别以复杂方式交叉时,单一类别偏见缓解策略能否有效降低偏见?
- RQ4提示变化和上下文在多大程度上影响交叉身份中偏见的表达和排名?
- RQ5如何通过标准化、社区参与的方法改善对语言模型中交叉偏见的检测与缓解?
主要发现
- 偏见在性别、宗教和残疾类别中持续存在,其中宗教和残疾类别的偏见更强且更持久,而性别类别的偏见相对较弱。
- 与中性或单一类别提示相比,穆斯林以及大多数残疾相关标签(除‘唐氏综合征患者’外)的情感得分显著更差。
- 交叉偏见不遵循加法或可预测的模式;某些组合表现出更强烈的负面情感,而其他组合则产生定性不同的边缘化形式。
- 模型规模增加和训练数据多样性提升无法消除或显著减少交叉偏见,表明其根植于模型架构和数据之中。
- 即使提示变化微小,也能显著改变情感排名和整体偏见表达,凸显上下文敏感性和不可预测性。
- 单一类别偏见缓解策略不足以应对交叉偏见,因为类别的相互作用会产生独特且非线性的偏见模式。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。