[论文解读] WinoQueer: A Community-in-the-Loop Benchmark for Anti-LGBTQ+ Bias in Large Language Models
WinoQueer 引入了一种社区参与式循环的基准测试,用于衡量大型语言模型中的反LGBTQ+偏见,其基于LGBTQ+社区提供的调查驱动的刻板印象模板。该研究揭示了多个大型语言模型中存在显著的反酷儿偏见,并表明在社区生成的内容(尤其是社交媒体文本)上进行微调,可以有效减少此类偏见。
We present WinoQueer: a benchmark specifically designed to measure whether large language models (LLMs) encode biases that are harmful to the LGBTQ+ community. The benchmark is community-sourced, via application of a novel method that generates a bias benchmark from a community survey. We apply our benchmark to several popular LLMs and find that off-the-shelf models generally do exhibit considerable anti-queer bias. Finally, we show that LLM bias against a marginalized community can be somewhat mitigated by finetuning on data written about or by members of that community, and that social media text written by community members is more effective than news text written about the community by non-members. Our method for community-in-the-loop benchmark development provides a blueprint for future researchers to develop community-driven, harms-grounded LLM benchmarks for other marginalized communities. Note: This version corrects a bug found in evaluation code after publication. General findings have not changed, but tables 5 and 6 and figure 1 have been corrected.
研究动机与目标
- 为解决在评估大型语言模型偏见时,缺乏基于LGBTQ+社区真实世界伤害经验的基准测试的问题。
- 开发一种以LGBTQ+个体的亲身经历和自报刻板印象为核心的偏见评估框架。
- 探究在LGBTQ+社区创作或关于该群体的内容上进行微调,是否能够减少反酷儿偏见。
- 创建一种可扩展、社区驱动的方法,用于为其他边缘化身份构建偏见基准测试。
- 突出现有基准测试在捕捉LGBTQ+群体内部交叉性身份和非二元性别身份方面的局限性。
提出的方法
- 通过向LGBTQ+个体进行调查,开发了一种新颖的社区参与式循环方法,以识别有害且普遍存在的反LGBTQ+刻板印象。
- 基于调查反馈生成句子模板,并将其嵌入Winograd风格的指代消解任务中,以测试模型的预测结果。
- 利用九个LGBTQ+身份子群体构建WinoQueer基准测试,其代词和姓名反映西方、顺性别和异性恋的规范。
- 使用自定义评分函数评估7种主流大型语言模型(BERT、RoBERTa、ALBERT、BART、GPT2、OPT、BLOOM),以衡量模型预测中的偏见。
- 在两组语料上对模型进行微调:关于LGBTQ+社区的新闻文章(Media Cloud)和LGBTQ+个体发布的社交媒体帖子(Twitter),并比较其去偏效果。
- 采用WinoQueer评分(范围为0至100)量化偏见,其中50分表示无偏见,高于50分表示模型更可能将负面刻板印象应用于LGBTQ+个体。

实验结果
研究问题
- RQ1现成的大型语言模型在多大程度上会内化LGBTQ+社区报告的反LGBTQ+刻板印象?
- RQ2在LGBTQ+个体创作的内容上进行微调,是否比在非LGBTQ+记者撰写的新闻内容上进行微调,更能有效减少反酷儿偏见?
- RQ3不同类型训练数据(新闻媒体与社交媒体)如何影响大型语言模型中反LGBTQ+偏见的缓解?
- RQ4当前基准测试在多大程度上未能捕捉到交叉性身份或非西方性别与性取向身份?
- RQ5WinoQueer评分低于50意味着什么?此类评分在模型公平性评估中应如何解释?
主要发现
- 所有评估的大型语言模型均表现出显著的反酷儿偏见,WinoQueer评分远高于50,表明模型强烈倾向于将负面特质与LGBTQ+身份关联。
- 在LGBTQ+个体撰写的社交媒体文本上进行微调,比在非LGBTQ+记者撰写的新闻文章上进行微调,更有效地降低了偏见。
- 在社区生成内容上微调的模型在WinoQueer评分上表现出可测量的改进,证明了训练数据中代表性增强可缓解有害刻板印象。
- 部分微调后的模型在WinoQueer基准测试中得分低于50,表明其更可能将负面刻板印象应用于顺性别和异性恋个体,引发对无意偏见转移的担忧。
- 该基准测试在非西方姓名、非二元代词和交叉性身份的代表性方面存在局限,凸显了当前覆盖范围的不足。
- 本研究强调了社区参与在偏见基准开发中的重要性,因为传统众包方法无法捕捉到与社区相关的特定伤害。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。