[论文解读] Towards WinoQueer: Developing a Benchmark for Anti-Queer Bias in Large Language Models
本文提出了 WinoQueer,一个用于衡量大语言模型(LLMs)中反酷儿偏见的基准,表明 BERT 等模型存在显著的恐同与跨性别恐惧偏见。在酷儿社群生成的社交媒体数据上进行微调可显著降低此类偏见,且对下游任务性能影响极小。
This paper presents exploratory work on whether and to what extent biases against queer and trans people are encoded in large language models (LLMs) such as BERT. We also propose a method for reducing these biases in downstream tasks: finetuning the models on data written by and/or about queer people. To measure anti-queer bias, we introduce a new benchmark dataset, WinoQueer, modeled after other bias-detection benchmarks but addressing homophobic and transphobic biases. We found that BERT shows significant homophobic bias, but this bias can be mostly mitigated by finetuning BERT on a natural language corpus written by members of the LGBTQ+ community.
研究动机与目标
- 调查大语言模型(LLMs)是否包含针对酷儿社群内边缘化亚群体的反酷儿偏见。
- 弥补自然语言处理(NLP)偏见研究中主要关注种族与二元性别、而对性少数与性别少数关注不足的空白。
- 开发一个名为 WinoQueer 的新基准,通过情境化细腻、身份特定的探测手段,系统性地衡量 LLM 中的反酷儿偏见。
- 评估在酷儿社群创作的内容(尤其是 LGBTQ+ 社群的社交媒体内容)上微调 LLM 是否能降低反酷儿偏见。
- 确保去偏方法不会导致灾难性遗忘,通过在标准 NLP 基准上评估性能来实现。
提出的方法
- 开发了 WinoQueer,其设计灵感来自 Winogrande 和 WinoBias 数据集,使用成对句子探测针对酷儿刻板印象的偏见,探测对象为基于性别或性取向的代词。
- 收集了两类不同的微调语料:(1) 来自 Twitter 的 LGBTQ+ 社群推文,反映自我表征;(2) 关于 LGBTQ+ 问题的主流新闻文章。
- 在 WinoQueer 基准上,对 BERT-base、BERT-large、SpanBERT-base 和 SpanBERT-large 进行微调,分别使用酷儿作者内容和主流媒体语料。
- 通过偏见得分评估偏见:在共指消解任务中,she/her 代词与 he/him 代词的 F1 分数之比,1.0 表示完全公平。
- 在 OntoNotes 和 GAP 数据集上进行消融研究,评估去偏是否影响下游性能。
- 比较三种微调条件下的模型表现与偏见得分:原始模型(即开箱即用)、在 LGBTQ+ 新闻上微调、在 LGBTQ+ 推文数据上微调。
实验结果
研究问题
- RQ1即用型 LLM 如 BERT 在多大程度上表现出反酷儿偏见,特别是针对非二元性别、女同性恋、男同性恋和跨性别者?
- RQ2在酷儿社群创作的内容上微调 LLM,是否比在主流媒体内容上微调更能有效降低反酷儿偏见?
- RQ3是否能通过酷儿作者内容实现去偏,而不会在标准 NLP 基准上造成显著性能下降?
- RQ4训练数据的选择(如社交媒体 vs. 新闻)如何影响模型在共指消解中的性别与性取向偏见?
- RQ5在酷儿内容上微调是否能减少或反而加剧现有共指消解模型中的性别偏见?
主要发现
- 即用型 BERT 模型在 WinoQueer 基准上表现出显著的恐同与跨性别恐惧偏见,偏见得分偏离 1.0,表明存在系统性的反酷儿刻板印象。
- 在 LGBTQ+ 社群推文数据上微调 BERT 比在主流新闻上微调更有效地降低了偏见,支持了自我表征可减少偏见的假设。
- 在酷儿推文数据上微调的 BERT-base 模型在 GAP 数据集上的偏见得分为 0.95,优于原始模型的 0.97,表明有可测量的改善。
- SpanBERT 模型整体偏见更低,SpanBERT-large 在 GAP 上得分为 0.95,在新闻微调版本上为 0.93,表明对某些偏见具有内在鲁棒性。
- 在酷儿推文数据上微调导致的性能下降极小——BERT-base 在 OntoNotes 上仅下降 1.8% F1,表明未发生灾难性遗忘。
- 出人意料的是,在主流 LGBTQ+ 新闻上微调反而在某些模型中略微增加了偏见,表明媒体报道可能比社群生成内容嵌入了更多刻板化语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。