Skip to main content
QUICK REVIEW

[论文解读] QueerBench: Quantifying Discrimination in Language Models Toward Queer Identities

Mae Sosto, Alberto Barrón‐Cedeño|arXiv (Cornell University)|Jun 18, 2024
Gender Studies in Language被引用 4
一句话总结

本文提出了 QueerBench,一种新颖的框架,通过基于模板的方法和掩码语言建模,量化英语大语言模型(LLMs)中的反LGBTQIA+偏见。结果显示,当酷儿身份作为主题时,LLMs 生成有害补全内容的频率为 16.9%,比非酷儿主题高出 7.2%,凸显了 NLP 系统中对酷儿身份存在的系统性歧视。

ABSTRACT

With the increasing role of Natural Language Processing (NLP) in various applications, challenges concerning bias and stereotype perpetuation are accentuated, which often leads to hate speech and harm. Despite existing studies on sexism and misogyny, issues like homophobia and transphobia remain underexplored and often adopt binary perspectives, putting the safety of LGBTQIA+ individuals at high risk in online spaces. In this paper, we assess the potential harm caused by sentence completions generated by English large language models (LLMs) concerning LGBTQIA+ individuals. This is achieved using QueerBench, our new assessment framework, which employs a template-based approach and a Masked Language Modeling (MLM) task. The analysis indicates that large language models tend to exhibit discriminatory behaviour more frequently towards individuals within the LGBTQIA+ community, reaching a difference gap of 7.2% in the QueerBench score of harmfulness.

研究动机与目标

  • 为解决 NLP 领域中同性恋恐惧和跨性别恐惧问题,特别是大语言模型(LLMs)中的此类问题。
  • 开发一种系统化方法,量化针对 LGBQTIA+ 身份的有害语言生成,尤其关注超越二元性别规范的情况。
  • 揭示并测量 LLM 在生成酷儿身份与非酷儿身份主题的补全内容时所表现出的歧视性倾向。
  • 通过识别在 AI 生成文本中边缘化性别多元和酷儿个体的偏见,推动 NLP 的包容性发展。
  • 发布开源代码和数据,以支持未来对 NLP 中反LGBTQIA+偏见的研究。

提出的方法

  • 设计基于模板的提示框架,利用标准化、中性的上下文,从 LLM 中提取句子补全。
  • 采用掩码语言建模(MLM)任务,评估在回应酷儿和非酷儿主题时,有害标记被预测的可能性。
  • 使用经过筛选的代词集合(二元代词、新式代词、中性代词)和名词集合(酷儿身份相关 vs. 非酷儿身份相关)作为主题,以评估模型行为。
  • 将 QueerBench 得分计算为在多次模型生成(top-1 和 top-5 预测)中,有害补全内容所占的百分比。
  • 比较不同代词和名词类别下的有害性得分,以检测偏见失衡情况。
  • 在多个 LLM(如 BERTweet、RoBERTa、ALBERT)的基线和大模型版本中分析模型行为,以评估规模效应。

实验结果

研究问题

  • RQ1当主题为酷儿身份名词与非酷儿名词时,英语 LLM 在生成有害补全内容方面有何差异?
  • RQ2在以二元代词、新式代词和中性代词作为主题时,LLM 的有害性水平如何?
  • RQ3模型规模(基线 vs. 大模型)是否显著影响针对 LGBTQIA+ 身份的补全内容的有害性?
  • RQ4在掩码语言建模任务中,LLM 对酷儿身份相较于非酷儿身份表现出多大程度的歧视性行为?
  • RQ5QueerBench 框架如何以可复现且可扩展的方式检测并量化反LGBTQIA+偏见?

主要发现

  • LLMs 在生成酷儿主题补全时表现出显著更高的有害性,平均 QueerBench 得分为 16.9%,而针对非酷儿主题的得分为 9.2%。
  • 酷儿主题与非酷儿主题之间的有害性差异在 QueerBench 得分中达到峰值 7.2% 的差距,表明存在可测量的歧视。
  • 在代词主题中,有害性最高的是二元代词(6.1%),其次是新式代词(5.4%),最低的是中性代词(4.9%)。
  • 对于名词主题,top-5 预测的有害性比 top-1 预测高出 13%,表明模型多样性会放大偏见。
  • BERTweet 基线模型在酷儿主题的 top-5 预测中表现出不成比例的高有害性(27%),提示可能存在数据或架构相关的偏见。
  • 大模型的整体有害性略低于基线模型(例如,酷儿名词的有害性分别为 8.2% 和 11.4%),但差异无统计学显著性,表明规模本身并不能有效降低偏见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。