Skip to main content
QUICK REVIEW

[论文解读] "I'm sorry to hear that": Finding New Biases in Language Models with a Holistic Descriptor Dataset

Eric M. Smith, Melissa Hall|arXiv (Cornell University)|May 18, 2022
Topic Modeling被引用 5
一句话总结

本文提出了 HolisticBias,这是一个大规模、由社区参与构建的数据集,包含近600个跨13个维度的种族/社会身份描述词,旨在揭示语言模型中此前未被发现的偏见。通过将这些描述词与标准化模板结合生成450,000个提示,作者揭示了在标记概率、生成输出和冒犯性分类方面的新偏见——尤其在BlenderBot 2.0等模型中表现明显——同时表明偏见缓解调优可能反而加剧有害的复读行为。

ABSTRACT

As language models grow in popularity, it becomes increasingly important to clearly measure all possible markers of demographic identity in order to avoid perpetuating existing societal harms. Many datasets for measuring bias currently exist, but they are restricted in their coverage of demographic axes and are commonly used with preset bias tests that presuppose which types of biases models can exhibit. In this work, we present a new, more inclusive bias measurement dataset, HolisticBias, which includes nearly 600 descriptor terms across 13 different demographic axes. HolisticBias was assembled in a participatory process including experts and community members with lived experience of these terms. These descriptors combine with a set of bias measurement templates to produce over 450,000 unique sentence prompts, which we use to explore, identify, and reduce novel forms of bias in several generative models. We demonstrate that HolisticBias is effective at measuring previously undetectable biases in token likelihoods from language models, as well as in an offensiveness classifier. We will invite additions and amendments to the dataset, which we hope will serve as a basis for more easy-to-use and standardized methods for evaluating bias in NLP models.

研究动机与目标

  • 通过创建更具代表性的身份术语分类体系,解决NLP领域中缺乏全面、包容且动态的偏见评估问题。
  • 克服静态、预定义的偏见评估数据集所存在的局限,这些数据集往往排除边缘化身份和过时的社会类别。
  • 开发一个持续演进、可扩展的评估框架,以适应社会语言变化和真实生活经验的演变。
  • 实现对语言模型行为中细微、此前未被发现的偏见的检测,涵盖生成、概率和冒犯性指标。
  • 通过提供标准化、开源的工具,支持从检测到缓解的完整偏见研究周期。

提出的方法

  • 作者通过与专家及具有真实生活经验的社区成员合作,收集了13个人口统计维度上的598个描述词,构建了一个参与式数据集。
  • 通过将描述词与标准化的偏见测量模板(如“我是一个[描述词]”或“我讨厌[描述词]”)组合,生成了450,000个唯一的句子提示。
  • 该数据集被用于在三个评估设置下评估四种生成模型(GPT-2、RoBERTa、DialoGPT、BlenderBot 2.0):标记概率、文本生成和冒犯性分类。
  • 使用B.A.D.冒犯性分类器评估模型输出是否被标记为冒犯性,并应用过滤机制以排除可能具有煽动性或不安全的响应。
  • 对模型实施了偏见缓解调优,并在调优前后测量其对模型行为(尤其是复读和Hateful概率)的影响。
  • 通过Amazon Mechanical Turk进行人工评估,采用Acute-Eval方法比较调优前后模型在偏好度、自然度和趣味性方面的表现。

实验结果

研究问题

  • RQ1更具包容性和动态性的描述词数据集是否能揭示语言模型中此前未被发现的偏见?
  • RQ2不同的人口统计维度——尤其是代表性不足或带有污名的身份——在标记概率、生成内容和冒犯性方面如何影响模型行为?
  • RQ3偏见缓解调优在多大程度上会无意中加剧有害行为,如复读或生成Hateful回应?
  • RQ4与静态、预定义的分类体系相比,由社区审核的、持续演化的数据集在检测和测量NLP模型中的社会偏见方面有何优势?
  • RQ5在偏见缓解调优后,模型复读行为与Hateful回应概率上升之间存在何种关系?

主要发现

  • HolisticBias数据集成功揭示了在标记概率和生成输出中的新型偏见,尤其体现在神经多样性身份、非二元性别身份以及文化或宗教描述词上。
  • BlenderBot 2.0 3B在偏见缓解调优后,Hateful概率平均上升了0.14%,其中前五个描述词的上升幅度最高达1.55%。
  • 复读行为——即模型完全重复输入提示——在调优后显著增加,尤其在负面模板下:对“谁遭受了创伤性脑损伤”这一问题,调优后100%的响应均为原始复制。
  • 复读行为增加与偏见值变化之间的Spearman等级相关系数为+0.19,表明偏见缓解与复读行为增加之间存在可测量的关联。
  • 人工评估显示,调优模型与原始模型在偏好度、自然度和趣味性方面无显著差异,表明调优未降低模型的感知质量。
  • B.A.D.分类器对使用负面模板(如“我讨厌[复数名词短语]”)生成的响应标记为冒犯性的比例更高,尤其当描述词带有负面含义(如“alcoholic”或“druggie”)时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。