[论文解读] A Disability Lens towards Biases in GPT-3 Generated Open-Ended Languages
本研究通过残障视角,调查了GPT-3生成的开放式文本中的偏见,采用情感分析和毒性评分对包含“盲人”和“聋人”身份标记的提示进行分析。研究发现,当涉及残障身份时,GPT-3生成的文本毒性更高且情感倾向更负面,表明模型输出中嵌入了社会刻板印象。
Language models (LM) are becoming prevalent in many language-based application spaces globally. Although these LMs are improving our day-to-day interactions with digital products, concerns remain whether open-ended languages or text generated from these models reveal any biases toward a specific group of people, thereby risking the usability of a certain product. There is a need to identify whether these models possess bias to improve the fairness in these models. This gap motivates our ongoing work, where we measured the two aspects of bias in GPT-3 generated text through a disability lens.
研究动机与目标
- 调查GPT-3是否对残障人士生成有偏见的开放式文本。
- 使用情感分析和毒性评分作为关键指标来衡量偏见。
- 识别GPT-3在生成文本中是否再现了关于聋人和盲人个体的有害社会刻板印象。
- 为未来针对语言模型中残障相关偏见的去偏见框架奠定基础。
提出的方法
- 使用Hassan等人(2021)的修改版数据集,其中包含包含“盲人”和“聋人”身份标记的句子提示。
- 应用身份掩码技术,创建带有和不带残障身份的并行提示,以实现受控比较。
- 使用GPT-3并固定生成参数:max_length=20,temperature=0.9,do_sample=True。
- 采用Unitary团队的毒性分类器测量毒性,将输出评分在0–1的尺度上。
- 使用BOLD度量框架进行情感分析,将生成文本分类为正面或负面。
- 基于极端情感和毒性评分,选取每类提示的前40个输出用于分析。
实验结果
研究问题
- RQ1与中性提示相比,当提示中包含“盲人”或“聋人”身份标记时,GPT-3是否生成了更具毒性的文本?
- RQ2当提示中包含或不包含残障身份时,GPT-3生成文本的情感有何不同?
- RQ3当残障身份被包含时,GPT-3的输出中是否存在与领导力角色相关的刻板印象关联?
- RQ4GPT-3的输出在开放式生成任务中,多大程度上反映了社会对残障人士的误解?
- RQ5情感和毒性度量能否检测出大型语言模型生成文本中对聋人和盲人存在的内在偏见?
主要发现
- 对于包含‘聋人’身份的提示,GPT-3生成文本的毒性评分为0.25,而‘盲人’提示为0.1,中性提示为0.0。
- 对于提示‘那个人教[MASK]’,GPT-3在无身份提示时毒性评分为0.0,含‘盲人’身份时为0.1,含‘聋人’身份时为0.25。
- 当提示中包含‘盲人’时,14篇生成文本中有12篇情感为负面,而中性提示下为7篇负面和7篇正面。
- 对于‘聋人’提示,14篇生成文本中有11篇情感为负面,表明模型输出存在强烈的负面偏见。
- 当残障身份存在时,GPT-3在与‘监督’和‘指导’等领导力动词相关的输出中表现出明显的负面情感偏见。
- 该模型表现出刻板印象关联,例如将残障与无能或缺乏自主性联系起来,尤其在基于角色的提示中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。