[论文解读] Stereotype and Skew: Quantifying Gender Bias in Pre-trained and Fine-tuned Language Models
本文提出了两种新度量——偏斜度(skew)与刻板印象(stereotype),以量化预训练及微调语言模型中的性别偏见,尤其针对 WinoBias 代词消解任务。研究发现,偏斜度(整体男性代词偏好)与刻板印象(与性别相关的职业关联)之间存在权衡关系,并表明在微调过程中进行数据增强可有效降低两种偏见,而在线缓解方法仅降低其中一种,反而导致另一种增加。
This paper proposes two intuitive metrics, skew and stereotype, that quantify and analyse the gender bias present in contextual language models when tackling the WinoBias pronoun resolution task. We find evidence that gender stereotype correlates approximately negatively with gender skew in out-of-the-box models, suggesting that there is a trade-off between these two forms of bias. We investigate two methods to mitigate bias. The first approach is an online method which is effective at removing skew at the expense of stereotype. The second, inspired by previous work on ELMo, involves the fine-tuning of BERT using an augmented gender-balanced dataset. We show that this reduces both skew and stereotype relative to its unaugmented fine-tuned counterpart. However, we find that existing gender bias benchmarks do not fully probe professional bias as pronoun resolution may be obfuscated by cross-correlations from other manifestations of gender prejudice. Our code is available online, at https://github.com/12kleingordon34/NLP_masters_project.
研究动机与目标
- 开发比传统代词-刻板印象关联更细致的上下文语言模型性别偏见度量方法。
- 探究现有基准(如 WinoBias)是否能完整捕捉职业性别偏见,或是否受其他刻板印象的干扰。
- 评估并比较两种偏见缓解策略的有效性:在线偏斜度缓解与微调期间的数据增强。
- 揭示模型可能通过非职业属性(如能力或性格)表现出偏见,而当前基准未能将其分离。
- 倡导开发更全面、隔离的偏见基准,以更准确地探测 NLP 模型中不同形式的性别偏见。
提出的方法
- 提出两种新的偏见度量:偏斜度(整体男性代词偏好)与刻板印象(代词在性别化职业上的非均衡分配)。
- 使用 WinoBias 数据集,特别聚焦测试集 2(T2),通过将职业术语替换为“person”来隔离与能力相关的偏见。
- 在推理过程中通过调整注意力分数实施在线偏斜度缓解,以减少男性代词偏见。
- 通过创建男性与女性引用数量相等的平衡数据集,实施数据增强以微调 BERT,灵感来自先前针对 ELMo 的去偏方法。
- 在原始数据集与增强数据集上分别微调 BERT,随后在 WinoBias T2 上使用偏斜度与刻板印象度量评估偏见。
- 分析不同能力水平(无能、中性、能干)下的性别比例,以检测职业之外的残余偏见。
实验结果
研究问题
- RQ1如何在超越传统代词-刻板印象关联的基础上,更好地量化预训练与微调语言模型中的性别偏见?
- RQ2在未经调整的模型中,是否存在偏斜度(整体代词偏好)与刻板印象(基于职业的偏见)之间的权衡?
- RQ3在微调过程中使用数据增强是否能有效降低 BERT 中的偏斜度与刻板印象?
- RQ4当前基准(如 WinoBias)在多大程度上真正隔离了职业性别偏见,还是受其他刻板印象(如性格或能力)的干扰?
- RQ5语言模型是否会在非职业属性(如感知能力)上表现出偏见?这种偏见如何测量?
主要发现
- 在未经调整的模型中,偏斜度与刻板印象之间存在强烈的负相关性,表明二者之间存在权衡关系。
- DistilBERT 与 BERT 展现高偏斜度与低刻板印象,而 RoBERTa 与 ALBERT-xxlarge 则表现出较低偏斜度但更高刻板印象。
- 在线偏斜度缓解降低了偏斜度,但增加了刻板印象,表明其效果与初衷相反。
- 与未增强的微调相比,微调过程中使用数据增强可同时降低偏斜度与刻板印象,显示出其在偏见缓解方面的有效性。
- 即使在减少职业偏见后,模型在基于能力的代词消解中仍表现出性别失衡,BERT-A 将‘无能’类别中女性代词的使用率从 0.156 提高至 0.281,表明存在残余偏见。
- 当前基准(如 WinoBias 与 Winogender)并未完全隔离职业偏见,因为其他刻板印象(如性格、能力)的交叉相关性掩盖了职业偏见的真实本质。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。