Skip to main content
QUICK REVIEW

[论文解读] Evaluating Gender Bias in Natural Language Inference

Shanya Sharma, Manan Dey|arXiv (Cornell University)|May 12, 2021
Natural Language Processing Techniques参考文献 32被引用 6
一句话总结

该论文通过将性别中立的前提与性别特定的假设配对,提出了一项挑战性任务,以评估自然语言蕴涵(NLI)模型中的性别偏见,发现 BERT、RoBERTa 和 BART 存在显著的性别刻板印象预测错误。通过数据增强确保训练数据性别平衡,可有效降低偏见,同时性能下降极小。

ABSTRACT

Gender-bias stereotypes have recently raised significant ethical concerns in natural language processing. However, progress in detection and evaluation of gender bias in natural language understanding through inference is limited and requires further investigation. In this work, we propose an evaluation methodology to measure these biases by constructing a challenge task that involves pairing gender-neutral premises against a gender-specific hypothesis. We use our challenge task to investigate state-of-the-art NLI models on the presence of gender stereotypes using occupations. Our findings suggest that three models (BERT, RoBERTa, BART) trained on MNLI and SNLI datasets are significantly prone to gender-induced prediction errors. We also find that debiasing techniques such as augmenting the training dataset to ensure a gender-balanced dataset can help reduce such bias in certain cases.

研究动机与目标

  • 探究最先进 NLI 模型在预测中是否表现出性别偏见,特别是与职业刻板印象相关的情况。
  • 开发一种针对性的评估方法,通过挑战性任务将性别中立的前提与性别特定的假设配对,以检测偏见。
  • 评估数据增强作为去偏技术在降低微调后 NLI 模型性别偏见方面的有效性。
  • 确定 NLI 模型中的偏见主要源于微调数据集还是模型的预训练数据。
  • 为评估和缓解 NLI 系统中的性别偏见建立基线。

提出的方法

  • 通过构建成对的句子实例创建挑战性任务,其中性别中立的前提与仅在性别化职业术语上不同的两个假设配对(例如,'nurse' 与 'doctor')。
  • 使用现有的 NLI 数据集(SNLI、MNLI、ANLI、QNLI),并在其上微调 BERT、RoBERTa 和 BART,以评估模型在挑战对上的行为。
  • 通过预测差异衡量偏见:若模型对仅在性别化职业上不同的假设分配了不同的标签(蕴涵/中性/矛盾),则认为其具有偏见。
  • 对训练数据应用基于规则的性别互换增强,以创建性别平衡的数据集版本,然后在这些增强数据集上微调模型。
  • 使用准确率(Acc)、偏见分数(B)和预测差异(ΔP)等指标,在原始和增强数据集上评估模型性能。
  • 比较去偏前后的模型行为,以评估数据增强对偏见降低和性能保持的影响。

实验结果

研究问题

  • RQ1当面对具有性别刻板印象的职业角色时,最先进 NLI 模型是否在预测中表现出性别偏见?
  • RQ2通过确保训练数据性别平衡的数据增强,在不降低性能的前提下,能在多大程度上减少 NLI 模型中的性别偏见?
  • RQ3NLI 模型中的性别偏见主要源自微调数据集还是预训练数据?
  • RQ4不同预训练模型(BERT、RoBERTa、BART)在相同性别化假设对上的预测一致性如何?
  • RQ5一种简单的数据增强技术是否能有效缓解多个基准数据集上 NLI 模型中的性别偏见?

主要发现

  • 在 MNLI 和 SNLI 数据集上微调的 BERT、RoBERTa 和 BART 模型表现出显著的性别刻板印象预测错误,BERT 在 MNLI 上的偏见得分为 35.02%,在 SNLI 上为 30.01%。
  • 当同一前提与性别化假设配对时,模型的预测不一致,表明其反映了社会中的职业刻板印象。
  • 通过数据增强确保训练数据性别平衡,可显著降低 BERT 的偏见,MNLI 上的偏见得分从 35.02% 降至 14.60%,SNLI 上从 30.01% 降至 19.99%。
  • 该去偏方法保持了较高的性能,BERT 在 MNLI 上的准确率仅从 84.04% 略降至 82.53%。
  • RoBERTa 和 BART 在增强后也表现出偏见指标的轻微改善,表明即使主要偏见源来自预训练数据,性别平衡的数据也有助于缓解偏见。
  • 结果表明,模型预测中的偏见与现实中职业中性别分布高度一致,证实了模型内化并反映了社会刻板印象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。