Skip to main content
QUICK REVIEW

[论文解读] A Survey on Bias and Fairness in Natural Language Processing

Rajas Bansal|arXiv (Cornell University)|Mar 6, 2022
Hate Speech and Cyberbullying Detection被引用 6
一句话总结

本综述综合了当前对自然语言处理中偏见与公平性的理解,分析了其在数据和模型中的根源,形式化了公平性定义,并评估了NLP各子领域中度量方法与去偏技术。研究发现,现有去偏方法在大规模上往往无法彻底消除偏见,因为WEAT等度量方法仅能表面检测偏见,下游模型仍能从‘去偏’嵌入中恢复性别关联。

ABSTRACT

As NLP models become more integrated with the everyday lives of people, it becomes important to examine the social effect that the usage of these systems has. While these models understand language and have increased accuracy on difficult downstream tasks, there is evidence that these models amplify gender, racial and cultural stereotypes and lead to a vicious cycle in many settings. In this survey, we analyze the origins of biases, the definitions of fairness, and how different subfields of NLP mitigate bias. We finally discuss how future studies can work towards eradicating pernicious biases from NLP algorithms.

研究动机与目标

  • 系统分析NLP中偏见的根源,包括标签偏见、选择偏见、过度放大偏见以及词嵌入中的语义偏见。
  • 形式化并比较关键的公平性定义,如人口统计均等、机会均等和结果均等。
  • 评估WEAT和SEAT等现有度量方法,用于衡量词嵌入和下游模型中的偏见。
  • 调查NLP各子领域中的去偏技术,包括对抗学习和数据增强。
  • 识别当前方法的关键局限性,并呼吁采用更稳健、可泛化且跨学科的偏见缓解方法。

提出的方法

  • 将偏见来源分类为四类:标签偏见、选择偏见、过度放大偏见以及来自词嵌入的语义偏见。
  • 使用三种正式标准定义公平性:人口统计均等、机会均等和结果均等,每种标准具有不同的条件独立性要求。
  • 采用词嵌入关联测试(WEAT)和句子级偏见评估(SEAT)来量化词嵌入和模型预测中的偏见。
  • 回顾去偏技术,如对抗训练,其中生成器学习构建性别中立的类比,而判别器则试图推断性别,从而迫使生成器减少偏见。
  • 应用性别互换评估(GBET)测试去偏嵌入是否仍编码性别关联。
  • 批判性评估当前的度量方法与技术,认为低WEAT分数并不意味着真正去除了偏见,因为下游模型仍能恢复性别关联。

实验结果

研究问题

  • RQ1NLP数据集和模型中的主要偏见来源是什么?它们在数据收集和表示过程中如何产生?
  • RQ2不同形式的公平性定义(如人口统计均等、机会均等和结果均等)如何影响模型行为和公平性结果?
  • RQ3现有偏见度量方法(如WEAT和SEAT)在多大程度上准确反映了词嵌入和下游预测中偏见的存在?
  • RQ4为何当前的去偏技术即使降低了度量分数,仍无法实现稳健且可泛化的公平性?
  • RQ5需要哪些新的方法论和跨学科方法,才能有效检测并消除NLP系统中非性别偏见(如种族、宗教和阶级偏见)?

主要发现

  • 在历史语料库上训练的词嵌入会反映并放大社会刻板印象,例如将计算机科学与男性关联,将护理与女性关联,这一现象随时间与社会运动趋势相关联。
  • 尽管当前去偏方法降低了WEAT分数,但往往无法在语义层面彻底消除性别偏见,因为下游分类器仍能从去偏向量中恢复性别关联。
  • 即使经过去偏处理,性别中立术语如‘接待员’和‘发型师’仍与典型女性关联的词汇聚集在一起,表明语义偏见持续存在。
  • 对抗学习方法在通过训练生成器避免暴露性别方面显示出潜力,但无法保证在所有下游任务中实现公平性。
  • WEAT和SEAT等度量方法在检测偏见方面具有实用性,但作为衡量真正公平性的独立指标不足,因为低分并不能确保隐性偏见的消失。
  • 由于数据稀缺和方法论挑战,目前对非性别偏见(如种族、宗教和阶级偏见)的研究严重不足,凸显了当前NLP公平性研究中的重大空白。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。