Skip to main content
QUICK REVIEW

[论文解读] Gender-preserving Debiasing for Pre-trained Word Embeddings

Masahiro Kaneko, Danushka Bollegala|arXiv (Cornell University)|Jun 3, 2019
Topic Modeling参考文献 31被引用 21
一句话总结

本文提出了一种保留性别的预训练词嵌入去偏方法,可在消除不公平的性别刻板印象的同时,保留女性、男性和性别中立词语中的非歧视性性别相关信息。通过去噪自编码器框架,该方法在基准数据集上的表现优于最先进去偏技术,有效消除了刻板印象词语中的偏见,同时未降低语义相似度或类比任务的性能。

ABSTRACT

Word embeddings learnt from massive text collections have demonstrated significant levels of discriminative biases such as gender, racial or ethnic biases, which in turn bias the down-stream NLP applications that use those word embeddings. Taking gender-bias as a working example, we propose a debiasing method that preserves non-discriminative gender-related information, while removing stereotypical discriminative gender biases from pre-trained word embeddings. Specifically, we consider four types of information: \emph{feminine}, \emph{masculine}, \emph{gender-neutral} and \emph{stereotypical}, which represent the relationship between gender vs. bias, and propose a debiasing method that (a) preserves the gender-related information in feminine and masculine words, (b) preserves the neutrality in gender-neutral words, and (c) removes the biases from stereotypical words. Experimental results on several previously proposed benchmark datasets show that our proposed method can debias pre-trained word embeddings better than existing SoTA methods proposed for debiasing word embeddings while preserving gender-related but non-discriminative information.

研究动机与目标

  • 解决预训练词嵌入中不公平性别偏见的问题,此类偏见可能对下游自然语言处理应用产生负面影响。
  • 保留如'护士'(女性相关)、'医生'(男性相关)和'table'(性别中立)等词语中的非歧视性性别相关信息。
  • 专门针对'程序员'(男性刻板印象)或'家庭主妇'(女性刻板印象)等词语中的刻板印象性别偏见进行消除。
  • 开发一种去偏方法,确保去偏后在标准自然语言处理评估任务中仍保持语义质量和性能。
  • 使该方法可与现有去偏技术结合使用,以进一步减少残留性别偏见。

提出的方法

  • 该方法基于种子词集,将词语分为四类:女性相关(非歧视性)、男性相关(非歧视性)、性别中立,以及刻板印象(有偏)词。
  • 采用去噪自编码器,其中编码器学习一个去偏的嵌入空间,解码器则重建原始词嵌入。
  • 模型端到端训练,以同时保留非刻板印象词语中的性别相关信息,并消除刻板印象词语中的偏见。
  • 损失函数动态平衡四项目标:保留女性和男性词语的表征、保持性别中立词语的中立性,以及消除刻板印象词语中的偏见。
  • 该方法应用于预训练的GloVe嵌入,并可进一步用于处理先前方法(如GN-GloVe)已去偏的嵌入。
  • 通过在平衡基准数据集上的偏见检测(如性别关系类比)和语义相似度任务,对去偏嵌入进行评估。

实验结果

研究问题

  • RQ1去偏方法能否在不降低语义质量的前提下,有效消除预训练词嵌入中的不公平性别刻板印象?
  • RQ2该方法在消除刻板印象术语偏见的同时,能在多大程度上保留如'护士'或'工程师'等词语中的非歧视性性别相关信息?
  • RQ3在去偏程度和语义保留方面,该方法与最先进去偏技术相比表现如何?
  • RQ4该方法能否应用于先前已去偏的嵌入,以进一步减少残留性别偏见?
  • RQ5去偏后,该方法在标准语义相似度和类比任务上的性能是否保持较高水平?

主要发现

  • 在SemBias数据集上,该方法优于硬去偏和GN-GloVe方法,能正确去偏刻板印象性别类比,如'man:doctor :: woman:nurse'。
  • 在语义相似度数据集的平衡版本(如WS、RG、MEN)上,该方法的性能与原始GloVe嵌入相当,表明语义保留能力出色。
  • 在原始和平衡相似度数据集上,该方法与人类评分的相关性均达到高Spearman等级相关系数,表明去偏后语义信息得到良好保留。
  • 可视化结果证实,该方法降低了刻板印象词语的性别相似度得分,同时保持了女性、男性和性别中立词语之间清晰的性别取向。
  • 该方法能有效减少先前经GN-GloVe去偏的嵌入中的残留性别偏见,证明其作为后处理步骤的兼容性和有效性。
  • 去偏嵌入的自编码版本在所有语义相似度基准测试中表现与原始输入嵌入相当,确认了信息损失极小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。