Skip to main content
QUICK REVIEW

[论文解读] Robustness and Reliability of Gender Bias Assessment in Word Embeddings: The Role of Base Pairs

Haiyang Zhang, Alison Sneyd|arXiv (Cornell University)|Oct 6, 2020
Hate Speech and Cyberbullying Detection参考文献 31被引用 17
一句话总结

本文通过证明对性别基对(如(man, woman)或(she, he))的依赖导致了有缺陷的、非鲁棒的偏见测量,挑战了词嵌入中性别偏见评估的可靠性。它表明,广泛引用的类比如“man is to computer programmer as woman is to homemaker”实际上是高向量相似性的产物,而非社会偏见,从而削弱了当前偏见检测与去偏方法的有效性。

ABSTRACT

It has been shown that word embeddings can exhibit gender bias, and various methods have been proposed to quantify this. However, the extent to which the methods are capturing social stereotypes inherited from the data has been debated. Bias is a complex concept and there exist multiple ways to define it. Previous work has leveraged gender word pairs to measure bias and extract biased analogies. We show that the reliance on these gendered pairs has strong limitations: bias measures based off of them are not robust and cannot identify common types of real-world bias, whilst analogies utilising them are unsuitable indicators of bias. In particular, the well-known analogy "man is to computer-programmer as woman is to homemaker" is due to word similarity rather than societal bias. This has important implications for work on measuring bias in embeddings and related work debiasing embeddings.

研究动机与目标

  • 评估依赖预定义性别基对的词嵌入中性别偏见度量的稳健性与可靠性。
  • 调查这些偏见度量是否准确反映现实世界中的社会性别刻板印象,还是仅仅是向量相似性的产物。
  • 评估使用性别基对生成的类比是否可作为词嵌入中偏见的有效指标。
  • 挑战向量差异(如 man–woman)编码性别的假设,并探讨其对去偏技术的影响。
  • 指出当前偏见度量框架的局限性,并倡导在自然语言处理公平性研究中采用更严格、上下文感知的评估方法。

提出的方法

  • 作者使用一组标准化的性别基对,评估了四种流行的性别偏见度量方法——直接偏见(DB)、词嵌入关联测试(WEAT)、词关联(WA)和性别偏见得分(GBS)。
  • 他们采用三项标准框架来评估稳健性:对基对选择的敏感性、在词形(单数/复数)间的一致性,以及预测社会刻板印象性别角色的准确性。
  • 研究使用余弦相似度分析性别基对与目标词之间的向量关系,检验诸如“man is to X as woman is to Y”这类类比是否由性别驱动,还是由相似性驱动。
  • 作者分析了 Google 类比测试集,评估使用性别基对的类比被正确解答的频率,发现正确答案主要由词语之间的高相似性驱动,而非性别因素。
  • 他们计算了性别基对之间(如 man–woman, she–he)以及目标词对之间(如 computer programmer–homemaker)的余弦相似度,表明高相似度是主导因素。
  • 本文证明,类比“man is to computer programmer as woman is to homemaker”主要源于目标词之间(computer programmer 与 homemaker)的高向量相似度(0.50),而非性别偏见。

实验结果

研究问题

  • RQ1性别偏见度量在多大程度上依赖于性别基对的选择?这种依赖性如何影响其可靠性?
  • RQ2性别偏见度量能否准确预测人类特质或语言编码性别(如 lioness)的社会刻板印象性别关联?
  • RQ3使用性别基对生成的类比是否可作为词嵌入中性别偏见的有效指标?
  • RQ4词语之间向量相似度在性别类比成功中的作用是什么?这种相似度是源于偏见还是噪声?
  • RQ5本分析的结果如何挑战依赖基对偏见检测的当前去偏技术的有效性?

主要发现

  • 性别偏见度量的输出对性别基对的选择极为敏感,例如(she, he)与(woman, man)之间的差异,表明其缺乏稳健性。
  • 偏见度量无法正确识别人类特质的社会刻板印象性别(例如,某些度量错误地将“nurse”标记为女性),在语言编码性别(如“lioness”)方面也表现不佳,未能一致识别其为女性。
  • 广泛引用的类比“man is to computer programmer as woman is to homemaker”并非性别偏见的证据,而是由“computer programmer”与“homemaker”之间较高的余弦相似度(0.50)驱动,该相似度与性别无关。
  • 性别基对(如“man”与“woman”)之间的余弦相似度极高(0.77),远超随机词对的平均值(0.13),表明许多类比结果的解释应归因于相似性,而非性别。
  • 使用性别基对的类比经常被正确解答,并非因为性别关系,而是因为目标词在向量空间中相似,如在 Google 类比测试集上,非性别词对的正确率高达 22%。
  • Bolukbasi 等人(2016)提出的生成偏见类比的方法(要求 ||x−y||=1)存在缺陷,因为它强制 x 与 y 之间具有相似性,导致结果仅由相似性决定,而非性别语义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。