[论文解读] Understanding Undesirable Word Embedding Associations
本文证明,基于矩阵分解的模型(如SGNS和GloVe)通过子空间投影进行事后去偏,其理论等价于在无偏语料上进行训练。本文提出了RIPA这一新的关联度量方法,表明SGNS平均而言不会放大性别偏见,但会对性别刻板印象词汇产生放大效应,并提出了一种无监督方法,在去除有偏关联的同时保留性别适当的类比关系。
Word embeddings are often criticized for capturing undesirable word associations such as gender stereotypes. However, methods for measuring and removing such biases remain poorly understood. We show that for any embedding model that implicitly does matrix factorization, debiasing vectors post hoc using subspace projection (Bolukbasi et al., 2016) is, under certain conditions, equivalent to training on an unbiased corpus. We also prove that WEAT, the most common association test for word embeddings, systematically overestimates bias. Given that the subspace projection method is provably effective, we use it to derive a new measure of association called the $ extit{relational inner product association}$ (RIPA). Experiments with RIPA reveal that, on average, skipgram with negative sampling (SGNS) does not make most words any more gendered than they are in the training corpus. However, for gender-stereotyped words, SGNS actually amplifies the gender association in the corpus.
研究动机与目标
- 理解词嵌入中事后去偏的理论基础,并确定其与在无偏语料上训练的等价性。
- 识别并修正WEAT(衡量词嵌入关联的标准测试)中的理论缺陷。
- 提出一种新的、理论基础坚实的关联度量方法——RIPA,以实现语料层面与嵌入层面关联的准确比较。
- 提出一种无监督方法,用于识别性别适当的词语,以在去偏过程中保留有效的类比关系。
- 证明SGNS平均而言不会增加词嵌入中的性别偏见,但会对刻板印象词汇产生放大效应。
提出的方法
- 证明对于基于矩阵分解的模型(如SGNS、GloVe),在特定条件下(包括使用偏差定义向量的张成空间,而不仅仅是主成分)进行子空间投影去偏,其理论等价于在无偏语料上训练。
- 识别出WEAT因对属性词频率的隐含假设以及对人为构造的属性集敏感,系统性地高估了偏见。
- 将关系内积关联(RIPA)定义为⟨w, b⟩,其中b是性别定义对(如man–woman)的差异向量的第一主成分,从而实现嵌入空间与语料中关联的信息论比较。
- 提出一种无监督启发式方法来识别性别适当的词语:若|β(w; b*)| < |β(w; b’)|,则仅对词语w进行去偏,其中b*为性别定义向量,b’为来自刻板印象类比的偏差定义向量。
- 使用RIPA比较实际嵌入关联与预期的语料层面关联,揭示偏见被放大的时机与方式。
- 通过类比关系保留率评估去偏性能:衡量去偏后保留的性别适当类比与有偏类比的数量。
实验结果
研究问题
- RQ1对于基于矩阵分解的词嵌入模型,事后子空间投影去偏是否等价于在无偏语料上训练?
- RQ2为什么WEAT系统性地高估词嵌入中的性别偏见?其理论缺陷是什么?
- RQ3与训练语料相比,SGNS在多大程度上放大了词嵌入中的性别关联?
- RQ4在去偏过程中,如何在去除性别偏见关联的同时保留性别适当的类比关系?
- RQ5无监督方法能否有效识别性别适当的词语,以指导选择性去偏?
主要发现
- 当偏差子空间被定义为偏差定义向量的张成空间(而非仅主成分)时,SGNS和GloVe的子空间投影去偏在理论上等价于在无偏语料上训练。
- WEAT系统性地高估偏见,因为它假设属性词在语料中频率相等,且易受人为构造的属性集影响,导致对性别中性词产生误报。
- SGNS平均而言不会使大多数词语在嵌入空间中的性别化程度高于其在训练语料中的程度;仅对性别刻板印象词或定义上具有性别的词(如'nurse', 'queen')产生性别关联的放大。
- 所提出的无监督方法在识别性别适当词语方面表现优异,与Bolukbasi等人基于监督方法相比,保留了94.9%的性别适当类比(强度≥0.5),而后者仅保留16.5%;同时将有偏类比从80.0%降低至36.7%。
- RIPA使语料层面与嵌入层面关联的直接比较成为可能,揭示偏见放大并非SGNS的一般特性,而是特定词类的特异性现象。
- 去偏前不应对向量长度进行归一化,因为长度携带了对准确去偏至关重要的信息。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。