[论文解读] Regional Negative Bias in Word Embeddings Predicts Racial Animus--but only via Name Frequency
本文表明,美国大都市区Word Embedding Association Test(WEAT)测得的反非裔偏见估计值并非真实的语言偏见,而是由社交媒体数据中非裔姓名相对频率所驱动的伪影。在控制姓名频率后,WEAT得分与衡量种族敌意的指标(如隐性偏见和隔离程度)之间的所有相关性均消失,揭示出这种关系本质上是源于词频而非语义偏见。
The word embedding association test (WEAT) is an important method for measuring linguistic biases against social groups such as ethnic minorities in large text corpora. It does so by comparing the semantic relatedness of words prototypical of the groups (e.g., names unique to those groups) and attribute words (e.g., 'pleasant' and 'unpleasant' words). We show that anti-black WEAT estimates from geo-tagged social media data at the level of metropolitan statistical areas strongly correlate with several measures of racial animus--even when controlling for sociodemographic covariates. However, we also show that every one of these correlations is explained by a third variable: the frequency of Black names in the underlying corpora relative to White names. This occurs because word embeddings tend to group positive (negative) words and frequent (rare) words together in the estimated semantic space. As the frequency of Black names on social media is strongly correlated with Black Americans' prevalence in the population, this results in spurious anti-Black WEAT estimates wherever few Black Americans live. This suggests that research using the WEAT to measure bias should consider term frequency, and also demonstrates the potential consequences of using black-box models like word embeddings to study human cognition and behavior.
研究动机与目标
- 调查基于WEAT的美国大都市区反非裔语言偏见估计是否反映真实的种族敌意,还是方法论上的伪影。
- 检验WEAT得分与区域种族敌意度量之间的观察相关性是否因未观测变量而产生虚假关系。
- 检验社交媒体语料库中非裔姓名的相对频率是否可解释词嵌入中看似存在的反非裔偏见。
- 评估在应用标准社会人口学控制变量后,WEAT作为语言偏见测量工具的稳健性。
- 强调在未考虑词频等混淆因素的情况下,使用黑箱NLP模型(如词嵌入)研究人类认知和社会态度所存在的风险。
提出的方法
- 本研究使用地理标签化的美国Twitter数据,在大都市统计区(MSA)层面计算WEAT得分,通过词嵌入中非裔姓名、白人姓名与愉悦/不悦属性词之间的余弦相似度来衡量反非裔偏见。
- 采用多重回归模型检验WEAT得分与区域种族敌意度量(包括隐性联想测试IAT分数和居住隔离)之间的关系。
- 关键的方法论创新在于引入了非裔姓名的相对频率作为控制变量,即语料库中唯一非裔姓名占白人姓名的比例。
- 作者通过比较包含与不包含姓名频率控制的模型的拟合优度和系数显著性,以隔离其解释力。
- 使用LOWESS平滑法可视化非裔居民比例与数据中非裔姓名比例之间的强相关性。
- 分析依赖于在Twitter语料库上训练的Word2Vec词嵌入,WEAT得分使用标准公式计算,涉及属性词对与类别词对之间平均余弦相似度。
实验结果
研究问题
- RQ1WEAT是否在区域性的美国社交媒体语料库中检测到真实的反非裔语言偏见,还是受人口统计因素的干扰?
- RQ2语料库中非裔姓名的相对频率在多大程度上解释了WEAT得分与种族敌意度量之间的观察相关性?
- RQ3标准的社会人口学控制是否足以纠正词嵌入中因词频引入的偏见?
- RQ4观察到的反非裔WEAT得分是否可完全由非裔姓名的频率解释,而无需考虑实际的种族态度?
- RQ5这种混淆因素对在计算社会科学中使用词嵌入来测量文化或社会偏见有何影响?
主要发现
- 在未校正时,WEAT估计值与Project Implicit的隐性偏见(IAT分数)之间的相关性显著,但控制非裔姓名相对频率后变得不显著。
- 当姓名频率作为控制变量引入后,WEAT得分与居住隔离之间的关系也消失。
- 控制姓名频率后,WEAT与种族敌意度量相关性的效应量减小程度,超过所有标准社会人口学控制变量的总和。
- 语料库中非裔姓名的比例解释了超过一半的观察到的反非裔WEAT得分的方差,表明存在强烈的混淆效应。
- 本研究发现,WEAT估计值并非测量语义偏见,而是非裔姓名在数据中稀有程度的噪声代理指标。
- 结果表明,词嵌入将词频与积极情感混淆,导致在不同地区群体代表性差异时产生虚假的偏见估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。