[论文解读] ValNorm Quantifies Semantics to Reveal Consistent Valence Biases Across Languages and Over Centuries
ValNorm 引入了一项新颖的内在评估任务,用于量化跨七种语言和超过200年英语文本中词嵌入的效价(愉悦/不悦)维度。其与人类评分的效价规范高度相关(ρ = 0.88),揭示了非歧视性词汇中一致且广泛共享的情感关联,而社会群体偏见则因语言和时间而异。
Word embeddings learn implicit biases from linguistic regularities captured by word co-occurrence statistics. By extending methods that quantify human-like biases in word embeddings, we introduceValNorm, a novel intrinsic evaluation task and method to quantify the valence dimension of affect in human-rated word sets from social psychology. We apply ValNorm on static word embeddings from seven languages (Chinese, English, German, Polish, Portuguese, Spanish, and Turkish) and from historical English text spanning 200 years. ValNorm achieves consistently high accuracy in quantifying the valence of non-discriminatory, non-social group word sets. Specifically, ValNorm achieves a Pearson correlation of r=0.88 for human judgment scores of valence for 399 words collected to establish pleasantness norms in English. In contrast, we measure gender stereotypes using the same set of word embeddings and find that social biases vary across languages. Our results indicate that valence associations of non-discriminatory, non-social group words represent widely-shared associations, in seven languages and over 200 years.
研究动机与目标
- 开发一种利用人类评分的心理规范来量化词嵌入中情感效价维度的方法。
- 评估词嵌入中的效价关联是否在不同语言和时间上保持一致,且独立于社会群体偏见。
- 提出 ValNorm 作为一项新的内在评估任务,其在捕捉语义质量方面优于传统词语相似性度量。
- 区分广泛共享的非歧视性效价规范与文化特异性或社会偏见关联。
- 提供一种透明且经过统计验证的工具,用于评估词嵌入在捕捉内在情感意义方面的语义保真度。
提出的方法
- ValNorm 使用置换检验来评估词嵌入中效价量化结果的统计显著性。
- 以 Bellezza 等人(1986)提供的399个英语词汇的人类评分效价分数作为真实标签,计算与基于嵌入的效价分数之间的相关性。
- 通过计算目标词与一组正向/负向效价锚点(如“仁慈”与“折磨”)之间的向量相似度得分,来估计效价。
- ValNorm 应用于在多样化语料库和算法上训练的静态词嵌入,覆盖七种语言及跨越200年的英语历史文本。
- 使用皮尔逊相关系数(ρ)作为度量标准,将性能与六项传统内在评估任务进行比较。
- 该方法将效价与句法和语法影响(如性别一致的名词搭配)分离,以确保对语言结构的鲁棒性。
实验结果
研究问题
- RQ1词嵌入在多大程度上捕捉了跨多种语言的广泛共享、非歧视性效价规范?
- RQ2在200年英语历史文本跨度中,词嵌入中的效价关联有多稳定?
- RQ3与传统内在评估任务相比,ValNorm 在衡量语义质量方面的表现如何?
- RQ4词嵌入中的效价关联是否在不同文化和语言间保持一致,还是随语言结构而变化?
- RQ5效价规范能否作为基准,用于检测文本语料中针对社会群体的偏移或有害态度?
主要发现
- ValNorm 在399个英语词汇上实现了基于嵌入的效价分数与人类评分效价规范之间的皮尔逊相关系数 ρ = 0.88,表明其在捕捉情感意义方面具有高度准确性。
- ValNorm 在七种语言(中文、英语、德语、波兰语、葡萄牙语、西班牙语、土耳其语)中均保持高性能,相关系数 ρ 范围为 [0.82, 0.88],表明具有跨语言一致性。
- 效价规范在200年英语文本中保持稳定,历史嵌入的相关系数范围为 ρ = 0.75 至 0.82,表明长期语义稳定性。
- 与效价规范相反,社会群体偏见(如性别、种族)在不同语言间存在显著差异,表明其具有文化和语言依赖性。
- ValNorm 在衡量语义质量方面优于六项传统内在评估任务,其基于效应量而非余弦相似度的度量更具敏感性。
- 研究证实,非歧视性词汇如“仁慈”和“呕吐”在不同语言和时间中均保持一致的愉悦/不悦关联,反映出广泛共享的人类情感反应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。