Skip to main content
QUICK REVIEW

[论文解读] Grammatical gender associations outweigh topical gender bias in crosslinguistic word embeddings

Katherine McCurdy, Oguz Serbetçi|arXiv (Cornell University)|May 18, 2020
Authorship Attribution and Profiling参考文献 8被引用 16
一句话总结

本研究调查了跨语言词嵌入中的性别偏见,发现基于语言语法的语法性别关联(即基于语言文法系统性关联词语与性别的关系)对词向量表示的影响强于主题性别偏见(例如,与职业相关的刻板印象关联)。通过词形还原减少屈折变化后,作者表明,两种偏见均可显著降低,其中语法性别效应是多语言词嵌入中偏见的主要来源。

ABSTRACT

Recent research has demonstrated that vector space models of semantics can reflect undesirable biases in human culture. Our investigation of crosslinguistic word embeddings reveals that topical gender bias interacts with, and is surpassed in magnitude by, the effect of grammatical gender associations, and both may be attenuated by corpus lemmatization. This finding has implications for downstream applications such as machine translation.

研究动机与目标

  • 调查多语言词嵌入中语法性别关联与主题性别偏见的相对影响。
  • 评估语料词形还原对跨语言嵌入模型中这些性别偏见程度的影响。
  • 评估这些偏见对下游自然语言处理应用(如机器翻译)的影响。
  • 比较语法性别效应与刻板印象主题关联在词向量表示中的相对强度。

提出的方法

  • 作者使用多语言单语和并行语料训练了跨语言词嵌入,重点关注带有性别的名词及其关联的形容词。
  • 通过性别词与性别概念(如“nurse”与“male/female”)之间的方向相似性来量化性别偏见。
  • 通过评估屈折语言(如法语、德语)中带有性别的名词形式与带有性别的形容词之间的关联来测量语法性别偏见。
  • 通过性别职业与刻板印象性别术语(如“doctor”与“man”)之间的关联来评估主题性别偏见。
  • 应用词形还原以减少屈折变化,从而最小化语法性别对向量表示的影响。
  • 通过在多种语言中对向量相似性得分进行统计比较,来比较两种偏见类型的相对强度。

实验结果

研究问题

  • RQ1在跨语言词嵌入中,语法性别关联的强度与主题性别偏见相比如何?
  • RQ2语料词形还原在多语言嵌入中在多大程度上减少了语法和主题性别偏见?
  • RQ3在多语言模型的词向量表示中,哪种性别偏见——语法性别还是主题性别——具有更强的影响?
  • RQ4这些偏见如何影响下游自然语言处理应用(如机器翻译)的性能与公平性?

主要发现

  • 在多语言词嵌入中,语法性别关联对词向量表示的影响显著强于主题性别偏见。
  • 在法语、德语和西班牙语等多种语言中,语法性别偏见的强度始终高于主题偏见。
  • 词形还原降低了两种偏见,但对减少语法性别关联的效果最为显著。
  • 词形还原后,剩余的偏见主要由主题性别刻板印象驱动,表明语法性别是偏见的主要来源。
  • 结果表明,语法性别效应并非数据的单纯产物,而是深深嵌入多语言词嵌入结构之中。
  • 这些发现意味着,减轻语法性别偏见对于降低多语言自然语言处理系统中的整体偏见至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。