Skip to main content
QUICK REVIEW

[论文解读] Man is to Person as Woman is to Location: Measuring Gender Bias in Named Entity Recognition

Ninareh Mehrabi, Thamme Gowda|arXiv (Cornell University)|Oct 24, 2019
Topic Modeling参考文献 25被引用 15
一句话总结

本文通过评估女性姓名被错误分类为非-PERSON实体(例如地点或城市)的频率,相较于男性姓名,引入了一个衡量命名实体识别(NER)系统中性别偏见的基准。利用139年美国人口普查婴儿姓名数据,在九种模板化语境下进行分析,研究发现当前最先进的NER模型系统性地低估了女性姓名的识别,女性姓名的错误率最高可达男性姓名的2.5倍——尤其在加权频率度量下更为显著,揭示了NLP系统中显著的公平性差距。

ABSTRACT

We study the bias in several state-of-the-art named entity recognition (NER) models---specifically, a difference in the ability to recognize male and female names as PERSON entity types. We evaluate NER models on a dataset containing 139 years of U.S. census baby names and find that relatively more female names, as opposed to male names, are not recognized as PERSON entities. We study the extent of this bias in several NER systems that are used prominently in industry and academia. In addition, we also report a bias in the datasets on which these models were trained. The result of this analysis yields a new benchmark for gender bias evaluation in named entity recognition systems. The data and code for the application of this benchmark will be publicly available for researchers to use.

研究动机与目标

  • 调查命名实体识别(NER)模型在将男性与女性姓名识别为PERSON实体时是否存在性别偏见。
  • 利用139年美国人口普查婴儿姓名数据,开发一个公开可用的基准,以评估NER系统中的性别偏见。
  • 分析模型更新和训练数据分布如何导致或加剧NER性能中的性别偏见。
  • 量化广泛使用的NER模型和数据集中女性姓名的代表性不足和错误分类程度。

提出的方法

  • 构建了一个基准数据集,使用九种句子模板将美国人口普查婴儿姓名嵌入应被分类为PERSON实体的语境中。
  • 在139年数据(1880–2018)上,对五种当前最先进的NER模型——Flair、CoreNLP 3.9和spaCy(小、中、大型)——在该基准上进行评估。
  • 计算三种类型的错误率:未加权、按姓名频率加权、以及特定语境下的错误率,以评估不同条件下的偏见。
  • 使用统计独立性作为公平性度量,通过比较女性与男性姓名的错误率来定义偏见为错误分类的差异。
  • 分析训练数据集(CoNLL 2003、OntoNotes5),评估训练数据中女性姓名代表性不足是否导致模型偏见。
  • 对CoreNLP进行跨版本分析,检测模型更新是否加剧了现有的性别偏见。

实验结果

研究问题

  • RQ1当前最先进的NER模型是否系统性地将女性姓名错误分类为非-PERSON实体,相较于男性姓名?
  • RQ2姓名在训练数据中的频率在多大程度上影响其在NER模型中的错误分类率?
  • RQ3模型更新(如CoreNLP 3.8到3.9)如何影响NER系统中的性别偏见?
  • RQ4广泛使用的NER训练数据集在多大程度上反映了现实世界中男性与女性姓名的分布?
  • RQ5能否设计一个标准化基准,以在不同模型和应用场景中评估NER系统中的性别偏见?

主要发现

  • 当按姓名频率加权时,女性姓名被错误分类为非-PERSON实体的比率最高可达男性姓名的2.5倍,表明存在显著的性别偏见。
  • 在所有模板中,女性姓名的错误率均持续更高,尤其在语境上明确的案例中,如“X is a person”(模板4),尽管存在明确的人物指涉,错误分类仍持续存在。
  • 模型更新(如从CoreNLP 3.8到3.9)加剧了性别偏见,此前正确标记的姓名如“Charlotte”和“Jordan”被错误分类为地点或城市。
  • 训练数据集如CoNLL 2003和OntoNotes5对女性姓名代表性不足,测试集中仅42–44%的姓名为女性,尽管美国人口普查数据中62%的姓名为女性。
  • 该基准揭示,即使高性能模型如spaCy和Flair也表现出显著的性别偏见,尤其在加权错误度量下,表明模型设计和数据表示中存在系统性问题。
  • 本研究证明,NER中的性别偏见不仅存在于模型中,也根植于训练数据,表明偏见缓解措施必须同时关注数据整理和模型评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。