Skip to main content
QUICK REVIEW

[论文解读] Hate Speech Classifiers Learn Human-Like Social Stereotypes

Aida Mostafazadeh Davani, Mohammad Atari|arXiv (Cornell University)|Oct 28, 2021
Hate Speech and Cyberbullying Detection参考文献 37被引用 4
一句话总结

本研究表明,仇恨言论分类器会习得并复制类人的社会刻板印象,导致对边缘化群体的预测存在偏见。通过结合社会心理学(IAT)与自然语言处理(NLP),作者发现标注者隐性偏见以及文本中嵌入的刻板印象均与神经网络仇恨言论检测器中的系统性误分类相关,揭示了AI内容审核系统中不公平现象的关键来源。

ABSTRACT

Social stereotypes negatively impact individuals' judgements about different groups and may have a critical role in how people understand language directed toward minority social groups. Here, we assess the role of social stereotypes in the automated detection of hateful language by examining the relation between individual annotator biases and erroneous classification of texts by hate speech classifiers. Specifically, in Study 1 we investigate the impact of novice annotators' stereotypes on their hate-speech-annotation behavior. In Study 2 we examine the effect of language-embedded stereotypes on expert annotators' aggregated judgements in a large annotated corpus. Finally, in Study 3 we demonstrate how language-embedded stereotypes are associated with systematic prediction errors in a neural-network hate speech classifier. Our results demonstrate that hate speech classifiers learn human-like biases which can further perpetuate social inequalities when propagated at scale. This framework, combining social psychological and computational linguistic methods, provides insights into additional sources of bias in hate speech moderation, informing ongoing debates regarding fairness in machine learning.

研究动机与目标

  • 探究个体标注者隐性社会刻板印象如何影响其仇恨言论标注行为。
  • 检验文本中嵌入的社会刻板印象是否与专家标注者之间更高的不一致性相关。
  • 评估社会刻板印象对神经网络仇恨言论分类器系统性预测错误的影响。
  • 识别数据与标注过程中的人类类偏见如何被AI模型内化,从而加剧社会不平等。

提出的方法

  • 通过隐性联想测试(IAT)量化参与者对八组社会群体(如黑人与白人、女同性恋者与异性恋者)的隐性偏见。
  • 从124名标注者处收集对多样化社交媒体文本的仇恨言论标注,其中包含特定社会群体的提及。
  • 采用多水平泊松回归模型,分析IAT得分(隐性偏见)与每类社会群体相关文本所获仇恨言论标注数量之间的关系。
  • 通过两样本置换检验,比较包含与不包含社会群体关键词的文本、以及仇恨言论与非仇恨言论内容在标注者不一致性上的差异。
  • 执行双因素方差分析,检验仇恨言论标签与社会群体关键词存在与否对不一致性评分的交互效应。
  • 训练一个神经网络仇恨言论分类器,并分析其预测错误与刻板印象语言模式及群体提及之间的关联。

实验结果

研究问题

  • RQ1通过IAT测量的标注者隐性偏见与其对提及特定社会群体内容所分配的仇恨言论标签数量之间有何相关性?
  • RQ2文本中提及社会群体在多大程度上会增加专家标注者之间的不一致性?
  • RQ3当文本中同时包含仇恨言论内容与社会群体关键词时,标注者之间的不一致性是升高还是降低?
  • RQ4语言中嵌入的社会刻板印象在多大程度上导致了神经网络仇恨言论分类器的系统性错误?

主要发现

  • 标注者对某一社会群体的隐性偏见得分每提高1分,其对提及该群体内容所分配的仇恨言论标签数量相应增加0.1%(β = 0.09,p < .01)。
  • 标注者不一致性在被标记为仇恨言论的文本中显著更高(M = 0.50),高于非仇恨言论文本(M = 0.13),p < .001。
  • 提及社会群体关键词的文本引发的不一致性显著更高(M = 0.30),高于未提及的文本(M = 0.13),p < .001。
  • 双因素方差分析显示,仇恨言论存在与社会群体关键词存在均独立预测更高的不一致性(p < .001)。
  • 神经网络仇恨言论分类器表现出与语言中刻板印象一致的系统性预测错误,表明模型习得了并放大了类人的社会偏见。
  • 本研究证实,标注者层面的隐性偏见与语言中嵌入的刻板印象均对模型不公平行为有贡献,从而在大规模上强化了社会不平等。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。