Skip to main content
QUICK REVIEW

[论文解读] Are Chess Discussions Racist? An Adversarial Hate Speech Data Set

Rupak Sarkar, Ashiqur R. KhudaBukhsh|arXiv (Cornell University)|Nov 20, 2020
Hate Speech and Cyberbullying Detection参考文献 9被引用 4
一句话总结

本文研究了现成的仇恨言论分类器是否会因国际象棋术语中的种族性词汇,而将良性国际象棋讨论误判为仇恨言论。基于来自国际象棋频道的681,995条YouTube评论数据集,作者识别出1,000条经人工验证的非仇恨言论评论被分类器错误标记——揭示了领域鲁棒性的严重缺陷,并暴露了NLP模型中系统性的颜色多义性问题。

ABSTRACT

On June 28, 2020, while presenting a chess podcast on Grandmaster Hikaru Nakamura, Antonio Radić's YouTube handle got blocked because it contained "harmful and dangerous" content. YouTube did not give further specific reason, and the channel got reinstated within 24 hours. However, Radić speculated that given the current political situation, a referral to "black against white", albeit in the context of chess, earned him this temporary ban. In this paper, via a substantial corpus of 681,995 comments, on 8,818 YouTube videos hosted by five highly popular chess-focused YouTube channels, we ask the following research question: \emph{how robust are off-the-shelf hate-speech classifiers to out-of-domain adversarial examples?} We release a data set of 1,000 annotated comments where existing hate speech classifiers misclassified benign chess discussions as hate speech. We conclude with an intriguing analogy result on racial bias with our findings pointing out to the broader challenge of color polysemy.

研究动机与目标

  • 调查现成的仇恨言论分类器是否会因种族性术语,而将良性国际象棋相关讨论误判为仇恨言论。
  • 检验现成仇恨言论分类器在应用于域外内容(特别是国际象棋解说)时的鲁棒性。
  • 分析词汇歧义(尤其是'白'和'黑')在仇恨言论检测中引发假阳性的角色。
  • 通过不同文本领域中的类比测试,探讨词嵌入偏见的广泛影响。
  • 发布一个经过筛选的1,000条误分类国际象棋评论数据集,以供未来对抗样本和NLP偏见研究之用。

提出的方法

  • 使用YouTube API从五个受欢迎的国际象棋频道的8,818个YouTube视频中收集了681,995条评论。
  • 应用两个预训练的仇恨言论分类器:一个在Twitter数据上微调的模型($\mathcal{M}_{\mathit{twitter}}$),另一个在白人至上主义论坛数据集上训练的模型($\mathcal{M}_{\mathit{stormfront}}$)。
  • 对至少一个分类器标记为仇恨言论的1,000条随机抽样评论进行人工标注,以确定真实标签。
  • 在国际象棋、福克斯新闻和CNN评论数据集的词嵌入中进行类比测试(例如,'黑' : '奴隶' :: '白' : ?),以评估语义偏见。
  • 通过人工标注的黄金标准,量化假阳性率并评估分类器在不同领域中的表现。
  • 分析'攻击'、'威胁'、'吃子'等语言触发词以及颜色词汇,以识别误分类中的模式。

实验结果

研究问题

  • RQ1现成的仇恨言论分类器在多大程度上会将良性国际象棋讨论误判为仇恨言论?
  • RQ2当应用于国际象棋相关内容时,仇恨言论分类器的性能在不同领域之间如何变化?
  • RQ3哪些语言特征——尤其是颜色词汇和战斗隐喻——会触发仇恨言论检测中的假阳性?
  • RQ4来自不同领域(如国际象棋与新闻)的词嵌入在类比推理中如何反映或扭曲种族刻板印象?
  • RQ5国际象棋术语中'白'和'黑'的语境在多大程度上导致了NLP模型中的种族偏见?

主要发现

  • 分类器标记为仇恨言论的评论中,82.4%实际上是无害的,表明在国际象棋讨论中假阳性率高达82.4%。
  • 在白人至上主义论坛数据集上训练的基于BERT的分类器($\mathcal{M}_{\mathit{stormfront}}$)的假阳性率略低于在Twitter数据上微调的模型($\mathcal{M}_{\mathit{twitter}}$),表明其在种族仇恨言论任务上具有更好的领域对齐性。
  • 尽管在极端仇恨内容上进行过训练,$\mathcal{M}_{\mathit{stormfront}}$ 仍错误地将82.4%的国际象棋评论标记为仇恨言论,表明其在域外泛化能力极差。
  • 类比测试'黑 : 奴隶 :: 白 : ?'在国际象棋数据集中得出'奴隶',而福克斯新闻和CNN数据集则预测为'奴役主',揭示国际象棋语境使词嵌入中种族权力关系趋于正常化。
  • '白'、'黑'、'攻击'、'威胁'和'吃子'等术语是假阳性的主要触发因素,表明词汇歧义是误分类的核心原因。
  • 本研究表明,即使在'白'和'黑'仅具象征意义的语境中,NLP模型仍会因多义性及有偏见的预训练数据,将它们与种族权力关系关联起来。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。