Skip to main content
QUICK REVIEW

[论文解读] HateBR: A Large Expert Annotated Corpus of Brazilian Instagram Comments for Offensive Language and Hate Speech Detection

Francielle Vargas, Isabelle Carvalho|arXiv (Cornell University)|Mar 27, 2021
Hate Speech and Cyberbullying Detection被引用 14
一句话总结

本文介绍了HateBR,这是首个大规模专家标注的巴西语Instagram评论语料库,包含7,000条葡萄牙语评论,用于检测冒犯性语言和仇恨言论。该语料库在三个层级上进行标注——冒犯性/非冒犯性、冒犯程度等级以及九类仇恨言论类别,使基线模型的F1得分达到85%,优于现有的葡萄牙语基线模型。

ABSTRACT

Due to the severity of the social media offensive and hateful comments in Brazil, and the lack of research in Portuguese, this paper provides the first large-scale expert annotated corpus of Brazilian Instagram comments for hate speech and offensive language detection. The HateBR corpus was collected from the comment section of Brazilian politicians' accounts on Instagram and manually annotated by specialists, reaching a high inter-annotator agreement. The corpus consists of 7,000 documents annotated according to three different layers: a binary classification (offensive versus non-offensive comments), offensiveness-level classification (highly, moderately, and slightly offensive), and nine hate speech groups (xenophobia, racism, homophobia, sexism, religious intolerance, partyism, apology for the dictatorship, antisemitism, and fatphobia). We also implemented baseline experiments for offensive language and hate speech detection and compared them with a literature baseline. Results show that the baseline experiments on our corpus outperform the current state-of-the-art for the Portuguese language.

研究动机与目标

  • 为解决巴西葡萄牙语中冒犯性语言和仇恨言论检测领域缺乏大规模、专家标注数据集的问题。
  • 开发一种稳健的多层标注方案,以捕捉仇恨言论和冒犯性内容中的语境和语用细微差别。
  • 提供一个高质量、平衡且标注者间一致性高的语料库,用于训练和评估葡萄牙语的自然语言处理模型。
  • 在政治敏感语境下,为巴西社交媒体中的冒犯性语言和仇恨言论检测建立基准。
  • 证明结构良好的标注可带来更优的模型性能,超越当前葡萄牙语领域的最先进结果。

提出的方法

  • HateBR语料库从巴西政治人物Instagram账号的评论区收集,因其具有高度的政治与社会冲突强度而被选中。
  • 采用三层标注方案:(1) 二元分类(冒犯性 vs. 非冒犯性),(2) 冒犯程度分类(轻微、中等、高度冒犯),(3) 将仇恨言论划分为九种类别。
  • 由语言学家、仇恨言论专家和自然语言处理研究人员组成的专家团队执行标注,遵循严格指南和培训,以确保一致性并减少偏见。
  • 通过测量标注者间一致性,验证了标注方案的可靠性。
  • 基线模型使用独元特征和TF-IDF特征,基于朴素贝叶斯、支持向量机、多层感知机和逻辑回归,在冒犯性语言和仇恨言论检测任务上进行训练。
  • 通过欠采样处理仇恨言论检测任务中的类别不平衡问题,以防止过拟合并提升模型泛化能力。

实验结果

研究问题

  • RQ1能否为巴西葡萄牙语(该领域资源较少的语言)有效构建一个大规模、专家标注的冒犯性语言和仇恨言论检测语料库?
  • RQ2包含冒犯程度等级和具体仇恨言论类别的多层标注方案是否能提升数据集在自然语言处理任务中的质量与实用性?
  • RQ3标注质量(以标注者间一致性衡量)在多大程度上与仇恨言论检测的下游模型性能相关?
  • RQ4在该语料库上训练的基线模型能否超越现有葡萄牙语中冒犯性语言和仇恨言论检测的最先进模型?
  • RQ5HateBR语料库在规模、平衡性、标注质量及性能基准方面,与现有葡萄牙语语料库相比如何?

主要发现

  • HateBR语料库包含7,000条Instagram评论,其中3,500条被标注为冒犯性,3,500条为非冒犯性,确保了类别分布的平衡。
  • 该语料库实现了较高的标注者间一致性评分,验证了所提出的三层标注方案的稳健性与一致性。
  • 冒犯性语言检测的基线模型F1得分为85%,显著优于现有葡萄牙语最先进模型。
  • 在仇恨言论检测任务中,最佳基线模型F1得分为78%,尽管存在类别不平衡,仍表现出强劲性能。
  • HateBR语料库在规模、标注质量及模型性能方面均超越现有葡萄牙语语料库,确立了该语言的新基准。
  • 结果证实,结构良好、专家标注的语料库即使使用简单的基线模型,也能带来更优的模型性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。