Skip to main content
QUICK REVIEW

[论文解读] On Analyzing Annotation Consistency in Online Abusive Behavior Datasets

Rabiul Awal, Rui Cao|arXiv (Cornell University)|Jun 24, 2020
Hate Speech and Cyberbullying Detection参考文献 9被引用 10
一句话总结

本文提出一种两步分析框架,通过训练多个分类器识别有争议的推文,再检索语义相似的推文以标记标签差异,从而检测在线辱骂行为数据集中的标注不一致性。研究发现存在显著的标注不一致问题——尤其在 FOUNTA 数据集中,相同的转发推文被不一致地标记,严重损害了该数据集在仇恨言论研究中的可靠性。

ABSTRACT

Online abusive behavior is an important issue that breaks the cohesiveness of online social communities and even raises public safety concerns in our societies. Motivated by this rising issue, researchers have proposed, collected, and annotated online abusive content datasets. These datasets play a critical role in facilitating the research on online hate speech and abusive behaviors. However, the annotation of such datasets is a difficult task; it is often contentious on what should be the true label of a given text as the semantic difference of the labels may be blurred (e.g., abusive and hate) and often subjective. In this study, we proposed an analytical framework to study the annotation consistency in online hate and abusive content datasets. We applied our proposed framework to evaluate the consistency of the annotation in three popular datasets that are widely used in online hate speech and abusive behavior studies. We found that there is still a substantial amount of annotation inconsistency in the existing datasets, particularly when the labels are semantically similar.

研究动机与目标

  • 为解决在线辱骂行为数据集中标注不一致这一关键挑战,该挑战会削弱仇恨言论检测模型的可靠性。
  • 开发一种系统性框架,用于识别现有数据集中具有争议性且可能存在误标问题的推文。
  • 对三个广泛使用的数据集(WZ、DT 和 FOUNTA)的标注质量进行实证评估。
  • 强调语义相似性与标签模糊性对标注可靠性的影响,特别是对关系密切的标签(如仇恨与冒犯)的影响。
  • 为研究人员提供经过标注且具备不一致性意识的数据集,以改进未来研究中的数据预处理与模型训练。

提出的方法

  • 在每个数据集中训练由五个不同文本分类器组成的集成模型,预测推文标签,并通过多数投票识别有争议的推文。
  • 利用投票机制将被超过一半分类器错误分类的推文标记为“有争议”,表明可能存在标签模糊性。
  • 使用基于语义嵌入相似度的搜索引擎,为每条有争议的推文检索最相似的推文。
  • 通过比较每条有争议推文与其最相似检索到的推文的标签,构建标注不一致矩阵。
  • 当有争议推文与其最相似推文的标签不同时,即标记为不一致,表明可能存在标注错误。
  • 通过人工检查代表性案例验证不一致情况,尤其关注 FOUNTA 数据集中标签冲突的转发推文。

实验结果

研究问题

  • RQ1在 WZ、DT 和 FOUNTA 等广泛使用的在线辱骂行为数据集中,标注不一致性在多大程度上存在?
  • RQ2标签之间的语义相似性(如仇恨与冒犯)如何导致标注不一致?
  • RQ3相同或近乎相同的转发推文在引入标注不一致性方面起到什么作用,特别是在 FOUNTA 数据集中?
  • RQ4基于分类器的投票机制能否有效识别出因模糊性而可能被误标的有争议推文?
  • RQ5在所分析的数据集中,不同标签类别(如仇恨、冒犯、辱骂)的不一致性水平如何变化?

主要发现

  • FOUNTAIN 数据集中标注不一致性程度最高,有 758 个有争议的辱骂类推文,其最相似的推文被标记为正常。
  • 在 FOUNTA 数据集中,超过 10% 的推文为转发内容,其中相同或几乎相同的转发推文被不同标注者不一致地标记。
  • 在 WZ 数据集中,1,407 个被识别为有争议的性别歧视类推文中,有 745 个的最相似推文被标记为“无类别”,表明可能存在误标。
  • 在 DT 数据集中,1,089 个被标记为有争议的仇恨类推文中,有 842 个的最相似推文被标记为“冒犯”,凸显了仇恨与冒犯内容之间的混淆。
  • 研究识别出具体案例:同一则转发推文在一个实例中被标记为“仇恨”,在另一实例中却被标记为“正常”,暴露了 FOUNTA 标注策略中的关键缺陷。
  • 该分析框架成功检测并量化了不一致性,表明标签模糊性与语义相似性显著影响了标注的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。