Skip to main content
QUICK REVIEW

[论文解读] Author Profiling for Hate Speech Detection

Pushkar Mishra, Marco Del Tredici|arXiv (Cornell University)|Feb 14, 2019
Hate Speech and Cyberbullying Detection参考文献 31被引用 12
一句话总结

本文提出了一种新颖的仇恨言论检测方法,将基于社区的作者画像特征——源自社交网络嵌入——整合到现有的深度学习模型中。通过利用 node2vec 生成捕捉社区结构的低维作者嵌入,该方法在标注了种族主义和性别歧视的 16,000 条推文数据集上显著优于当前最先进的基线模型,表明社交网络上下文可提升检测性能,而不仅依赖于词汇和语义线索。

ABSTRACT

The rapid growth of social media in recent years has fed into some highly undesirable phenomena such as proliferation of abusive and offensive language on the Internet. Previous research suggests that such hateful content tends to come from users who share a set of common stereotypes and form communities around them. The current state-of-the-art approaches to hate speech detection are oblivious to user and community information and rely entirely on textual (i.e., lexical and semantic) cues. In this paper, we propose a novel approach to this problem that incorporates community-based profiling features of Twitter users. Experimenting with a dataset of 16k tweets, we show that our methods significantly outperform the current state of the art in hate speech detection. Further, we conduct a qualitative analysis of model characteristics. We release our code, pre-trained models and all the resources used in the public domain.

研究动机与目标

  • 探究基于社区的作者画像是否能超越传统文本特征,提升仇恨言论检测效果。
  • 探讨同质性与在线社区在塑造仇恨语言模式中的作用。
  • 开发并评估一种结合用户网络结构与深度学习以提升检测性能的方法。
  • 发布代码、预训练模型和数据集,以支持可复现性与未来研究。

提出的方法

  • 基于 16,000 条推文数据集中推文的转发与提及关系,构建了 Twitter 作者的有向图。
  • 应用 node2vec 为每位作者学习低维稠密嵌入,以捕捉其社区归属与社交结构。
  • 将作者嵌入作为额外特征整合进基线仇恨言论分类器中,包括逻辑回归与基于 RNN 的模型。
  • 使用 5 折交叉验证设置在标注了种族主义与性别歧视标签的数据上训练并评估模型。
  • 使用 t-SNE 可视化作者嵌入,验证聚类与具有相似语言行为的社区相对应。
  • 维护一个 URL 黑名单,以应对包含混淆或恶意链接的推文造成的误分类问题。

实验结果

研究问题

  • RQ1属于特定在线社区的作者是否更可能产生仇恨言论?
  • RQ2基于社区的作者画像特征能否提升仇恨言论检测系统的性能?
  • RQ3从社交网络中提取的作者嵌入与纯粹的词汇或语义特征相比,在仇恨言论检测中的表现如何?
  • RQ4尽管增加了画像特征,哪些类型的仇恨内容仍被错误分类?

主要发现

  • 与仅使用文本特征的最先进基线相比,添加 node2vec 生成的作者嵌入显著提升了仇恨言论检测性能。
  • 该模型在标注了种族主义与性别歧视的 16,000 条推文数据集上达到了最先进结果,证明了社交网络结构在分类中的价值。
  • 作者嵌入的可视化结果揭示了密集聚类,对应于频繁发布仇恨内容的用户社区,尤其在性别歧视类别中表现明显。
  • 尽管性能有所提升,包含混淆词汇(如 'c*nt')或指向仇恨内容的短链接的推文仍被错误分类,表明当前检测策略存在局限性。
  • 本研究证实,易产生仇恨言论的用户倾向于形成紧密的在线社区,验证了同质性在在线话语中的相关性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。