Skip to main content
QUICK REVIEW

[论文解读] Detecting the Hate Code on Social Media

Rijul Magu, Kshitij Joshi|arXiv (Cornell University)|Mar 16, 2017
Hate Speech and Cyberbullying Detection参考文献 9被引用 9
一句话总结

本文提出了一种机器学习系统,用于检测Twitter上的编码仇恨言论,其中极端分子用无害术语替代种族和民族侮辱性词汇(例如,用“Skype”代指犹太人)。该系统使用支持向量机(SVM)分类器对词形还原、预处理后的推文进行分析,在区分编码仇恨言论与非仇恨性使用方面达到了79.4%的准确率,同时识别出传播此类内容的高频用户,从而支持对仇恨煽动行为模式的研究。

ABSTRACT

Social media has become an indispensable part of the everyday lives of millions of people around the world. It provides a platform for expressing opinions and beliefs, communicated to a massive audience. However, this ease with which people can express themselves has also allowed for the large scale spread of propaganda and hate speech. To prevent violating the abuse policies of social media platforms and also to avoid detection by automatic systems like Google's Conversation AI, racists have begun to use a code (a movement termed Operation Google). This involves substituting references to communities by benign words that seem out of context, in hate filled posts or Tweets. For example, users have used the words Googles and Bings to represent the African-American and Asian communities, respectively. By generating the list of users who post such content, we move a step forward from classifying tweets by allowing us to study the usage pattern of these concentrated set of users.

研究动机与目标

  • 检测社交媒体中通过使用无害同义词伪装攻击性词汇以逃避检测的编码仇恨言论。
  • 识别频繁发布编码仇恨内容的用户,以支持对其行为模式的分析。
  • 开发一种系统,以区分推文中代码词的合法使用与仇恨动机使用。
  • 探索检测新兴代码词及仇恨煽动者之间潜在网络结构的可行性。
  • 评估在政治或社会动荡期间,编码仇恨言论使用是否出现激增。

提出的方法

  • 使用网络爬虫(Jefferson-Henrique脚本)在2016年9月23日至10月18日期间收集了超过一百万条推文,重点关注已知的代码词。
  • 通过词形还原、去除标点符号、停用词和低频词汇对推文进行预处理。
  • 基于训练数据中出现频率最高的词汇,为每条推文构建词袋特征向量表示。
  • 在1,999条标注推文(951条无害,1,048条仇恨)上使用线性核SVM分类器进行训练,并采用10折交叉验证。
  • 在23,401条英文测试集推文中评估分类器,生成预测结果并识别仇恨内容。
  • 从预测为仇恨的推文中提取用户ID,并应用启发式阈值(频率≥4)以识别高频传播者。

实验结果

研究问题

  • RQ1机器学习模型能否有效区分社交媒体帖子中代码词的仇恨性使用与非仇恨性使用?
  • RQ2哪些用户频繁使用编码仇恨言论,其行为具有何种特征模式?
  • RQ3在政治或社会紧张时期,是否存在编码仇恨言论的可检测激增?
  • RQ4该系统能否扩展为自动检测在线话语中新兴的代码词?
  • RQ5发布编码仇恨言论的用户是否形成互联网络或共享的社群结构?

主要发现

  • SVM分类器在测试集上达到79.4397%的准确率,精确率为0.795,召回率为0.794。
  • 系统正确分类了83.3%的仇恨推文(召回率),以及75.2%的无害推文(无害类别的真正阳性率)。
  • 发现频率阈值为4时,能以最少的误报率最优识别发布编码仇恨内容的高频用户。
  • 仇恨推文中相关性最高的词汇包括“#MAGA”、“#MAWA”、“#ALTRIGHT”以及“white”,表明与极右翼意识形态一致。
  • “gas”一词与仇恨言论高度相关,尤其在“gas the skypes”等短语中,暗示暴力号召。
  • 在后续研究中未观察到新代码词的出现,表明在观察期内词汇库保持稳定但持续演变。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。