Skip to main content
QUICK REVIEW

[论文解读] Measuring Offensive Speech in Online Political Discourse

Rishab Nithyanand, Brian Schaffner|arXiv (Cornell University)|Jun 6, 2017
Hate Speech and Cyberbullying Detection参考文献 9被引用 9
一句话总结

本文开发并评估了一种攻击性言论分类器,利用2015年1月至2017年1月期间的1.68亿条Reddit评论,测量在线政治话语中的不文明现象。研究发现,在2016年美国总统大选期间,政治类子版块中的攻击性言论显著增加,峰值达到近10%的评论,而非政治类子版块则未表现出类似趋势,表明在线政治不文明现象的上升与竞选活动密切相关。

ABSTRACT

The Internet and online forums such as Reddit have become an increasingly popular medium for citizens to engage in political conversations. However, the online disinhibition effect resulting from the ability to use pseudonymous identities may manifest in the form of offensive speech, consequently making political discussions more aggressive and polarizing than they already are. Such environments may result in harassment and self-censorship from its targets. In this paper, we present preliminary results from a large-scale temporal measurement aimed at quantifying offensiveness in online political discussions. To enable our measurements, we develop and evaluate an offensive speech classifier. We then use this classifier to quantify and compare offensiveness in the political and general contexts. We perform our study using a database of over 168M Reddit comments made by over 7M pseudonyms between January 2015 and January 2017 -- a period covering several divisive political events including the 2016 US presidential elections.

研究动机与目标

  • 量化2016年美国总统大选期间在线政治话语中攻击性言论的上升趋势。
  • 探究在重大政治事件期间,政治讨论是否比非政治讨论更加具有攻击性。
  • 考察选举结束后政治论坛中攻击性言论的持续性。
  • 分析攻击性评论者在不同在线社区中的行为模式。
  • 利用多源训练数据开发并验证一种稳健的攻击性言论分类器,以实现大规模测量。

提出的方法

  • 使用CrowdFlower仇恨言论数据集训练二元攻击性言论分类器,将“攻击性”和“仇恨性”标签合并为单一的攻击性类别。
  • 引入两个外部攻击性词汇列表——Hatebase(1,122个词)和Google的“What Do You Love”项目(422个词)作为辅助特征。
  • 将训练好的分类器应用于2015年1月至2017年1月期间的1.68亿条Reddit评论样本,排除短评、已删除或非匿名的评论。
  • 通过时间序列分析,比较政治类与非政治类子版块在时间维度上的攻击性评论比例。
  • 追踪攻击性评论者在子版块间的流动,识别其来源社区。
  • 使用标准指标(精确率、召回率、F1值)在保留的测试集上评估分类器性能,实现可靠的攻击性言论检测效果。

实验结果

研究问题

  • RQ1在2016年美国总统大选竞选期间,政治在线论坛中攻击性言论的发生率是否上升?
  • RQ2在相同时间段内,政治类子版块中的攻击性言论水平与非政治类子版块相比如何?
  • RQ3与非攻击性评论相比,政治讨论中的攻击性言论是否获得更多社区点赞或互动?
  • RQ4攻击性评论者是否更可能从特定类型的子版块(如默认子版块或候选人专属子版块)迁移到政治论坛?
  • RQ52016年大选结束后,政治话语中的攻击性言论水平是否仍处于较高水平?

主要发现

  • 在2016年美国总统大选期间,政治类子版块中近10%的评论被分类为攻击性,表明不文明现象出现显著激增。
  • 政治类子版块中的攻击性评论获得的点赞数高于非攻击性评论,表明其吸引了更多社区互动。
  • 随着大选竞选活动的加剧,政治类子版块中攻击性评论的比例稳步上升,而非政治类子版块未观察到类似增长。
  • 即使在2016年大选结束三个月后,政治类子版块中攻击性评论的比例仍显著偏高,表明不文明现象持续存在。
  • 大量攻击性评论者源自默认子版块,如r/worldnews、r/askreddit和r/news,以及候选人专属子版块,如r/the_donald和r/sandersforpresident。
  • r/conspiracy、r/nfl和r/imgoingtohellforthis等子版块也是攻击性政治评论者的重要来源,表明不文明现象在社区间存在迁移现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。