Skip to main content
QUICK REVIEW

[论文解读] Collective moderation of hate, toxicity, and extremity in online discussions

Jana Lasser, Alina Herderich|arXiv (Cornell University)|Mar 1, 2023
Hate Speech and Cyberbullying Detection被引用 4
一句话总结

本研究利用2015年难民危机期间及之后四年的13万条德语Twitter讨论数据,调查了集体式言论管理策略在减少在线讨论中的仇恨、毒性与极端化现象方面的效果。研究发现,表达直接但非事实性的观点——即不带侮辱性语言——在微观、中观和宏观三个层面均最有效地降低后续的仇恨与毒性,优于传统反言论策略,并提供了一种低门槛的公民参与式干预方式。

ABSTRACT

In the digital age, hate speech poses a threat to the functioning of social media platforms as spaces for public discourse. Top-down approaches to moderate hate speech encounter difficulties due to conflicts with freedom of expression and issues of scalability. Counter speech, a form of collective moderation by citizens, has emerged as a potential remedy. Here, we aim to investigate which counter speech strategies are most effective in reducing the prevalence of hate, toxicity, and extremity on online platforms. We analyze more than 130,000 discussions on German Twitter starting at the peak of the migrant crisis in 2015 and extending over four years. We use human annotation and machine learning classifiers to identify argumentation strategies, ingroup and outgroup references, emotional tone, and different measures of discourse quality. Using matching and time-series analyses we discern the effectiveness of naturally observed counter speech strategies on the micro-level (individual tweet pairs), meso-level (entire discussions) and macro-level (over days). We find that expressing straightforward opinions, even if not factual but devoid of insults, results in the least subsequent hate, toxicity, and extremity over all levels of analyses. This strategy complements currently recommended counter speech strategies and is easy for citizens to engage in. Sarcasm can also be effective in improving discourse quality, especially in the presence of organized extreme groups. Going beyond one-shot analyses on smaller samples prevalent in most prior studies, our findings have implications for the successful management of public online spaces through collective civic moderation.

研究动机与目标

  • 调查在在线政治讨论中,哪些反言论策略最有效地减少仇恨、毒性与极端化现象。
  • 分析由公民主导的言论管理在大规模社交媒体讨论中的长期现实影响。
  • 评估有组织的极端主义团体(如Reconquista Germanica和Reconquista Internet)对不同讨论策略有效性的影响。
  • 为公民和社区提供基于证据的指导,说明如何在不依赖自上而下的平台管理的情况下开展集体性公民言论管理。
  • 超越小规模、一次性实验,基于真实世界数据,分析四年来的话语动态。

提出的方法

  • 构建了一个包含1,150,469条来自德国新闻媒体、记者和政治人物的推文语料库,形成跨越四年(2015–2018年)的讨论树结构。
  • 结合人工标注与机器学习分类器,识别论证策略、外群体/内群体指涉、情感基调及话语质量指标。
  • 采用匹配分析与时间序列分析(包括ARDL建模)评估话语维度对仇恨、毒性与极端化在微观(推文对)、中观(完整讨论)和宏观(每日趋势)层面的因果影响。
  • 引入有组织极端主义存在的指标(RG和RI),以检验其对反言论策略有效性的影响。
  • 使用统计模型在控制说话者极端性与话题等混淆变量的前提下,隔离特定话语策略的影响。
  • 在材料转移协议下发布所有推断数据与代码,数据可通过OSF获取,代码在GitHub上公开。

实验结果

研究问题

  • RQ1哪些反言论策略最有效地降低在线政治讨论中后续的仇恨、毒性与极端化?
  • RQ2不同话语策略的效果在微观层面的互动、中观层面的讨论结构与宏观层面的每日趋势中如何变化?
  • RQ3有组织的极端主义团体(如Reconquista Germanica和Reconquista Internet)的存在如何调节反言论策略的有效性?
  • RQ4表达直接观点——无论事实准确性如何,但不带侮辱性——是否比传统的理性或共情式反言论方法更有效?
  • RQ5讽刺是否可作为提升话语质量的有效工具,特别是在有协调一致的极端主义行为者存在时?

主要发现

  • 表达直接观点——即非事实性但不含侮辱性语言——在所有分析层次(微观、中观与宏观)上均导致后续仇恨、毒性与极端化水平最低。
  • 该策略在降低话语毒性方面优于传统推荐的理性呼吁、共情或道德原则等方法。
  • 讽刺被发现能有效改善话语质量,尤其在有组织的极端主义团体活跃时,表明其在对抗有组织的虚假信息方面可能具有潜在作用。
  • 有组织的极端主义团体(如Reconquista Germanica(RG)和Reconquista Internet(RI))的存在显著调节反言论策略的有效性,其影响因话语维度而异。
  • 研究结果在多个分析层次与时间范围上均具稳健性,证明了公民言论管理策略具有长期且真实的现实影响。
  • 研究结果为公民和社区提供了可操作的、基于证据的指导,使其能够在不依赖正式平台管理或高认知负荷的前提下开展集体性言论管理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。