Skip to main content
QUICK REVIEW

[论文解读] Finding Social Media Trolls: Dynamic Keyword Selection Methods for Rapidly-Evolving Online Debates

Anqi Liu, Maya Srikanth|arXiv (Cornell University)|Nov 13, 2019
Advanced Text Analysis Techniques参考文献 10被引用 4
一句话总结

本文提出一种基于词嵌入的动态关键词选择方法,用于检测快速变化的社交媒体辩论中不断演变的网络欺凌和网络骚扰行为,例如 #MeToo 运动。通过在种子关键词上应用 GloVe 嵌入,该方法识别出语义相关的新兴关键词,并检测特定领域语言的差异,从而实现对 Twitter 和 Reddit 等平台上的仇恨言论和攻击性内容更有效、更具适应性的监控。

ABSTRACT

Online harassment is a significant social problem. Prevention of online harassment requires rapid detection of harassing, offensive, and negative social media posts. In this paper, we propose the use of word embedding models to identify offensive and harassing social media messages in two aspects: detecting fast-changing topics for more effective data collection and representing word semantics in different domains. We demonstrate with preliminary results that using the GloVe (Global Vectors for Word Representation) model facilitates the discovery of new and relevant keywords to use for data collection and trolling detection. Our paper concludes with a discussion of a research agenda to further develop and test word embedding models for identification of social media harassment and trolling.

研究动机与目标

  • 解决静态关键词搜索在捕捉仇恨言论和网络骚扰相关快速演变的在线辩论时的局限性。
  • 开发一种透明、半自动化的动态关键词发现方法,减少对人工标注的依赖,并避免在分析攻击性内容时引发的伦理问题。
  • 通过利用捕捉语义变化和跨平台(如 Twitter 和 Reddit)特定术语的词嵌入,提升对攻击性语言的检测能力。
  • 使研究人员能够通过识别无需预先知晓术语变化的新颖相关关键词,实现实时追踪不断演变的论述。
  • 为未来基于网络的语气和互动模式分析奠定基础,以区分在线社区中支持性与攻击性行为。

提出的方法

  • 使用预训练的 GloVe 词嵌入来表示社交媒体文本中词语之间的语义关系。
  • 应用余弦相似度和 K-means 聚类,从一组种子词(例如 'MeToo'、'survivor'、'harassment')中识别语义相关的关键词。
  • 在不同社区的数据上训练特定领域的词嵌入(例如 Twitter #MeToo 和 Reddit 的 Red Pill 子版块),以捕捉 'female' 和 'male' 等术语的对比语义表征。
  • 利用与种子词最相似的词语来动态扩展关键词列表,仅基于语义相关性而非单纯的词汇匹配。
  • 比较来自不同领域(Wikipedia、Gigaword5、Twitter #MeToo、Reddit Red Pill)的词嵌入,检测性别与权力概念在不同语境中的概念差异。
  • 开发一个持续扩展关键词的流水线,通过语义相似度和聚类对新候选词进行排序,计划引入合理排序机制以防止关键词爆炸。

实验结果

研究问题

  • RQ1词嵌入模型能否有效识别在快速演变的在线辩论(如 #MeToo 运动)中出现的新颖相关关键词?
  • RQ2像 'female' 和 'male' 这样的关键词在 Twitter 和 Red Pill 子版块等不同在线社区中的语义表征有何差异?
  • RQ3与静态关键词方法相比,基于嵌入的动态关键词选择在检测演变中的网络骚扰和仇恨言论方面能多大程度上表现更优?
  • RQ4特定领域的词嵌入能否揭示边缘化群体与对抗性群体在在线论述中对性别与权力概念的结构性差异?
  • RQ5一种半自动化的透明关键词发现方法在多大程度上能减少对人工标注的依赖,同时保持对攻击性内容检测的准确性?

主要发现

  • 在 #MeToo Twitter 数据上训练的词嵌入成功识别出原始种子集之外的语义相关关键词,如 'survivor'、'harassment'、'abuse' 和 'support'。
  • K-means 聚类揭示了不同的主题聚类,例如一个以 'Epstein' 为中心的聚类和一个以 'Kavanaugh' 为中心的聚类,反映出 #MeToo 运动期间讨论主题的演变。
  • 特定领域的嵌入显示出显著的语义差异:在 Red Pill 子版块中,'female' 与 'plight'、'negative' 和 'sexual' 相关联,而在 #MeToo 中,'female' 则与 'survivor'、'victim' 和 'abuse' 相关联。
  • Red Pill 子版块的嵌入呈现出将 'male' 框架为 'alpha'、'beta'、'physical' 和 'emotional' 的概念结构,反映出与中性或 #MeToo 语料相比截然不同的意识形态和语言结构。
  • 来自 Wikipedia 和 Gigaword5 的预训练嵌入作为有用基线,显示出比社区特定嵌入更中性、更通用的语义关联。
  • 该方法在发现先前未见的关键词和语言模式方面展现出可行性,表明其在可扩展、自适应的在线虐待行为监控方面具有强大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。