Skip to main content
QUICK REVIEW

[论文解读] Quantifying Controversy in Social Media

Kiran Garimella, Gianmarco De Francisci Morales|arXiv (Cornell University)|Jul 18, 2015
Social Media and Politics参考文献 36被引用 4
一句话总结

本文提出了一种与领域无关的基于图的框架,通过从用户互动(例如转发)构建对话图,并应用三阶段流程——图构建、划分以识别对立观点,以及使用基于随机游走的度量方法衡量争议性——来量化社交媒体中的争议性。其主要贡献是引入了RWC(随机游走争议性)度量方法,该方法在区分争议性与非争议性话题方面优于现有方法,尤其在Twitter上表现突出,而内容特征则基本无效。

ABSTRACT

Which topics spark the most heated debates on social media? Identifying those topics is not only interesting from a societal point of view, but also allows the filtering and aggregation of social media content for disseminating news stories. In this paper, we perform a systematic methodological study of controversy detection by using the content and the network structure of social media. Unlike previous work, rather than study controversy in a single hand-picked topic and use domain specific knowledge, we take a general approach to study topics in any domain. Our approach to quantifying controversy is based on a graph-based three-stage pipeline, which involves (i) building a conversation graph about a topic; (ii) partitioning the conversation graph to identify potential sides of the controversy; and (iii) measuring the amount of controversy from characteristics of the graph. We perform an extensive comparison of controversy measures, different graph-building approaches, and data sources. We use both controversial and non-controversial topics on Twitter, as well as other external datasets. We find that our new random-walk-based measure outperforms existing ones in capturing the intuitive notion of controversy, and show that content features are vastly less helpful in this task.

研究动机与目标

  • 开发一种通用的、与领域无关的方法,用于检测和量化社交媒体中的争议性,而无需依赖特定领域的知识或人工标注的数据集。
  • 系统性地评估广泛范围的争议性度量方法、图构建方法以及不同数据源在多样化话题(包括争议性和非争议性话题)上的表现。
  • 识别在社交媒体对话中对争议性最具预测力的结构特征、情感特征和基于内容的特征。
  • 建立一个可靠且可扩展的争议性测量框架,可应用于现实世界系统,并用于缓解回音室效应和过滤气泡。

提出的方法

  • 构建一个对话图,其中节点代表用户,边代表与由文本查询(例如Twitter上的话题标签)定义的主题相关的互动,如转发、提及或回复。
  • 应用图划分算法——特别是METIS和带负边的相关性聚类——以识别具有对立观点的用户群组。
  • 开发并评估多种争议性度量方法,包括割比(conductance)、模块度(modularity)、同配性(assortativity)以及一种新颖的基于随机游走的度量方法(RWC),以量化极化的程度。
  • 使用RWC度量方法,该方法通过计算图中随机游走的期望 hitting 时间之比,基于对立群组之间的分离程度来评估争议性。
  • 使用大规模Twitter对话数据集和外部数据集对所有度量方法进行评估,并以人工标注的争议性标签作为黄金标准。
  • 将基于内容的特征(如关键词、情感)与结构特征进行比较,发现结构特征——尤其是基于转发的赞同——表现显著更优。

实验结果

研究问题

  • RQ1是否可以采用一种通用的、与领域无关的方法,无需依赖人工标注的数据集或特定领域知识,可靠地量化社交媒体中的争议性?
  • RQ2在结构、情感和基于内容的特征中,哪类图特征最有效地区分争议性与非争议性话题?
  • RQ3不同争议性度量方法(包括割比、模块度和RWC)在捕捉多样化话题中争议性的直观概念方面表现如何?
  • RQ4基于内容的特征(如关键词和情感)在多大程度上有助于争议性检测?它们能否独立可靠地使用?
  • RQ5所提出的RWC度量方法是否在不同数据源和领域中具有泛化能力?它是否优于现有最先进方法?

主要发现

  • 基于随机游走的争议性度量方法(RWC)在区分争议性与非争议性话题方面显著优于所有其他评估过的度量方法,在实证评估中表现出更优的分离效果。
  • 基于内容的特征(如关键词和情感)在检测争议性方面效果极差,情感分析仅表现出有限潜力,而结构特征(如转发)则具有更强的预测能力。
  • 使用转发边的METIS图划分方法在识别对立观点方面最为可靠,优于基于提及或随机划分的方法。
  • 传统度量方法如模块度和同配性与人工标注的争议性评分无显著相关性,表明它们在此情境下是极化程度的不良指标。
  • RWC度量方法在不同数据集和领域(包括Twitter和外部社交媒体数据)中均表现出良好的泛化能力,证实了其稳健性和可扩展性。
  • 简单的结构度量方法(如割大小或割比)在不同规模和密度的图之间无法泛化,限制了其在大规模系统中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。