Skip to main content
QUICK REVIEW

[论文解读] A Motif-based Approach for Identifying Controversy

Mauro Coletto, Kiran Garimella|arXiv (Cornell University)|Mar 15, 2017
Misinformation and Its Impacts参考文献 6被引用 8
一句话总结

本文提出一种语言无关、基于模式的争议检测方法,通过分析回复线程中的局部用户互动模式,而非依赖全局网络结构或文本内容,来检测社交媒体中的争议。该方法在分类争议性讨论时达到85%的准确率,比基线的结构特征、传播特征和时间特征高出7个百分点,其中二元模式尤其有效,能够捕捉到社交圈外的极化互动。

ABSTRACT

Among the topics discussed in Social Media, some lead to controversy. A number of recent studies have focused on the problem of identifying controversy in social media mostly based on the analysis of textual content or rely on global network structure. Such approaches have strong limitations due to the difficulty of understanding natural language, and of investigating the global network structure. In this work we show that it is possible to detect controversy in social media by exploiting network motifs, i.e., local patterns of user interaction. The proposed approach allows for a language-independent and fine- grained and efficient-to-compute analysis of user discussions and their evolution over time. The supervised model exploiting motif patterns can achieve 85% accuracy, with an improvement of 7% compared to baseline structural, propagation-based and temporal network features.

研究动机与目标

  • 为解决基于内容和基于全局网络的争议检测方法的局限性,这些方法对语言、主题以及网络聚类的计算假设敏感。
  • 开发一种语言和主题无关的方法,通过聚焦于局部、可重复的用户互动模式,识别争议。
  • 实现在整体非争议性对话中对争议性子讨论的细粒度、动态检测。
  • 评估局部网络模式是否能在预测争议方面优于传统结构特征、传播特征和时间特征。
  • 证明利用模式分析在回复子树上监测争议随时间演变的可行性。

提出的方法

  • 该方法通过用户回复图 R = (U, I) 建模用户互动,其中边表示用户之间的回复,并提取称为模式的局部互动模式。
  • 模式被定义为用户互动中的小型重复子图,包括二元模式(例如,相互回复、单向回复)和三元模式(例如,三位用户之间的相互回复)。
  • 该方法将模式频率计算为每个回复树的特征,重点关注捕捉跨社交网络边界非互惠和互惠回复行为的二元模式。
  • 使用监督学习模型(AdaBoost)在基于模式的特征上进行训练,同时结合基线特征,如回复树大小、平均回复间隔时间和最大相对度数。
  • 该模型不仅应用于完整线程,还应用于回复子树,从而实现在整体非争议性讨论中检测局部争议。
  • 该方法在经过筛选的 Twitter 数据集上进行评估,包含来自18个页面的192.7万条推文,并通过回复内容和结构进行人工标注争议性。

实验结果

研究问题

  • RQ1局部网络模式能否在不依赖语言和主题的前提下,有效区分社交媒体中的争议性与非争议性讨论?
  • RQ2基于模式的特征在争议检测中的性能与传统结构特征、传播特征和时间特征相比如何?
  • RQ3模式分析在多大程度上能够检测到在整体非争议性对话中隐藏的争议性子讨论?
  • RQ4哪些具体的模式形态最能指示争议?它们揭示了用户参与动态的哪些特征?
  • RQ5基于模式的模型能否以可扩展且高效的方式,用于监测争议随时间的演变?

主要发现

  • 基于模式的模型在分类争议时达到85%的准确率,比使用结构特征、传播特征和时间特征的基线模型高出7个百分点。
  • 在基线特征中加入二元模式后,准确率从78%提升至84%,表明其在预测争议方面具有强大的预测能力。
  • 三元模式对性能提升的贡献微乎其微,尽管它们在争议线程中具有相关性,但因在数据集中出现频率较低而影响有限。
  • 模型中最重要的特征是平均回复间隔时间,其次是最大相对度数,而二元模式位列最具影响力的前六项特征之中。
  • 约7%的非争议性主推文的直接回复子树被分类为争议性,证实了该方法在整体讨论中检测局部争议的能力。
  • 二元模式,尤其是指示跨非好友关系互动的模式(如模式A),对争议具有高度预测性,而涉及互惠友谊的模式(如模式C)则相关性较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。