Skip to main content
QUICK REVIEW

[论文解读] A Semi-automatic Method for Efficient Detection of Stories on Social Media

Soroush Vosoughi, Deb Roy|arXiv (Cornell University)|May 17, 2016
Complex Network Analysis Techniques被引用 7
一句话总结

本文提出了一种半自动系统,通过首先使用有监督的断言分类器(F1 = 0.86)过滤非断言性推文,再利用一种新颖的基于图的Louvain算法对剩余断言进行聚类,从而提升在Twitter上检测与事件相关的新闻故事的效率。该方法显著优于传统方法,使用户在五分钟内识别出81%的谣言,较仅使用层次聚类提高21%,较未经处理的数据提高76%。

ABSTRACT

Twitter has become one of the main sources of news for many people. As real-world events and emergencies unfold, Twitter is abuzz with hundreds of thousands of stories about the events. Some of these stories are harmless, while others could potentially be life-saving or sources of malicious rumors. Thus, it is critically important to be able to efficiently track stories that spread on Twitter during these events. In this paper, we present a novel semi-automatic tool that enables users to efficiently identify and track stories about real-world events on Twitter. We ran a user study with 25 participants, demonstrating that compared to more conventional methods, our tool can increase the speed and the accuracy with which users can track stories about real-world events.

研究动机与目标

  • 为解决在真实事件中海量嘈杂、非断言性推文的干扰下,识别有意义的事件相关故事的挑战。
  • 通过在聚类前过滤掉非断言内容,减轻用户追踪突发新闻时的认知负担。
  • 开发一种可扩展且准确的方法,利用先进的自然语言处理与聚类技术,对Twitter上的相似事件断言进行分组。
  • 通过受控的用户研究,评估该系统在实时应急场景中的有效性。
  • 证明将断言检测与高效的社区发现算法(Louvain)结合,优于在Twitter数据上使用传统的层次聚类方法。

提出的方法

  • 用户指定一个布尔查询(例如:'Boston AND Bombing'),从Twitter中检索与事件相关的推文。
  • 使用在7,000条人工标注推文(47%为断言)上训练的二分类断言分类器,以F1得分0.86过滤掉非断言内容。
  • 利用最先进的自然语言处理工具对剩余的断言推文进行嵌入,构建推文相似性图。
  • 在相似性图上应用基于图的社区发现算法(Louvain),形成语义相似的断言一致聚类。
  • 同时将层次聚类(HAC)作为基线进行对比评估。
  • 用户通过可视化工具交互式探索生成的聚类,以识别、调查并追踪新兴故事。

实验结果

研究问题

  • RQ1过滤非断言性推文是否能提升在真实事件中检测Twitter事件故事的效率与准确性?
  • RQ2基于Louvain的聚类在Twitter断言数据上的表现与传统层次聚类(HAC)相比如何?
  • RQ3将断言过滤与先进聚类方法结合,是否能显著提升用户识别谣言的性能?
  • RQ4该系统在高流量、实时场景下,能在多大程度上减少检测事件相关故事所需的时间与精力?
  • RQ5Louvain与HAC生成的聚类质量与真实谣言分组相比如何?

主要发现

  • 表现最佳的系统——结合断言过滤与Louvain聚类——使用户在五分钟内识别出81%的谣言,显著优于对照组(仅识别出31%)。
  • 在与层次聚类(HAC)结合时,断言过滤使检测准确率提升21%;在与Louvain聚类结合时,准确率提升16%。
  • 在未使用断言过滤时,Louvain聚类相比HAC提升15%;在结合断言过滤后,仍提升9%。
  • 使用调整兰德指数(0.25 vs. 0.14)和调整互信息(0.31 vs. 0.19)的定量评估证实,Louvain生成的聚类质量高于HAC。
  • 单因素方差分析显示组间存在显著差异(F(4,20) = 11.283, p < .001),证实所提出方法的优越性。
  • 该系统有效减少了噪声,提升了聚类的内聚性,使用户能够更高效地浏览成千上万条推文,并快速识别关键新闻故事。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。