Skip to main content
QUICK REVIEW

[论文解读] The Early Bird Catches The Term: Combining Twitter and News Data For Event Detection and Situational Awareness

Nicholas Thapen, Donal Simmie|arXiv (Cornell University)|Apr 9, 2015
Data-Driven Disease Surveillance参考文献 20被引用 6
一句话总结

本文提出一种混合方法,结合推特和新闻数据以检测现实世界事件并生成情境意识摘要。该方法使用改进的生物监测算法检测地理位置推文数据中的事件突增,通过筛选相关术语进行新闻检索,并对关键推文和新闻文章进行排序,事件检测的F1得分为0.9362,新闻关联的精确度较高。

ABSTRACT

Twitter updates now represent an enormous stream of information originating from a wide variety of formal and informal sources, much of which is relevant to real-world events. In this paper we adapt existing bio-surveillance algorithms to detect localised spikes in Twitter activity corresponding to real events with a high level of confidence. We then develop a methodology to automatically summarise these events, both by providing the tweets which fully describe the event and by linking to highly relevant news articles. We apply our methods to outbreaks of illness and events strongly affecting sentiment. In both case studies we are able to detect events verifiable by third party sources and produce high quality summaries.

研究动机与目标

  • 通过基于信号的异常检测方法,从实时推特流中检测现实世界事件。
  • 通过整合筛选后的推文和相关新闻文章,生成高质量的情境意识摘要。
  • 通过基于基线活动统计偏差的噪声过滤,提升事件检测的鲁棒性。
  • 将该方法推广至疾病暴发之外的事件类型,如名人去世等情绪驱动事件。
  • 通过疾病暴发和高情绪事件的案例研究,验证系统的有效性。

提出的方法

  • 应用EARS生物监测算法,并引入基于中位数绝对偏差(MAD)的新型过滤机制,以检测推文数量的显著突增。
  • 使用统计显著性(α < 0.05)识别偏离基线频率的术语,选择最能代表事件的术语。
  • 利用提取出的显著术语对事件相关推文进行过滤,生成聚焦的摘要数据集。
  • 采用精确度加权方法对新闻文章进行排序,每起事件检索最相关的前五篇。
  • 根据术语频率和与事件的相关性对事件推文进行排序,生成简洁的摘要列表。
  • 通过对比推文与新闻之间的命名实体和内容相似性(使用OpenCalais和余弦相似度)验证新闻的相关性。

实验结果

研究问题

  • RQ1能否将源自公共卫生领域的生物监测算法有效应用于检测与现实世界事件相对应的局部推特活动突增?
  • RQ2如何从事件推文中自动提取显著术语,以提高新闻检索的准确性?
  • RQ3筛选后的推文与新闻文章排序在多大程度上能生成准确且经人工验证的情境意识摘要?
  • RQ4该系统在多种事件类型(包括疾病暴发和名人去世等情绪驱动事件)中的表现如何?
  • RQ5整合推特与新闻数据能否减少误报,并提升对事件的上下文理解?

主要发现

  • 事件检测方法在测试数据集上取得了0.9362的F1得分,表明在识别现实世界事件方面具有高精确率和高召回率。
  • 新闻关联系统在无任何误报的情况下实现了0.79的F0.5得分,表明在检索相关新闻文章方面具有极强的精确度。
  • 在26起案例中的21起,过滤后排名前五的推文与人工编码摘要完全匹配,显示出与事件内容的高度一致性。
  • 该系统成功检测并总结了疾病暴发和情绪驱动事件(如罗宾·威廉姆斯去世),后者的μmax达到20,总推文数达4,472条。
  • 基于中位数的MAD过滤方法在非正态分布数据中表现稳健,尤其适用于基于症状的推文流。
  • 该方法不仅适用于疾病检测,还能通过情绪和关键词分析有效识别高影响力事件,如名人去世和重大体育赛事。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。