Skip to main content
QUICK REVIEW

[论文解读] Mining Concurrent Topical Activity in Microblog Streams

André Panisson, Laëtitia Gauvin|arXiv (Cornell University)|Mar 6, 2014
Complex Network Analysis Techniques参考文献 4被引用 13
一句话总结

本文提出了两种非负矩阵与张量分解方法,用于从2012年伦敦奥运会期间的Twitter微博流中提取并发的、随时间变化的主题。结果表明,检测到的主题活动时间线与官方赛程高度一致,表明Twitter可作为现实事件的高分辨率社会传感器。

ABSTRACT

Streams of user-generated content in social media exhibit patterns of collective attention across diverse topics, with temporal structures determined both by exogenous factors and endogenous factors. Teasing apart different topics and resolving their individual, concurrent, activity timelines is a key challenge in extracting knowledge from microblog streams. Facing this challenge requires the use of methods that expose latent signals by using term correlations across posts and over time. Here we focus on content posted to Twitter during the London 2012 Olympics, for which a detailed schedule of events is independently available and can be used for reference. We mine the temporal structure of topical activity by using two methods based on non-negative matrix factorization. We show that for events in the Olympics schedule that can be semantically matched to Twitter topics, the extracted Twitter activity timeline closely matches the known timeline from the schedule. Our results show that, given appropriate techniques to detect latent signals, Twitter can be used as a social sensor to extract topical-temporal information on real-world events at high temporal resolution.

研究动机与目标

  • 开发能够通过检测超越简单词频的潜在信号,实时解耦多主题并发的微博流中多个主题的技术。
  • 探究Twitter中的集体注意力如何与现实事件相关联,以2012年伦敦奥运会为参照,其赛程已知。
  • 通过将提取的主题活动时间线与外部事件时间线进行比较,评估Twitter是否可作为高分辨率社会传感器。
  • 比较基于分解的两种方法——非负张量分解(NTF)和凝聚型非负矩阵分解(NMF)——在捕捉主题动态方面的性能差异。
  • 通过评估检测到的主题与人工标注事件术语之间的语义匹配度,评估主题检测的鲁棒性。

提出的方法

  • 从Twitter数据构建一个三重微博-词-时间张量,并应用掩码非负张量分解(NTF)以提取具有相关时间活动特征的主题。
  • 采用时间分段方法:在固定每小时时间间隔内构建微博-词频率矩阵,并对每个时间间隔应用非负矩阵分解(NMF)。
  • 应用凝聚型层次聚类以追踪连续时间间隔中相似的主题,从而实现实时的主题演化追踪。
  • 提出一种改进的NTF技术,以适应微博数据的稀疏性和偏态结构,从而提升主题的一致性。
  • 采用众包评估方法,通过测量检测到的主题与事件标注之间的语义匹配度,验证主题质量。
  • 使用官方奥运会赛程作为真实基准,将检测到的主题时间结构与已知事件时间进行对比。

实验结果

研究问题

  • RQ1非负矩阵与张量分解方法在多大程度上能够从Twitter微博流中以高时间分辨率提取并发的、随时间变化的主题?
  • RQ2从Twitter中提取的主题活动时间线与现实事件的实际时间(以官方奥运会赛程为准)的对齐程度如何?
  • RQ3NTF与凝聚型NMF在动态微博流中检测和追踪主题随时间变化的性能差异是什么?
  • RQ4检测到的主题与事件标注之间的语义匹配权重与时间对齐准确度之间的相关性如何?
  • RQ5导致检测到的主题活动与实际事件赛程不匹配的因素有哪些,以及如何进行诊断?

主要发现

  • 通过NTF和NMF方法提取的主题活动特征图在时间上与官方赛程高度一致,尤其在小时级时间尺度上表现突出。
  • 对于大多数可与Twitter主题语义匹配的体育赛事,Twitter的活动高峰与赛事的预定开始时间或高峰时间高度吻合。
  • NTF和NMF方法在捕捉主题的正确时间结构方面优于简单的计数基线方法,尤其在存在多个活动阶段或非峰值波动的情况下表现更优。
  • 时间对齐不匹配的主要原因包括主题词与事件标注之间的语义匹配度较低(例如,'football, mexico, gabon'等事件),或事件结束后注意力转移存在延迟(例如,游泳决赛)。
  • 众包评估结果表明,NTF和NMF生成的主题在语义一致性方面优于基于频率的基线方法,表现为标注者之间的一致性更高。
  • 凝聚型NMF方法由于其时间分段设计,支持在线处理;而掩码NTF方法则能提供对完整时间张量的更整体视图。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。