Skip to main content
QUICK REVIEW

[论文解读] Sub-Story Detection in Twitter with Hierarchical Dirichlet Processes

P. K. Srijith, Mark Hepple|arXiv (Cornell University)|Jun 11, 2016
Complex Network Analysis Techniques参考文献 31被引用 4
一句话总结

本文提出一种分层狄利克雷过程(HDP)模型,用于在Twitter上自动检测子故事,利用概率主题建模识别共享现实事件中的细微子主题。HDP在子故事检测中优于局部敏感哈希(LSH)和谱聚类,尤其在结合对话结构以提升低语言重叠回复的聚类质量时,表现出更优的精确率与召回率平衡。

ABSTRACT

Social media has now become the de facto information source on real world events. The challenge, however, due to the high volume and velocity nature of social media streams, is in how to follow all posts pertaining to a given event over time, a task referred to as story detection. Moreover, there are often several different stories pertaining to a given event, which we refer to as sub-stories and the corresponding task of their automatic detection as sub-story detection. This paper proposes hierarchical Dirichlet processes (HDP), a probabilistic topic model, as an effective method for automatic sub-story detection. HDP can learn sub-topics associated with sub-stories which enables it to handle subtle variations in sub-stories. It is compared with state- of-the-art story detection approaches based on locality sensitive hashing and spectral clustering. We demonstrate the superior performance of HDP for sub-story detection on real world Twitter data sets using various evaluation measures. The ability of HDP to learn sub-topics helps it to recall the sub- stories with high precision. Another contribution of this paper is in demonstrating that the conversational structures within the Twitter stream can be used to improve sub-story detection performance significantly.

研究动机与目标

  • 为解决在Twitter上单个现实事件中检测多个重叠子故事的挑战,标准故事检测方法因词汇重叠和低推文速率而无法捕捉此类现象。
  • 通过将对话结构(如回复线程)整合到聚类过程中,提升子故事检测性能,尤其针对与原始推文语言重叠极少的回复。
  • 使用调整兰索姆互信息(AMI)作为评估指标,校正偶然一致性和过度聚类问题,提供比标准精确率-召回率更可靠的聚类性能度量。
  • 证明HDP通过学习分层子主题,能够实现比现有最先进方法更准确且可解释的子故事检测。

提出的方法

  • 采用分层狄利克雷过程(HDP)作为非参数贝叶斯主题模型,以在共享主主题内发现子主题,实现灵活且数据驱动的子故事聚类。
  • 将推文流建模为文档,并利用HDP推断潜在主题分布,使子主题自然地从模型的分层结构中浮现。
  • 通过将回复推文分配至其回复对象所处的同一聚类,整合对话结构,从而在语言差异较大的情况下仍能增强子故事检测。
  • 采用基于互信息的评估指标——调整兰索姆互信息(AMI)——评估聚类质量,同时考虑聚类数量并减少偶然一致性的偏差。
  • 将HDP与两个基线方法(局部敏感哈希LSH和谱聚类SC)进行比较,使用来自费格森事件、伦敦骚乱和渥太华枪击等真实事件的多个Twitter数据集。
  • 在五个公开的Twitter数据集上应用该模型,包括人工标注子故事的数据集和用于故事检测的数据集,以确保在多样化事件类型下的稳健评估。

实验结果

研究问题

  • RQ1分层主题模型(如HDP)是否能有效检测Twitter流中的子故事,其中子故事存在显著词汇重叠且时间上重叠?
  • RQ2在回复推文与原始推文缺乏词汇重叠的情况下,结合对话结构(如回复线程)在多大程度上能提升子故事检测性能?
  • RQ3在使用调整兰索姆互信息(AMI)作为评估指标时,HDP在子故事检测任务中是否优于LSH和谱聚类?
  • RQ4HDP学习子主题的能力在多大程度上提升了可解释性,并减少了对额外摘要步骤的需求?

主要发现

  • HDP在所有测试数据集上均取得最佳F1分数,表明其在精确率与召回率之间实现了更优且平衡的性能,优于LSH和谱聚类。
  • HDP在调整兰索姆互信息(AMI)得分上显著优于LSH和SC,表明其聚类质量更高,能有效校正偶然一致性和聚类数量的影响。
  • 整合对话结构显著提升了子故事检测性能,尤其在回复推文与原始推文语言重叠极少的情况下。
  • 即使在低推文速率、高词汇重叠的场景(如费格森骚乱和伦敦骚乱)中,HDP仍能以高精确率和高召回率检测子故事。
  • 平均而言,HDP处理伦敦骚乱数据集耗时约2小时,费格森事件约196秒,渥太华事件约55秒,尽管模型复杂,但运行时间可接受。
  • 该模型能够学习可解释的子主题(如“警察射杀布朗”与“视频证据”),使人类无需额外摘要步骤即可理解,显著提升可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。