Skip to main content
QUICK REVIEW

[论文解读] #Bieber + #Blast = #BieberBlast: Early Prediction of Popular Hashtag Compounds

Suman Maity, Ritvik Saraf|arXiv (Cornell University)|Oct 1, 2015
Topic Modeling参考文献 64被引用 8
一句话总结

该论文提出了一种机器学习模型,用于预测在Twitter上由两个或多个现有标签组合而成的标签复合体是否会变得流行。利用包括n-gram和词重叠在内的推文级特征,该模型在提前最多10个月的时间内实现了79.13%的预测准确率,显著优于人类基线的48.7%准确率。

ABSTRACT

Compounding of natural language units is a very common phenomena. In this paper, we show, for the first time, that Twitter hashtags which, could be considered as correlates of such linguistic units, undergo compounding. We identify reasons for this compounding and propose a prediction model that can identify with 77.07% accuracy if a pair of hashtags compounding in the near future (i.e., 2 months after compounding) shall become popular. At longer times T = 6, 10 months the accuracies are 77.52% and 79.13% respectively. This technique has strong implications to trending hashtag recommendation since newly formed hashtag compounds can be recommended early, even before the compounding has taken place. Further, humans can predict compounds with an overall accuracy of only 48.7% (treated as baseline). Notably, while humans can discriminate the relatively easier cases, the automatic framework is successful in classifying the relatively harder cases.

研究动机与目标

  • 探究驱动Twitter上标签复合体流行程度的社会语言学与行为因素。
  • 解决新形成的标签复合体是否会在使用频率上超越其组成部分这一挑战。
  • 开发一种机器学习框架,以在预测流行标签复合体方面超越人类判断。
  • 基于传播模式和统计特性,区分自发性与强制性/受引导的标签复合体。

提出的方法

  • 通过历史推文的1%随机抽样,从Twitter收集大规模的标签复合体数据集。
  • 提取推文级特征,包括n-gram重叠、词重叠、提及频率、转发次数和共现模式。
  • 利用这些特征训练监督分类模型,以预测某一复合标签是否会比其组成部分更受欢迎。
  • 采用长期预测策略,在复合发生后T = 2、6和10个月时评估模型性能。
  • 通过受控评估研究将模型预测与人类判断进行对比。
  • 通过对应分析,考察人类与机器预测在简单与困难案例中的互补性。

实验结果

研究问题

  • RQ1哪些社会语言学与行为特征能够区分流行的标签复合体与不流行的标签复合体?
  • RQ2机器学习模型能否在人类判断之前更早地预测标签复合体的未来流行度?
  • RQ3自发性(习语性)标签复合体与强制性/受引导标签复合体的传播模式有何不同?
  • RQ4哪些推文级特征最能预测标签复合体未来的流行度?
  • RQ5人类与机器在分类标签复合体流行度预测难度方面,其互补性在多大程度上体现?

主要发现

  • 所提出的模型在标签复合发生后2个月的预测准确率为77.07%,准确率随时间提升至6个月时的77.52%,10个月时达到79.13%。
  • 推文内容特征——尤其是n-gram和词重叠——是区分复合标签流行度最具判别力的预测因子。
  • 人类在预测流行标签复合体方面的基线准确率仅为48.7%,表明该任务具有显著难度。
  • 该模型在整体准确率上比人类判断高出约58%,尤其在分类较难案例时表现更优。
  • 自发性(习语性)标签复合体的提及频率较低,共现模式较少,且在早期传播阶段的扩散程度也较低,相较于强制性/受引导的复合体。
  • 对应分析显示,人类在频率差距较大的简单案例中表现更佳,而模型则在更模糊、更困难的案例中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。