Skip to main content
QUICK REVIEW

[论文解读] Polarized User and Topic Tracking in Twitter

Mauro Coletto, Claudio Lucchese|arXiv (Cornell University)|Oct 27, 2016
Complex Network Analysis Techniques参考文献 9被引用 10
一句话总结

本文提出PTR(Polarization TRacker),一种迭代算法,通过利用初始种子话题标签,在Twitter流中识别极化用户并发现具有区分性的主题标签。该方法在两次迭代后,F-measure相比k-means基线最高提升71%,性能稳定且召回率高(IT13数据集为85.3%),可有效追踪政治事件期间的极化社群与话题。

ABSTRACT

Digital traces of conversations in micro-blogging platforms and OSNs provide information about user opinion with a high degree of resolution. These information sources can be exploited to under- stand and monitor collective behaviors. In this work, we focus on polarization classes, i.e., those topics that require the user to side exclusively with one position. The proposed method provides an iterative classification of users and keywords: first, polarized users are identified, then polarized keywords are discovered by monitoring the activities of previously classified users. This method thus allows tracking users and topics over time. We report several experiments conducted on two Twitter datasets during political election time-frames. We measure the user classification accuracy on a golden set of users, and analyze the relevance of the extracted keywords for the ongoing political discussion.

研究动机与目标

  • 在用户必须归属于少数预定义立场之一的社会媒体流中,识别极化用户。
  • 发现最相关、最具区分性的主题标签,以表征每一类极化。
  • 在动态的社会媒体环境中,实现对用户社群及演变中讨论话题的持续追踪。
  • 在政治选举期间的真实Twitter数据集上,基于标注用户的真实标签集(golden set)对方法进行评估。

提出的方法

  • PTR算法从每个极化类别中一个种子主题标签开始,通过迭代识别频繁使用这些标签的用户。
  • 从每轮中被分类为极化的用户所发布的推文中,提取新的、更具区分性的主题标签。
  • 基于发现的主题标签集合的演变,在每轮迭代中更新用户分类,从而提升精确率与召回率。
  • 时间变体TPTR按天处理数据,重新分类用户并更新主题标签,以适应概念漂移与新兴趋势。
  • 该方法作为半监督聚类方法运行,仅需极少初始监督——仅需知道类别数量及每类一个关键词。
  • 评估使用F-measure、精确率、召回率和覆盖率(γ)来衡量分类质量,与真实标签集进行对比。

实验结果

研究问题

  • RQ1当仅有极少初始知识(如每类一个关键词)时,如何在Twitter流中有效识别极化用户?
  • RQ2迭代式主题标签发现对极化社群中用户分类的准确率与覆盖率有何影响?
  • RQ3该方法在动态社会媒体环境中,对随时间演化的用户社群与讨论话题的追踪能力如何?
  • RQ4主题标签的迭代优化在多大程度上提升了对极化用户聚类中相关话题的检测能力?

主要发现

  • 经过四轮迭代,PTR算法在IT13数据集上F-measure达到0.588,在EU14数据集上达到0.662,显著优于k-means基线。
  • 在两次迭代后,IT13数据集的覆盖率(γ)达到84.5%,EU14数据集达到83.0%,相比k-means,F-measure分别提升+71%和+7%。
  • 第二轮迭代带来最大性能提升,召回率显著提高,归因于发现新的、更具区分性的主题标签。
  • TPTR变体在IT13数据集上F-measure从第1天的0.177稳步提升至第9天的0.391,在EU14数据集上从0.155提升至0.635,反映出随时间推移分类性能持续改善。
  • 该方法成功提取出如知名政治人物、政党名称和政治口号等有意义的关键字,证实了所发现话题的相关性。
  • 该算法收敛迅速,第二轮迭代后性能提升微弱,表明两次迭代已足以实现高质量分类。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。