Skip to main content
QUICK REVIEW

[论文解读] Identifying Topical Twitter Communities via User List Aggregation

Derek Greene, Derek O’Callaghan|arXiv (Cornell University)|Jun 29, 2012
Complex Network Analysis Techniques参考文献 15被引用 14
一句话总结

本文提出一种通过聚合多位Twitter用户整理的用户列表,结合列表相似性图上的集成社区检测方法,识别主题性Twitter社区的方法,以生成稳定且重叠的社区。该方法在2012年伦敦奥运会期间检测体育主题社区时,实现了高达1.00的精确率和高达0.95的F1值,证明了众包用户列表数据在主题社区检测中的有效性。

ABSTRACT

A particular challenge in the area of social media analysis is how to find communities within a larger network of social interactions. Here a community may be a group of microblogging users who post content on a coherent topic, or who are associated with a specific event or news story. Twitter provides the ability to curate users into lists, corresponding to meaningful topics or themes. Here we describe an approach for crowdsourcing the list building efforts of many different Twitter users, in order to identify topical communities. This approach involves the use of ensemble community finding to produce stable groupings of user lists, and by extension, individual Twitter users. We examine this approach in the context of a case study surrounding the detection of communities on Twitter relating to the London 2012 Olympics.

研究动机与目标

  • 解决在Twitter网络中识别连贯、主题性社区的挑战,其中用户讨论共享主题,如新闻事件或体育赛事。
  • 利用Twitter用户列表的集体整理作为社区检测的众包标注形式。
  • 开发一种稳定且可重叠的社区检测方法,利用列表成员相似性与集成技术以提高可靠性。
  • 在2012年伦敦奥运会的真实案例研究中评估该方法,使用外部真实标签列表进行验证。

提出的方法

  • 构建一个图结构,其中节点代表用户列表,边代表用户成员重叠程度,使用Jaccard相似性量化重叠。
  • 应用一种集成社区检测框架,使用随机算法(如OSLOM)生成列表图的多个分区,以确保多样性。
  • 通过基于成对共分配频率的共识方法聚合多个分区,以推导出稳定且鲁棒的社区结构。
  • 通过将用户分配给其所属列表的社区,从稳定列表社区中推导出用户社区。
  • 使用稳定性评分(即各分区中平均共分配频率)评估每个社区的可靠性。
  • 与《每日电讯报》提供的外部真实标签列表进行对比,计算每个体育类别的精确率、召回率和F1值。

实验结果

研究问题

  • RQ1多样Twitter用户对用户列表的整理能否被有效聚合,以识别稳定且主题相关的社区?
  • RQ2集成社区检测方法在识别Twitter上重叠且主题特定的社区方面表现如何?
  • RQ3稳定性评分在多大程度上与检测到的社区中主题内容的一致性与连贯性相关?
  • RQ4与人工整理的真实标签列表相比,该方法在识别与特定奥运体育项目相关的社区方面准确度如何?

主要发现

  • 在18个奥运体育类别中的8个类别中,该方法实现了1.00的精确率,包括柔道、篮球和曲棍球,表明社区检测具有极高准确性。
  • 曲棍球社区的F1值达到0.95,表明在检测相关用户方面精确率与召回率保持了良好平衡。
  • 稳定性评分较高的社区通常与小众体育项目(如羽毛球、BMX赛车)相关,其中顶级用户多为精英运动员或官方组织账号。
  • 部分类别(如田径、自行车)召回率较低,与列表整理稀疏或不匹配有关,例如用户被分配至通用列表(如“水上运动”)而非具体类别。
  • 该方法成功识别出意外但连贯的社区,例如以2014年格拉斯哥英联邦运动会为中心的社区,表明其在主要案例研究之外也具有广泛适用性。
  • 该方法实现了语言无关的社区检测,因为基于列表的标签常包含多语言术语(如荷兰语、意大利语、英语),而文本-based的推文分析则不具备此特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。