Skip to main content
QUICK REVIEW

[论文解读] Aggregating Content and Network Information to Curate Twitter User Lists

Derek Greene, Gavin Sheridan|arXiv (Cornell University)|Jun 8, 2012
Complex Network Analysis Techniques参考文献 10被引用 6
一句话总结

本文提出一种基于SVD的聚合方法,通过结合内容相关与网络相关推荐标准,提升Twitter用户列表的整理效果。结果表明,将共现用户、提及关系及推文内容等多种视角的信息进行聚合,可显著提升推荐结果的鲁棒性与准确性,尤其在数据稀缺场景下优势明显。

ABSTRACT

Twitter introduced user lists in late 2009, allowing users to be grouped according to meaningful topics or themes. Lists have since been adopted by media outlets as a means of organising content around news stories. Thus the curation of these lists is important - they should contain the key information gatekeepers and present a balanced perspective on a story. Here we address this list curation process from a recommender systems perspective. We propose a variety of criteria for generating user list recommendations, based on content analysis, network analysis, and the "crowdsourcing" of existing user lists. We demonstrate that these types of criteria are often only successful for datasets with certain characteristics. To resolve this issue, we propose the aggregation of these different "views" of a news story on Twitter to produce more accurate user recommendations to support the curation process.

研究动机与目标

  • 解决手动整理Twitter用户列表以覆盖新闻事件所面临的挑战,该过程耗时且易导致信息不全或存在偏差。
  • 探究仅依赖孤立的内容相关或网络相关标准在推荐用户加入主题列表时的局限性。
  • 构建一个统一的推荐框架,整合多种视角(内容、网络及众包列表数据),以提升整理的准确性。
  • 利用Storyful媒体专业人士提供的真实标签数据,评估在涉及美国政治事件的多样化Twitter数据集上,聚合推荐方法的有效性。

提出的方法

  • 以权威用户初始种子列表作为上下文,推荐与新闻主题相关的其他用户。
  • 应用五种不同的推荐标准:基于网络的(被关注者、被提及者、共列入列表者)与基于内容的(推文、列表名称),每种标准生成一个候选用户排序列表。
  • 进行凝聚性分析,评估每种标准在十个美国政治新闻数据集上与真实标签种子用户的匹配程度。
  • 采用基于SVD的排序聚合方法,将表现最佳的前五项标准合并为一个更稳健的推荐列表。
  • 使用交叉验证,结合精确率与召回率指标,在多个k值(k=10, 20, 30, 40, 50)下评估不同数据集上的性能表现。
  • 通过比较各项标准在所有实验中排名前三位的排列位置,评估聚合结果相对于单一标准的表现。

实验结果

研究问题

  • RQ1当存在真实标签时,内容相关与网络相关标准在推荐Twitter列表用户方面各自表现如何?
  • RQ2在数据可用性各异的多样化Twitter数据集中,不同推荐标准的有效性差异有多大?
  • RQ3通过排序聚合整合多种标准,是否能显著提升推荐的鲁棒性与准确性,优于单一标准?
  • RQ4与表现最佳的单一标准相比,基于SVD的聚合方法在多个数据集及k值下,其精确率与召回率表现如何?

主要发现

  • 在所有数据集与k值的精确率评估中,SVD聚合方法获得第一名的占比达48%;在召回率评估中,第一名占比为46%。
  • 该聚合方法在92%的精确率评估与88%的召回率评估中位列前三,显著优于单一标准。
  • 表现最出色的单一标准“被提及者”仅在50%的实验中位列前三,凸显了聚合方法的价值。
  • 内容相关标准如“推文(200)”与“列表名称”在孤立使用时表现较差,其排名第一或第二的次数极少,表明其可靠性有限。
  • 网络相关标准如“被关注者”与“共列入列表者”表现中等,但仍不及聚合方法。
  • 凝聚性分析显示,没有任何一种标准在所有数据集中均能稳定匹配真实标签,这进一步证明了聚合方法的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。