Skip to main content
QUICK REVIEW

[论文解读] Wisdom of the Crowd or Wisdom of a Few? An Analysis of Users' Content Generation

Ricardo Baeza‐Yates, Diego Sáez-Trumper|arXiv (Cornell University)|Apr 11, 2016
Wikis in Education and Collaboration参考文献 19被引用 7
一句话总结

本文通过分析Facebook和Twitter中的用户生成内容(UGC),挑战了‘群体智慧’理论,发现不到7%的用户产生了超过一半的全部内容,其中一小撮高度活跃且社交关系紧密的用户构成了一个稳定、精英化的少数群体。研究揭示,大部分内容无人问津(即‘数字荒漠’),高质量内容也主要由极少数用户产出,这动摇了集体智慧所依赖的独立性与多样性假设。

ABSTRACT

In this paper we analyze how user generated content (UGC) is created, challenging the well known {\it wisdom of crowds} concept. Although it is known that user activity in most settings follow a power law, that is, few people do a lot, while most do nothing, there are few studies that characterize well this activity. In our analysis of datasets from two different social networks, Facebook and Twitter, we find that a small percentage of active users and much less of all users represent 50\% of the UGC. We also analyze the dynamic behavior of the generation of this content to find that the set of most active users is quite stable in time. Moreover, we study the social graph, finding that those active users are highly connected among them. This implies that most of the wisdom comes from a few users, challenging the independence assumption needed to have a wisdom of crowds. We also address the content that is never seen by any people, which we call digital desert, that challenges the assumption that the content of every person should be taken in account in a collective decision. We also compare our results with Wikipedia data and we address the quality of UGC content using an Amazon dataset. At the end our results are not surprising, as the Web is a reflection of our own society, where economical or political power also is in the hands of minorities.

研究动机与目标

  • 调查社交网络中用户活动的分布情况,挑战‘集体智慧源于广泛而独立的参与’这一假设。
  • 量化‘数字荒漠’的范围——即从未被他人看到的内容,从而质疑‘所有贡献在集体决策中都具有意义’的观点。
  • 考察用户活跃度、内容质量与社交连通性之间的关系,特别是最活跃的用户是否也是最具影响力或高质量内容的贡献者。
  • 比较Facebook、Twitter、Wikipedia和Amazon等平台的UGC动态,评估精英主导现象与内容可见性模式的一致性。
  • 评估内容质量是否与用户活跃度相关,以及是否存在一小部分用户主导了高质量内容的产出。

提出的方法

  • 分析了来自Facebook(新奥尔良用户)和Twitter(大规模微博)的匿名数据集,以内容生成量(帖子/推文)衡量用户活跃度。
  • 将‘基于活跃度的精英用户’定义为生成50%以上全部内容的用户,采用基于阈值的分类方法识别出主要贡献者。
  • 利用Amazon电影评论数据集评估内容质量,其中评论由读者标记为‘有帮助’,将‘基于质量的精英用户’定义为产出50%以上有帮助评论的用户。
  • 通过计算每位用户的文本熵来评估评论的信息丰富度,使用香农熵衡量语言多样性及潜在的智慧贡献。
  • 通过分析社交图谱中顶级活跃用户之间的连通性,测量其社交连通性,评估其是否构成一个紧密连接的精英群体。
  • 采用Spearman等级相关系数等统计方法分析活跃度、熵值与帮助性之间的关系,并应用时间序列分析评估顶级贡献者随时间的稳定性。

实验结果

研究问题

  • RQ1在Facebook和Twitter等社交网络中,有多少比例的用户生成了超过一半的用户生成内容?
  • RQ2最活跃用户在时间上有多稳定?他们在多大程度上形成了一个连贯的社交群体?
  • RQ3有多少生成的内容从未被任何用户看到?这对‘群体智慧’模型意味着什么?
  • RQ4内容质量(以帮助性评分衡量)与用户活跃度的相关性如何?哪些用户贡献了大部分高质量内容?
  • RQ5文本熵与内容帮助性之间的相关性有多大?更高的语言多样性是否预示着更高的智慧贡献?

主要发现

  • 在Facebook和Twitter中,生成超过50%用户生成内容的用户均不足7%,其中Twitter为2%,Facebook为7%。
  • 超过70%的最活跃用户在整个观察期内始终保持在顶级群体中,表明精英内容创作者具有高度的时间稳定性。
  • 最活跃用户之间高度互联,形成了一个连贯的社交精英群体,这挑战了群体智慧所依赖的独立性假设。
  • 约64%的Amazon电影评论至少被一名用户标记为‘有帮助’,但仅有2.5%的用户产出50%以上的有帮助评论,表明质量分布严重不均。
  • 用户活跃度与文本熵之间的相关性较低(0.32),但熵值与帮助性之间的相关性较高(0.43),表明更丰富的语言表达与更高的感知价值相关。
  • 大量内容——尤其在Wikipedia和非社交语境中——始终未被看见,形成了‘数字荒漠’,即贡献者面对的是无形的受众,这削弱了集体包容性的原则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。