Skip to main content
QUICK REVIEW

[论文解读] Of course we share! Testing Assumptions about Social Tagging Systems

Stephan Doerfel, Daniel Zöller|arXiv (Cornell University)|Jan 3, 2014
Recommender Systems and Techniques参考文献 30被引用 3
一句话总结

本文利用真实系统BibSonomy六年的匿名服务器日志数据,检验了社会标签系统中的四个核心假设——社会共享、检索效用、用户/标签/资源的平等性以及流行度一致性。研究发现,尽管部分假设部分成立,但诸如平等性和检索性等假设受到实证证据的显著挑战,凸显了在社会标签研究中进行数据驱动验证的必要性。

ABSTRACT

Social tagging systems have established themselves as an important part in today's web and have attracted the interest from our research community in a variety of investigations. The overall vision of our community is that simply through interactions with the system, i.e., through tagging and sharing of resources, users would contribute to building useful semantic structures as well as resource indexes using uncontrolled vocabulary not only due to the easy-to-use mechanics. Henceforth, a variety of assumptions about social tagging systems have emerged, yet testing them has been difficult due to the absence of suitable data. In this work we thoroughly investigate three available assumptions - e.g., is a tagging system really social? - by examining live log data gathered from the real-world public social tagging system BibSonomy. Our empirical results indicate that while some of these assumptions hold to a certain extent, other assumptions need to be reflected and viewed in a very critical light. Our observations have implications for the design of future search and other algorithms to better reflect the actual user behavior.

研究动机与目标

  • 通过实证方法检验以往因缺乏详细使用数据访问而未被验证的社会标签系统中的广泛假设。
  • 探究社会标签系统是否真正具备协作性、以检索为导向、在用户/标签/资源之间实现公平性,并在流行度度量上保持一致性。
  • 提供一种使用服务器日志数据测试此类假设的方法论框架,以支持未来对比研究。
  • 贡献一个独特的、匿名化的BibSonomy日志数据集,以支持社会标签系统中用户行为的进一步研究。
  • 通过基于实际用户请求和发布行为而非自我报告或仅事后数据,对现有社会标签理论模型提出挑战。

提出的方法

  • 收集并分析了BibSonomy六年的匿名服务器日志数据,记录了发布(打标签)和请求(页面浏览)行为。
  • 利用请求日志测量实际检索行为,与打标签行为对比,以评估检索假设。
  • 通过分析页面浏览频率和请求模式,量化用户、标签和资源的流行度。
  • 将聚合层面的流行度趋势与个体层面的行为进行对比,以评估流行度假设的有效性。
  • 通过页面访问分析资源分享频率和用户互动情境,评估社交行为。
  • 应用统计分析比较用户、标签和资源的页面访问率,以检验平等性假设。

实验结果

研究问题

  • RQ1BibSonomy中的用户在多大程度上真正实现了社会性资源共享,而非仅将其用作个人信息管理工具?
  • RQ2用户的打标签行为在多大程度上与实际检索行为一致——打标签是否真正支持后续检索?
  • RQ3在用户、标签和资源之间是否存在注意力和使用量的公平分布,如民俗分类模型所假设的那样?
  • RQ4帖子中的流行度(如频繁标签)在多大程度上与请求中的流行度(如页面浏览量)相匹配?
  • RQ5个体层面的行为与聚合层面的流行度和使用模式相比,有何异同?

主要发现

  • 尽管部分用户行为表明存在社会共享,但大量打标签和浏览行为具有个体主义特征,表明社会标签系统同时服务于社交和个性化信息管理目的。
  • 仅有极小部分发布的资源在之后被检索,表明‘打标签以备后续访问’的检索假设并未得到实际使用模式的有力支持。
  • 用户页面的访问频率远高于资源或标签页面,这为民俗分类模型中的平等性假设在BibSonomy中不成立提供了有力证据。
  • 帖子和请求的流行度模式在聚合层面一致,但在个体层面对应关系微弱,表明流行度假设仅部分成立。
  • 用户、标签和资源之间访问频率的显著差异表明,以用户为中心的设计和基于流行度的排序方法,可能比对三类实体一视同仁更有效。
  • 本研究表明,依赖用户、标签和资源对称处理的算法(如FolkRank)可能通过引入流行度权重或基于请求的转移概率而获益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。