Skip to main content
QUICK REVIEW

[论文解读] Measuring Similarity in Large-scale Folksonomies

Giovanni Quattrone, Emilio Ferrara|arXiv (Cornell University)|Jul 25, 2012
Topic Modeling参考文献 23被引用 6
一句话总结

本文提出了一种新颖的迭代相似性度量方法,用于大规模分类标签系统(folksonomies),通过标签与资源之间的相互增强机制,解决了传统相似性度量方法(如余弦相似度)在幂律分布、稀疏分类标签系统中失效的问题。在BibSonomy、MovieLens和CiteULike数据集上的评估表明,该方法在未经处理的真实世界数据集中,相比余弦相似度,显著提升了精确率和召回率。

ABSTRACT

Social (or folksonomic) tagging has become a very popular way to describe content within Web 2.0 websites. Unlike taxonomies, which overimpose a hierarchical categorisation of content, folksonomies enable end-users to freely create and choose the categories (in this case, tags) that best describe some content. However, as tags are informally defined, continually changing, and ungoverned, social tagging has often been criticised for lowering, rather than increasing, the efficiency of searching, due to the number of synonyms, homonyms, polysemy, as well as the heterogeneity of users and the noise they introduce. To address this issue, a variety of approaches have been proposed that recommend users what tags to use, both when labelling and when looking for resources. As we illustrate in this paper, real world folksonomies are characterized by power law distributions of tags, over which commonly used similarity metrics, including the Jaccard coefficient and the cosine similarity, fail to compute. We thus propose a novel metric, specifically developed to capture similarity in large-scale folksonomies, that is based on a mutual reinforcement principle: that is, two tags are deemed similar if they have been associated to similar resources, and vice-versa two resources are deemed similar if they have been labelled by similar tags. We offer an efficient realisation of this similarity metric, and assess its quality experimentally, by comparing it against cosine similarity, on three large-scale datasets, namely Bibsonomy, MovieLens and CiteULike.

研究动机与目标

  • 解决传统相似性度量方法(如余弦相似度和Jaccard相似度)在具有幂律标签分布的大规模真实世界分类标签系统中的局限性。
  • 克服现有度量方法在稀疏、非独立的分类标签数据中性能不佳的问题,尤其是在标签共现率极低的情况下。
  • 开发一种通过标签与资源之间的相互增强机制来捕捉语义相关性的相似性度量方法。
  • 在未经处理的真实世界分类标签数据集上,对所提出的度量方法与余弦相似度进行实证评估。
  • 证明在真实场景中,基于迭代相互增强的相似性计算方法相比标准方法能获得更高的精确率和召回率。

提出的方法

  • 该方法基于相互增强原理:若标签在相似的资源上共现,则认为它们相似;若资源被相似的标签标记,则认为它们相似。
  • 采用迭代算法同时计算标签与资源的相似性,每轮根据另一类实体集的当前状态更新相似性得分。
  • 实验表明,该算法在三个大规模数据集上收敛迅速,尽管数据稀疏,仍可高效实现。
  • 相似性计算基于包含用户、资源和标签的三元组分类标签系统模型,标签分配构成核心数据结构。
  • 与余弦相似度不同,该方法不假设标签的语义独立性,能够自然处理同义词与多义词问题。
  • 通过在未经修改的真实世界数据集上与余弦相似度对比,采用精确率和召回率作为评估指标进行方法评估。

实验结果

研究问题

  • RQ1传统相似性度量方法(如余弦相似度)能否有效衡量具有幂律标签分布的真实世界大规模分类标签系统中的标签相关性?
  • RQ2标签与资源之间的相互增强机制是否能在稀疏的分类标签数据中,提供比标准度量方法更准确的相似性估计?
  • RQ3所提出的迭代相似性度量方法在未经处理的真实世界数据集上,与余弦相似度相比,在精确率和召回率方面表现如何?
  • RQ4标签的非独立性以及共现的稀疏性在多大程度上影响了标准相似性度量在分类标签系统中的可靠性?
  • RQ5基于反馈的迭代相似性计算方法是否能在大规模稀疏分类标签环境中快速收敛并提供有意义的结果?

主要发现

  • 所提出的相互增强相似性度量方法在未经处理的真实世界数据集(如BibSonomy、MovieLens和CiteULike)上,相比余弦相似度,显著提升了精确率和召回率。
  • 由于标签的幂律分布和极低的共现率,传统度量方法(如余弦相似度)在真实分类标签系统中产生的相似度得分接近于零。
  • 所提出方法的迭代特性使其即使在高度稀疏的数据环境中,也能有效学习标签与资源的相似性。
  • 该方法无需预定义本体或数据转换,即可成功捕捉分类标签系统中的语义相关性,包括同义词与多义词现象。
  • 实际应用中,该算法收敛迅速,适用于大规模真实世界推荐与检索系统中的部署。
  • 实证结果表明,相互增强原理相比基于独立性的度量方法(如余弦相似度),能提供更稳健、更准确的相似性估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。