Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Similarity in Large-scale Folksonomies

Giovanni Quattrone, Emilio Ferrara|arXiv (Cornell University)|Jul 25, 2012
Topic Modeling参考文献 23被引用数 6
ひとこと要約

本稿では、タグとリソースの相互強化を活用することで、パワー則分布に従うスパースなフォルクソノミーにおいて、従来の類似度測定法(コサイン類似度など)が失敗する問題を解決する、大規模フォルクソノミー向けの新しい反復的類似度メトリクスを提案する。BibSonomy、MovieLens、CiteULikeで評価した結果、本稿で提案するメトリクスは、未処理の現実世界のデータセットにおいて、コサイン類似度よりも顕著に高い正確性(precision)と再現率(recall)を達成した。

ABSTRACT

Social (or folksonomic) tagging has become a very popular way to describe content within Web 2.0 websites. Unlike taxonomies, which overimpose a hierarchical categorisation of content, folksonomies enable end-users to freely create and choose the categories (in this case, tags) that best describe some content. However, as tags are informally defined, continually changing, and ungoverned, social tagging has often been criticised for lowering, rather than increasing, the efficiency of searching, due to the number of synonyms, homonyms, polysemy, as well as the heterogeneity of users and the noise they introduce. To address this issue, a variety of approaches have been proposed that recommend users what tags to use, both when labelling and when looking for resources. As we illustrate in this paper, real world folksonomies are characterized by power law distributions of tags, over which commonly used similarity metrics, including the Jaccard coefficient and the cosine similarity, fail to compute. We thus propose a novel metric, specifically developed to capture similarity in large-scale folksonomies, that is based on a mutual reinforcement principle: that is, two tags are deemed similar if they have been associated to similar resources, and vice-versa two resources are deemed similar if they have been labelled by similar tags. We offer an efficient realisation of this similarity metric, and assess its quality experimentally, by comparing it against cosine similarity, on three large-scale datasets, namely Bibsonomy, MovieLens and CiteULike.

研究の動機と目的

  • パワー則的タグ分布を特徴とする大規模で現実世界のフォルクソノミーにおいて、コサイン類似度やジャカード係数といった従来の類似度測定法の限界を解消すること。
  • タグの共起がまれであるスパースかつ非独立なフォルクソノミー・データにおいて、既存の測定法が低性能にとどまることを克服すること。
  • タグとリソースの間での相互強化を通じて意味的関連性を捉える類似度測定法を開発すること。
  • 未加工の現実世界のフォルクソノミー・データセット上で、本稿で提案するメトリクスとコサイン類似度を実証的に比較すること。
  • 反復的かつ相互強化に基づく類似度計算が、現実的な環境下で標準的手法よりも高い正確性と再現率を達成できることを示すこと。

提案手法

  • 本手法は、相互強化の原則に基づく:同じリソースに共起するタグは類似するとみなされ、類似したタグでマークされたリソースも類似するとみなされる。
  • 反復的なアルゴリズムを用いて、タグ類似度とリソース類似度を同時に計算し、各ラウンドで他方のエンティティセットの現在の状態に基づいて類似度スコアを更新する。
  • 実験により、3つの大規模データセットにおいても収束が速いことが示され、データのスパarsityにもかかわらず、効率的に実装可能である。
  • 類似度計算は、ユーザー、リソース、タグの3部構造のフォルクソノミー・モデルに基づき、タグの割り当てがコアとなるデータ構造を形成する。
  • コサイン類似度とは異なり、タグの意味的独立性を仮定せず、同義語や多義語の処理を自然に行えるように設計されている。
  • 本手法は、未加工の現実世界のデータセット上で、コサイン類似度と比較して正確性と再現率の指標を用いて評価されている。

実験結果

リサーチクエスチョン

  • RQ1パワー則的タグ分布を示す現実的で大規模なフォルクソノミーにおいて、コサイン類似度のような従来の類似度測定法は、タグの関連性を効果的に測定できるか?
  • RQ2タグとリソースの間の相互強化原理は、スパースなフォルクソノミー・データにおいて、標準的手法よりも正確な類似度推定を可能にするか?
  • RQ3未処理の現実世界のデータセットにおいて、本稿で提案する反復的類似度メトリクスは、コサイン類似度と比較して正確性と再現率でどのように性能を発揮するか?
  • RQ4タグの非独立性と共起のスパarsityが、フォルクソノミーにおける標準的類似度測定法の信頼性にどの程度影響を及ぼすか?
  • RQ5フィードバックに基づく反復的類似度計算は、大規模でスパースなフォルクソノミー環境でも、速やかに収束し、意味のある結果を提供できるか?

主な発見

  • 提案された相互強化型類似度メトリクスは、BibSonomy や MovieLens、CiteULike といった未処理の現実世界のデータセットにおいて、コサイン類似度よりも顕著に高い正確性と再現率を達成した。
  • パワー則的タグ分布と極めて低い共起頻度のため、従来の測定法(コサイン類似度など)は現実のフォルクソノミーでは類似度スコアがほぼゼロになってしまう。
  • 本手法の反復的性質により、極めてスパースなデータ環境でもタグとリソースの類似度を効果的に学習できる。
  • 事前定義されたオントロジーもデータの前処理も不要で、同義語や多義語の意味的関連性を効果的に捉えることができた。
  • 実際の応用においても収束が速いため、現実世界の推薦・検索システムへの大規模な展開に適している。
  • 実証的結果から、相互強化原理が、独立性に基づく測定法(コサイン類似度など)よりも、より頑健で正確な類似度推定を可能にすることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。