Skip to main content
QUICK REVIEW

[論文レビュー] A scalable mining of frequent quadratic concepts in d-folksonomies

Mohamed Nader Jelassi, Sadok Ben Yahia|arXiv (Cornell University)|Dec 1, 2012
Rough Sets and Fuzzy Logic参考文献 7被引用数 7
ひとこと要約

本稿では、時間次元を含む形式的概念分析への拡張を通じて、d-フォルクソノミーにおける頻出四概念をスケーラブルに抽出するためのQuadriConsというアルゴリズムを提案する。これにより、ユーザー、タグ、リソース、タイムスタンプの4次元パターンの逐次的発見が可能になる。本手法は、探索空間を縮小するための新しい閉包作用素を導入し、四概念最小生成子を用いることで、MovieLens や Last.fm などの大規模な実世界データセットにおいて高い性能を達成する。

ABSTRACT

Folksonomy mining is grasping the interest of web 2.0 community since it represents the core data of social resource sharing systems. However, a scrutiny of the related works interested in mining folksonomies unveils that the time stamp dimension has not been considered. For example, the wealthy number of works dedicated to mining tri-concepts from folksonomies did not take into account time dimension. In this paper, we will consider a folksonomy commonly composed of triples and we shall consider the time as a new dimension. We motivate our approach by highlighting the battery of potential applications. Then, we present the foundations for mining quadri-concepts, provide a formal definition of the problem and introduce a new efficient algorithm, called QUADRICONS for its solution to allow for mining folksonomies in time, i.e., d-folksonomies. We also introduce a new closure operator that splits the induced search space into equivalence classes whose smallest elements are the quadri-minimal generators. Carried out experiments on large-scale real-world datasets highlight good performances of our algorithm.

研究の動機と目的

  • ユーザー行動の変化や新規トレンドの検出に不可欠な時間次元を統合することで、フォルクソノミーマイニングにおけるギャップを埋める。
  • d-フォルクソノミーにおけるすべての頻出四概念を形式的に定義し、三概念分析を4次元に拡張する。
  • 大規模な d-フォルクソノミー データセットから頻出四概念を抽出するための効率的なアルゴリズム、QuadriCons を開発する。
  • 探索空間を同値類に分割する新しい閉包作用素を導入し、四概念最小生成子をその最小代表元として用いることで、探索の最適化を実現する。
  • 実世界のデータセットを用いた広範な実験を通じて、QuadriCons のスケーラビリティと効率性を実証し、実行時間とメモリ使用量の面で優れた性能を示す。

提案手法

  • 形式的概念分析(FCA)および三概念分析(TCA)を拡張し、ユーザー、タグ、リソース、時間の4次元データ構造を d-フォルクソノミーとしてモデル化する。
  • 四次元関係(4-ary relation)としての二次的コンテキストを定義し、頻出四概念を特定するためのサポート閾値を導入する。
  • 4次元の各部分集合をその最小生成子へ写像する新しい閉包作用素を導入し、探索空間内の同値類を形成する。
  • TriConsフレームワークに基づき、閉包作用素を活用して頻出四概念を効率的に探索・生成する QuadriCons アルゴリズムを設計する。
  • 同値類の標準的代表元として四概念最小生成子(QGs)を用い、重複計算を回避し、マイニングプロセスの高速化を実現する。
  • TriConsで用いられるスイープライン技術のインスピレーションを受けて、4次元ケースに適応した最適化を実装し、大規模データセットにおける性能向上を図る。

実験結果

リサーチクエスチョン

  • RQ1時間次元をフォルクソノミーマイニングに効果的に統合することで、進化するユーザーのタグ付け行動や新規トレンドを捉えることは可能か?
  • RQ2d-フォルクソノミーにおける頻出四概念の形式的定義は何か? また、スケールに応じて効率的に計算することは可能か?
  • RQ3探索空間を分割し、最小生成子を介して効率的なマイニングを可能にするために、閉包作用素を4次元に一般化することは可能か?
  • RQ4実行時間、メモリ使用量、概念の圧縮性の観点から、既存のツール(Data-Peeler)と比較して、提案された QuadriCons アルゴリズムはどの程度の性能向上を達成するか?
  • RQ5頻出四概念は、実世界のフォルクソノミー データにおいて、頻出四セットと比較して、どれほどよりコンパクトかつ情報量の多い表現を提供するのか?

主な発見

  • QuadriCons は、全テストデータセットおよび最小サポート閾値の設定に関わらず、Data-Peeler よりも実行時間とメモリ使用量の両面で顕著に優れている。
  • MovieLens データセット(minsupp_u=2, minsupp_t=1, minsupp_r=1, minsupp_d=1)において、QuadriCons は 95,580 個の三重項を 48.92 秒で処理し、メモリ使用量は 16,556 KB であった。一方、Data-Peeler は 5,965.94 秒と 2,098,452 KB を要した。
  • Last.fm データセット(同じ閾値)において、QuadriCons は 186,479 個の三重項を 88.16 秒で処理し、メモリ使用量は 18,976 KB であった。これに対して Data-Peeler は 3,118.85 秒と 2,188,452 KB を要した。
  • Last.fm データセットでは、頻出四概念の数が頻出四セットの数の最大 28.99% にまで減少しており、四概念がデータの非常にコンパクトな表現を提供していることが示された。
  • 四重組の数が増加するにつれて、圧縮比が上昇する傾向にあり、四概念はパターンの複雑さとサイズが増すほど、ますます有効であることがわかった。
  • アルゴリズムは強力なスケーラビリティを示しており、さまざまなサポート閾値下で、データセットサイズの増加に伴い実行時間とメモリ使用量が劣線形に増加する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。