Skip to main content
QUICK REVIEW

[論文レビュー] Mining Frequent Itemsets over Uncertain Databases

Yongxin Tong, Lei Chen|arXiv (Cornell University)|Aug 1, 2012
Data Mining Algorithms and Applications参考文献 29被引用数 4
ひとこと要約

本稿は、不確実性を持つデータベースにおける頻度の高い項目集合を抽出するアルゴリズムの包括的な実験的比較を提供し、期待支持に基づく定義と確率的頻度の高い項目集合の2つの定義の関係を明確にした。大規模なデータベースにおいて、これらの定義はリャプノフ中心極限定理を介して密接に結びついており、正規分布による近似が可能となることが示された。また、近似に基づくアルゴリズムが正確な手法に比べて、速度とメモリ効率の面で顕著に優れていることを示した。

ABSTRACT

In recent years, due to the wide applications of uncertain data, mining frequent itemsets over uncertain databases has attracted much attention. In uncertain databases, the support of an itemset is a random variable instead of a fixed occurrence counting of this itemset. Thus, unlike the corresponding problem in deterministic databases where the frequent itemset has a unique definition, the frequent itemset under uncertain environments has two different definitions so far. The first definition, referred as the expected support-based frequent itemset, employs the expectation of the support of an itemset to measure whether this itemset is frequent. The second definition, referred as the probabilistic frequent itemset, uses the probability of the support of an itemset to measure its frequency. Thus, existing work on mining frequent itemsets over uncertain databases is divided into two different groups and no study is conducted to comprehensively compare the two different definitions. In addition, since no uniform experimental platform exists, current solutions for the same definition even generate inconsistent results. In this paper, we firstly aim to clarify the relationship between the two different definitions. Through extensive experiments, we verify that the two definitions have a tight connection and can be unified together when the size of data is large enough. Secondly, we provide baseline implementations of eight existing representative algorithms and test their performances with uniform measures fairly. Finally, according to the fair tests over many different benchmark data sets, we clarify several existing inconsistent conclusions and discuss some new findings.

研究の動機と目的

  • 不確実性を持つデータベースにおける頻度の高い項目集合の2つの既存の定義—期待支持に基づくものと確率的頻度の高い項目集合—の理論的かつ実験的関係を明確化すること。
  • 一貫した実験的条件下で、8つの代表的アルゴリズムの公平で一貫性のあるパフォーマンス評価を提供すること。
  • 標準化されたメトリクスを用いた多様なベンチマークデータセットでのアルゴリズムのテストを通じて、先行研究における不整合を解消すること。
  • 正確なアルゴリズムと近似アルゴリズムにおける新しいパフォーマンスパターンと効率性のトレードオフを同定・検証すること。

提案手法

  • 期待支持に基づくおよび確率的頻度の高い項目集合抽出のための8つの代表的アルゴリズムのベースライン実装を提案する。
  • 複数のベンチマークデータセットを用いて、一貫性のある評価指標(実行時間、メモリ使用量)を用いて公平な比較を実施する。
  • リャプノフ中心極限定理を適用し、大規模なデータベースでは項目集合の支持度がポアソン二項分布に従うが、正規分布による近似が妥当であることを裏付ける。
  • 正確な確率的アルゴリズムにおいて、チェルノフの不等式を用いて頻度の低い項目集合を早期に除外することで、効率を向上させる。
  • 期待支持と分散に基づいた累積分布関数(CDF)の近似を用いて、頻度の高い確率を計算する。
  • 合成および実世界の不確実性を持つデータベースを用いた広範な実験を通じて、主張を検証する。密度と最小支持度の閾値が異なる条件で評価を実施した。

実験結果

リサーチクエスチョン

  • RQ1不確実性を持つデータベースにおいて、期待支持に基づく頻度の高い項目集合と確率的頻度の高い項目集合の定義はどのように関係しているか?
  • RQ2既存のアルゴリズムは、異なるデータセットや設定において一貫したパフォーマンス順位を示すのか?
  • RQ3正規分布に基づく近似を用いることで、確率的頻度の高い項目集合抽出問題を効率的に解くことができるか?
  • RQ4速度とメモリ使用量の観点から、正確なアルゴリズムと近似アルゴリズムの相対的なパフォーマンスのトレードオフは何か?
  • RQ5どのような条件下で近似アルゴリズムがほぼ完全な正確性(近似1)を達成し、その理由は何か?

主な発見

  • 項目集合の数が10,000を超えると、期待支持に基づく定義と確率的頻度の高い項目集合の定義は密接に結びついており、正規分布による近似が可能となる。
  • 近似に基づく確率的頻度の高い項目集合抽出アルゴリズムは、大規模なデータベースにおいて、大多数の項目集合でほぼ100%の頻度(≈1)を達成し、理論的近似の妥当性が裏付けられた。
  • 正規分布に基づくアルゴリズムは、ポアソンに基づく手法に比べて、速度とメモリ効率の両面で顕著に優れている。
  • 期待支持に基づく抽出では、密度が高く最小支持度が大きいデータベースではUAprioriが最も速く、スパースまたは最小支持度が低い環境ではUH-Mineが優れている。
  • 正確な確率的アルゴリズムにおいては、DCが大多数のケースで最も速いが、再帰的な結果の保存により高いメモリコストを要する。条件が許せばDPはDCより高速である。
  • 近似アルゴリズムは、効率性とメモリ使用量の両面で正確なアルゴリズムを常に上回っており、既存の期待支持に基づく解決策が分散の計算を追加することで確率的抽出に拡張可能であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。