[論文レビュー] Probabilistic Frequent Pattern Growth for Itemset Mining in Uncertain Databases (Technical Report)
本稿では、候補生成を伴わずに不確実なデータベースにおける確率的頻度アイテムセットを抽出するための、FP-Growthに基づく最初のアルゴリズムであるProFP-Growthを提案する。本研究では、ProFP-Treeと呼ばれるデータ構造と、線形時間でサポート確率分布を計算する生成関数に基づく手法を導入し、ProAprioriなどの最先端手法と比較して顕著な高速化を達成した。
Frequent itemset mining in uncertain transaction databases semantically and computationally differs from traditional techniques applied on standard (certain) transaction databases. Uncertain transaction databases consist of sets of existentially uncertain items. The uncertainty of items in transactions makes traditional techniques inapplicable. In this paper, we tackle the problem of finding probabilistic frequent itemsets based on possible world semantics. In this context, an itemset X is called frequent if the probability that X occurs in at least minSup transactions is above a given threshold. We make the following contributions: We propose the first probabilistic FP-Growth algorithm (ProFP-Growth) and associated probabilistic FP-Tree (ProFP-Tree), which we use to mine all probabilistic frequent itemsets in uncertain transaction databases without candidate generation. In addition, we propose an efficient technique to compute the support probability distribution of an itemset in linear time using the concept of generating functions. An extensive experimental section evaluates the our proposed techniques and shows that our ProFP-Growth approach is significantly faster than the current state-of-the-art algorithm.
研究の動機と目的
- アイテムの存在確率が与えられる不確実なトランザクションデータベースにおける頻度アイテムセット抽出の課題に対処すること。
- メモリ使用量の高さと複数回のデータベーススキャンを伴うAprioriに類するアルゴリズムの限界を克服すること。
- 候補生成を不要とする、効率的な手法を開発して、最小サポート閾値minSup以上のトランザクションで出現確率が閾値τを超える可能性のあるアイテムセット(確率的頻度アイテムセット)を同定すること。
- 圧縮データ構造と数学的最適化を活用して、スケーラブルかつ正確な抽出を実現すること。
提案手法
- 不確実なトランザクションデータベースを圧縮しながらもアイテムセットの存在確率を保持する、FP-Treeの確率的変種であるProFP-Treeを提案する。
- 任意のアイテムセットのサポート確率分布を、アイテム数に比例する線形時間で計算する、新しい生成関数に基づく技術を導入する。
- 可能な世界(possible worlds)の意味論を用いて確率的頻度アイテムセットを定義する:アイテムセットが少なくともminSup件のトランザクションに出現する確率が閾値τを超える場合に、そのアイテムセットは頻度的であるとみなす。
- 条件付きパターンベースと木の走査を用いて、候補生成を一切行わずにすべての確率的頻度アイテムセットを抽出するProFP-Growthアルゴリズムを設計する。
- 木の構築および抽出処理中に、不確実なアイテムとその確率を効率的に管理するための照会テーブルを活用する。
- 生成関数を介して、可能な世界の明示的列挙を避けるために、ポアソン二項分布の再帰関係を暗黙的に適用する。
実験結果
リサーチクエスチョン
- RQ1可能な世界を列挙せずに、不確実なデータベースにおけるアイテムセットのサポート確率分布を効率的に計算する方法は何か?
- RQ2FP-Growth風のアルゴリズムを不確実なデータベースにおいて、候補生成なしに確率的頻度アイテムセットを抽出できるように拡張できるか?
- RQ3不確実なデータベースを効果的に圧縮し、頻度アイテムセット抽出に必要な確率的情報を保持するデータ構造は何か?
- RQ4提案されたProFP-Growthアルゴリズムの実行時間とスケーラビリティは、既存のAprioriベースの手法と比べてどのように異なるか?
- RQ5アイテム出現の不確実性と確定性のレベルが変化する場合、ProFP-Treeのサイズと効率にどのような影響を与えるか?
主な発見
- ProFP-Growthは、テストされたすべての構成において、最先端のProAprioriアルゴリズムを著しく上回る実行時間性能を示し、アイテム数とトランザクション数が増加するにつれて性能向上が顕著になる。
- ProFP-Treeのノード数は、初期の増加を除き、アイテム数に対して線形に増加する傾向を示しており、プレフィックス共有による効率的なメモリ利用を示している。
- 確定的アイテム(P1(x))の数が増加するにつれて、トランザクションのプレフィックス被覆が増加し、ProFP-Treeのサイズが減少する。すべてのアイテムが確率的に存在する場合、最終的には線形リストに退化する。
- 不確実なアイテム数が固定されている限り、トランザクション数が増加しても、不確実なアイテム照会テーブルのサイズは一定のままである。
- minSup閾値が低い場合、両アルゴリズムとも確率的頻度アイテムセットの数が多いため、実行時間が長くなるが、ProFP-Growthは依然として顕著な性能優位性を維持する。
- トランザクション数が増加するにつれて、トランザクションプレフィックスの重複が増加するため、ProFP-Treeのサイズは飽和する傾向を示し、大規模データ処理においてもスケーラブルであることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。