Skip to main content
QUICK REVIEW

[論文レビュー] An Enhanced Apriori Algorithm for Discovering Frequent Patterns with Optimal Number of Scans

Sudhir Tirumalasetty, Aruna Jadda|arXiv (Cornell University)|Jun 23, 2015
Data Mining Algorithms and Applications被引用数 5
ひとこと要約

本論文では、候補生成段階で関連するトランザクションのみを的確にスキャンすることで、頻出パターンを発見するために必要なデータベーススキャン回数を削減する、拡張されたAprioriアルゴリズムを提案する。スキャン頻度を最適化することで、正確性を損なうことなく、処理時間における最適なパフォーマンスを実現する。

ABSTRACT

Data mining is wide spreading its applications in several areas. There are different tasks in mining which provides solutions for wide variety of problems in order to discover knowledge. Among those tasks association mining plays a pivotal role for identifying frequent patterns. Among the available association mining algorithms Apriori algorithm is one of the most prevalent and dominant algorithm which is used to discover frequent patterns. This algorithm is used to discover frequent patterns from small to large databases. This paper points toward the inadequacy of the tangible Apriori algorithm of wasting time for scanning the whole transactional database for discovering association rules and proposes an enhancement on Apriori algorithm to overcome this problem. This enhancement is obtained by dropping the amount of time used in scanning the transactional database by just limiting the number of transactions while calculating the frequency of an item or item-pairs. This improved version of Apriori algorithm optimizes the time used for scanning the whole transactional database.

研究の動機と目的

  • 頻出パターン抽出の過程で繰り返し全データベーススキャンが行われる伝統的なAprioriアルゴリズムの非効率性を是正すること。
  • 大規模なトランザクショナルデータベースにおける計算オーバーヘッドを、重複スキャンを最小限に抑えることで低減すること。
  • 候補アイテムセット生成のためのスキャン回数を最適化しながらも、正確性を維持する手法を開発すること。
  • トランザクショナルデータベースにおける効果的な頻出パターン抽出を実現するための最適なスキャン回数を達成すること。

提案手法

  • アルゴリズムは、データベーススキャンを、候補アイテムを含むトランザクションに限定することで、各イテレーションで全スキャンを回避する。
  • 候補アイテムセットのサポートカウント計算時に、関連するトランザクションのみにアクセスする、選択的スキャン戦略を採用する。
  • 有望でないアイテムセットを早期にフィルタリングする候補生成メカニズムを用いることで、繰り返しの全スキャンの必要性を低減する。
  • 事前にトランザクション内でのアイテムの存在を把握した上で、関連するデータベースサブセットに基づいてサポートカウントを計算する。
  • アイテムセットのサイズと頻度に応じて、スキャン範囲を動的に調整することで、I/Oオーバーヘッドを最小限に抑える。
  • コアとなるAprioriフレームワークを維持しつつ、不要なアクセスを減らすスマートなトランザクションフィルタリング機構を導入する。

実験結果

リサーチクエスチョン

  • RQ1頻出パターン抽出において、正確性を損なわずに、Aprioriアルゴリズムにおける全データベーススキャン回数をどのように最小化できるか。
  • RQ2候補アイテムセットのサポートカウント計算時に、関係のないトランザクションを特定・除外するための基準は何か。
  • RQ3選択的スキャンは、大規模データベースにおける関連ルールマイニングの時間的効率を向上させ得るか。
  • RQ4スキャン頻度の低減が、Aprioriアルゴリズム全体のパフォーマンスとスケーラビリティに及ぼす影響はどの程度か。
  • RQ5トランザクショナルデータベースにおける効果的な頻出パターン抽出を実現するための最適なスキャン回数は何か。

主な発見

  • 提案手法は、スキャン回数を最適レベルにまで削減し、処理時間を顕著に短縮した。
  • アイテムの存在に基づく選択的スキャンにより、全データベーススキャンに比べて、候補サポートの計算が高速化された。
  • 元のAprioriアルゴリズムと同等の正確性を維持しながら、効率性が向上した。
  • 関連するトランザクションにのみ焦点を当てることで、I/Oオーバーヘッドが低減され、大規模データベースにおけるスケーラビリティが向上した。
  • 特に大規模なトランザクショナルデータセットにおいて、実行時間に顕著なパフォーマンス向上が得られた。
  • 各イテレーションで関係のないトランザクションを知的にフィルタリングすることで、最適なスキャン回数を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。