Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Frequency: Utility Mining with Varied Item-Specific Minimum Utility

Wensheng Gan, Jerry Chun‐Wei Lin|arXiv (Cornell University)|Feb 25, 2019
Data Mining Algorithms and Applications参考文献 65被引用数 4
ひとこと要約

本稿では、アイテムごとの最小利益閾値を考慮する高利益アイテムセットマイニングのための1段階型ユーティリティマイニングアルゴリズムであるHIMUを提案する。従来の手法が一様な閾値を使用するのに対し、HIMUはその制限を克服する。新規のMIUツリー構造、グローバルおよび条件付き下位閉包性質、効率的なプルーニング戦略を導入することで、実行時間とメモリ使用量を顕著に削減し、『レアアイテム問題』を効果的に緩和するとともに、スケーラビリティと効率性において最先端のアルゴリズムを上回る性能を発揮する。

ABSTRACT

Utility-oriented mining which integrates utility theory and data mining is a useful tool for understanding economic consumer behavior. Traditional algorithms for mining high-utility patterns (HUPs) applies a single/uniform minimum high-utility threshold (minutil) to obtain the set of HUPs, but in some real-life circumstances, some specific products may bring lower utilities compared with others, but their profit may offer some vital information. However, if minutil is set high, the patterns with low minutil are missed; if minutil is set low, the number of patterns becomes unmanageable. In this paper, an efficient one-phase utility-oriented pattern mining algorithm, called HIMU, is proposed for mining HUPs with varied item-specific minimum utility. A novel tree structure called a multiple item utility set-enumeration tree (MIU-tree), the global sorted and the conditional downward closure properties are introduced in HIMU. In addition, we extended the compact utility-list structure to keep the necessary information, and thus this one-phase HIMU model greatly reduces the computational costs and memory requirements. Moreover, two pruning strategies are then extended to enhance the performance. We conducted extensive experiments in several synthetic and real-world datasets; the results indicates that the designed one-phase HIMU algorithm can address the "rare item problem" and has better performance than the state-of-the-art algorithms in terms of runtime, memory usage, and scalability. Furthermore, the enhanced algorithms outperform the non-optimized HIMU approach.

研究の動機と目的

  • すべてのアイテムに同一の均一な最小利益閾値を適用する従来の高利益アイテムセットマイニング(HUIM)手法の制限を解消すること。
  • 製品の利益性や重要性の実世界における差を反映できるように、アイテム別最小利益閾値を許容することで、より現実的で柔軟なユーティリティマイニングを可能にすること。
  • 低利益だが意味のあるアイテムが無視される『レアアイテム問題』を、アイテムごとに閾値を適応的に変更することで効果的に緩和すること。
  • 候補生成や複数回のデータベーススキャンを回避する1段階の効率的アルゴリズムを設計し、計算コストを低減すること。
  • 実世界および合成データセットにおけるスケーラビリティとパフォーマンスを向上させるために、新規のデータ構造とプルーニング戦略を導入すること。

提案手法

  • 候補生成を伴わずに高利益アイテムセットを直接列挙できるコンパactなツリー構造である、複数アイテムユーティリティセット列挙木(MIUツリー)を提案する。
  • 反単調性を保証し、有望でないアイテムセットを効果的にプルーニングできるように、グローバルおよび条件付き下位閉包性質(GDCおよびCDC)を導入する。
  • 必要なユーティリティ情報を効率的に格納するため、コンパクトなユーティリティリスト構造を採用し、メモリ使用量を最小限に抑える。
  • 非有望な分岐を早期に削除することでマイニングを加速する2つの強化プルーニング戦略(EUCP:効率的ユーティリティ圧縮プルーニング、LAP:利活用された反単調プルーニング)を設計する。
  • 軽量なEUCS構造を用いて、2アイテムセットのTWU(総加重利益)値を保持するようにユーティリティリスト構造を拡張する。
  • 複数回のデータベーススキャンや生成・テストフェーズを回避する1段階のマイニングプロセスを実装し、MIUツリーから直接高利益アイテムセットを発見する。

実験結果

リサーチクエスチョン

  • RQ1利益の程度に差があるアイテムが存在する状況において、それぞれのアイテムに異なる最小利益閾値を設定する必要がある場合、高利益アイテムセットマイニングはどのように改善できるか?
  • RQ21段階型アルゴリズムは、従来のレベルワイズまたは候補生成ベースのHUIM手法と比較して、実行時間、メモリ使用量、スケーラビリティの面で優れているか?
  • RQ3低利益だが意味のあるアイテムが除外されてしまう『レアアイテム問題』は、どのように効果的に緩和できるか?
  • RQ4ユーティリティ指向パターン探索におけるメモリ消費量の低減とマイニングの高速化を実現するため、どのような新規データ構造とプルーニング技術を設計できるか?
  • RQ5提案されたプルーニング戦略(EUCPおよびLAP)は、ベースラインのHIMUおよび最先端のアルゴリズムと比較して、どの程度パフォーマンスを向上させるか?

主な発見

  • HIMUアルゴリズムは、HUI-MMUおよびHUI-MMU TIDと比較して、特に大規模データセットにおいて実行時間が顕著に短縮され、メモリ使用量も大幅に削減された。
  • 強化されたHIMU EUCP、HIMU LAP、HIMU ELPアルゴリズムは、実行時間、メモリ消費量、生成されたアイテムセット数のすべての指標でベースラインHIMUを上回った。
  • MIUツリー構造により、候補生成や複数回のデータベーススキャンを回避できるため、計算オーバーヘッドが低減された。
  • グローバルおよび条件付き下位閉包性質により、正しさが保証されるとともに、効果的なプルーニングが可能となり、効率性が向上した。
  • 発見されたHUI(高利益アイテムセット)の数は、常にHTWUI(高総加重利益アイテムセット)の数よりも少なくなっていた。これは、アルゴリズムが意味の薄いパターンを効果的にフィルタリングしていることを確認するものである。
  • スケーラビリティ実験の結果、データセットサイズが大きくなるにつれてHIMUとベースラインアルゴリズムの性能差が拡大し、優れたスケーラビリティが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。