Skip to main content
QUICK REVIEW

[論文レビュー] FUIM: Fuzzy Utility Itemset Mining

Shicheng Wan, Wensheng Gan|arXiv (Cornell University)|Oct 30, 2021
Data Mining Algorithms and Applications参考文献 40被引用数 7
ひとこと要約

本稿では、新しいファジィリストデータ構造とタイトな上限モデルを用いて、高ファジィユーティリティアイテムセット(HFUIs)を効率的に発見する1段階のファジィユーティリティアイテムセットマイニングアルゴリズムであるFUIMを提案する。ファジィ集合理論と最適化された pruning を活用することで、最先端の手法(TPFUなど)と比較して最大3桁の高速化を達成し、メモリ使用量を著しく削減するとともに、優れたスケーラビリティを実現した。

ABSTRACT

Because of usefulness and comprehensibility, fuzzy data mining has been extensively studied and is an emerging topic in recent years. Compared with utility-driven itemset mining technologies, fuzzy utility mining not only takes utilities (e.g., profits) into account, but also considers quantities of items in each transaction for discovering high fuzzy utility itemsets (HFUIs). Thus, fuzziness can be regard as a key criterion to select high-utility itemsets, while the exiting algorithms are not efficient enough. In this paper, an efficient one-phase algorithm named Fuzzy-driven Utility Itemset Miner (FUIM) is proposed to find out a complete set of HFUIs effectively. In addition, a novel compact data structure named fuzzy-list keeps the key information from quantitative transaction databases. Using fuzzy-list, FUIM can discover HFUIs from transaction databases efficiently and effectively. Both completeness and correctness of the FUIM algorithm are proved by five theorems. At last, substantial experiments test three terms (runtime cost, memory consumption, and scalability) to confirm that FUIM considerably outperforms the state-of-the-art algorithms.

研究の動機と目的

  • 2段階のファジィユーティリティマイニングアルゴリズムが生成する過剰な候補アイテムセットの低効率性を解消すること。
  • ファジィユーティリティマイニングにおける下位クロージャー性の欠如に起因する、pruning の複雑化と計算コストの増加を克服すること。
  • 定量的取引データベースからの重要な情報を保持する、コンactな効果的なデータ構造(ファジィリスト)を構築すること。
  • ファジィ集合理論に基づく新しい上限モデルを設計し、探索空間を縮小し、深すぎるDFS走査を回避すること。
  • 既存手法と比較して、優れた実行時間、メモリ効率、スケーラビリティを実現しながら、高ファジィユーティリティアイテムセット(HFUIs)を完全かつ正確に発見すること。

提案手法

  • FUIMは、候補生成フェーズを避けるため、マイニングとデータ構造構築を統合した1段階マイニング戦略を採用している。
  • ファジィリストというデータ構造を導入し、ファジィユーティリティと残りユーティリティといったアイテムセットの情報を効果的に格納することで、効率的なpruningと走査を可能にしている。
  • ファジィ集合理論における最小演算を用いてアイテムセットのファジィユーティリティを計算し、最大演算を用いてタイトな上限を導出することで、pruningを実現している。
  • 残りファジィユーティリティに基づく新しい上限モデルを提案し、有望でないアイテムセットを早期に除外することで、探索空間を顕著に縮小している。
  • アイテム処理にFUUB上昇順を採用することで、実験的に実行時間と訪問ノード数を削減し、性能向上を実現している。
  • 5つの定理による理論的証明を通じて、FUIMの完全性と正しさが確立されており、有効なHFUIが見逃されないことが保証されている。

実験結果

リサーチクエスチョン

  • RQ12段階アルゴリズムの候補生成のオーバーヘッドを回避することで、ファジィユーティリティマイニングをどのようにより効率化できるか?
  • RQ2ファジィユーティリティ情報をコンパクトに表現しつつ、高速なpruningと走査を可能にするデータ構造は何か?
  • RQ3ファジィ集合理論に基づくよりタイトな上限モデルは、ファジィユーティリティマイニングにおける探索空間を顕著に縮小できるか?
  • RQ4アイテムの処理順序は、FUIMのようなファジィユーティリティマイニングアルゴリズムの性能にどのように影響を与えるか?
  • RQ5実データおよび合成データセットにおいて、FUIMは既存手法と比較して、実行時間、メモリ消費量、スケーラビリティの観点でどの程度優れているか?

主な発見

  • FUIMは、TPFUアルゴリズムと比較して最大3桁の高速化を達成した。特に最速のバージョン(FUIM 3)は、FUIM 2の実行時間の約1/3にまで短縮された。
  • foodmartデータセットでは、FUIMは51.84 MBのメモリを使用したが、TPFUは698.96 MBを要した。これは顕著なメモリ効率の優位性を示している。
  • retailデータセットにおいて、γ = 0.1‰の条件下で、FUUB上昇順の処理は、降順処理と比較して300秒以上の実行時間短縮を実現した。
  • よりタイトな上限を用いるFUIM 3は、実行時間とメモリ消費量の両面でFUIM 2を上回り、改善された上限の有効性を裏付けた。
  • データセットサイズを40kから100k件に増加させた際、FUIMの実行時間とメモリ使用量は滑らかで線形的なスケーリングを示し、優れたスケーラビリティを示した。
  • 残りファジィユーティリティを用いたpruning戦略がなければ、スパース(kosarak)および密(mushroom)データセットにおいて、10,000秒以内にマイニングを完了できなかった。これは、提案されたpruning機構の必要性を強力に示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。