Skip to main content
QUICK REVIEW

[論文レビュー] Mining high on-shelf utility itemsets with negative values from dynamic updated database

Anjali N. Radkar, Sayali Pawar|arXiv (Cornell University)|Jul 7, 2015
Data Mining Algorithms and Applications参考文献 12被引用数 3
ひとこと要約

本稿では、時間的データベースにおいて変化し続ける中で、負の利益を伴う高スループットユーティリティアイテムセットを動的にマイニングするアルゴリズムを提案する。この手法は、再計算から始めず、結果を段階的に更新することで、計算コストを著しく削減しながら、時間経過に伴うアイテムセットのユーティリティ(包括的)を正確に捉える。

ABSTRACT

Utility mining emerged to overcome the limitations of frequent itemset mining by considering the utility of an item. Utility of an item is based on user's interest or preference. Recently, temporal data mining has become a core technical data processing technique to deal with changing data. On-shelf utility mining considers on-shelf time period of item and gets the accurate utility values of itemsets in temporal database. In traditional on-shelf utility mining, profits of all items in databases are considered as positive values. However, in real applications, some items may have negative profit. Most of the traditional algorithms are used to handle static database. In practical situations, temporal databases are continually appended or updated. High on-shelf utility itemsets needs to be updated. Re-running the temporal mining algorithm every time is ineffective since it neglects previously discovered itemsets. It repeats the work done previously. In this paper, an effective algorithm is proposed to find high on-shelf utility itemsets with negative values from the dynamic updated temporal database.

研究の動機と目的

  • 従来のスループットユーティリティマイニングの限界を是正するため、アイテムに正の利益しか想定しないという前提を解消すること。
  • 継続的に更新される時間的データベースにおいて、高ユーティリティアイテムセットを効率的に発見すること。
  • 現実の状況(損失やコスト)を反映させるために、アイテムに負のユーティリティ値をサポートすること。
  • データベースの変更ごとに全再処理を行うのではなく、結果を段階的に更新することで計算コストを低減すること。
  • スループット期間とアイテム固有の利益/損失値を両方考慮することで、ユーティリティ推定の正確性を維持すること。

提案手法

  • コストや損失を反映させるために、アイテムに負のユーティリティ値を含めるようにスループットユーティリティモデルを拡張する。
  • 事前に発見されたアイテムセットを活用することで再計算を回避する、段階的更新メカニズムを導入する。
  • スループット期間とユーティリティ値に基づいて、アイテムセットユーティリティを動的に追跡する構造を維持する。
  • 正負の両方の寄与を考慮して、時間経過にわたるアイテムユーティリティを集約するユーティリティ計算を適用する。
  • 段階的更新中の探索空間を削減するために、ユーティリティの境界に基づくプルーニング戦略を採用する。
  • 新しいまたは変更されたトランザクションを効率的に処理する、トランザクションベースの更新メカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1スループットユーティリティマイニングを、負のユーティリティ値を伴うアイテムに対応させるにはどうすればよいか?
  • RQ2動的に更新される時間的データベースにおいて、高スループットユーティリティアイテムセットを効率的に維持するにはどうすればよいか?
  • RQ3段階的更新により、データベースの変更後にユーティリティマイニングアルゴリズムを再実行する際の計算コストを低減できるか?
  • RQ4負のユーティリティ値の導入が、マイニングされたアイテムセットの正確性および完全性に与える影響は何か?
  • RQ5段階的更新の過程で、事前に発見されたアイテムセットを効果的に再利用するにはどのようなメカニズムが必要か?

主な発見

  • 本手法は、過去の結果を再利用し、冗長な計算を最小限に抑えることで、全再処理に比べて顕著な性能向上を達成する。
  • 本手法は、損失やコストを伴う現実のビジネス状況を反映させるために、負のユーティリティ値を有するアイテムセットを正確に捉える。
  • 特に頻繁に更新されるデータベースでは、段階的更新がバッチ処理に比べて時間計算量を低減する。
  • スループット期間とユーティリティの符号(正/負)の両方を考慮することで、アルゴリズムは高ユーティリティアイテムセットを正確に維持する。
  • 実験的評価により、増加するデータベースサイズおよび更新頻度に対しても、段階的アプローチがより良好にスケーリングすることが示された。
  • 進化する取引データを伴うリアルタイムまたはニアリアルタイムのデータマイニングアプリケーションへの実用的導入を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。