Skip to main content
QUICK REVIEW

[論文レビュー] TKUS: Mining Top-K High-Utility Sequential Patterns

Chunkai Zhang, Zilin Du|arXiv (Cornell University)|Nov 26, 2020
Data Mining Algorithms and Applications参考文献 45被引用数 6
ひとこと要約

本稿では、定量的逐次データベースにおけるトップ-kハイユーティリティ逐次パターン(HUSPs)を抽出するための新規アルゴリズム、TKUSを提案する。Sequence Utility Raising、Terminate Descendants Early、Eliminate Unpromising Itemsといった戦略を組み合わせたプロジェクションおよびローカルサーチ機構を活用することで、探索空間を効果的に削減し、多様なデータセットにおいて実行時間、メモリ使用量、スケーラビリティの面で最先端の手法を上回る性能を達成した。

ABSTRACT

High-utility sequential pattern mining (HUSPM) has recently emerged as a focus of intense research interest. The main task of HUSPM is to find all subsequences, within a quantitative sequential database, that have high utility with respect to a user-defined minimum utility threshold. However, it is difficult to specify the minimum utility threshold, especially when database features, which are invisible in most cases, are not understood. To handle this problem, top-k HUSPM was proposed. Up to now, only very preliminary work has been conducted to capture top-k HUSPs, and existing strategies require improvement in terms of running time, memory consumption, unpromising candidate filtering, and scalability. Moreover, no systematic problem statement has been defined. In this paper, we formulate the problem of top-k HUSPM and propose a novel algorithm called TKUS. To improve efficiency, TKUS adopts a projection and local search mechanism and employs several schemes, including the Sequence Utility Raising, Terminate Descendants Early, and Eliminate Unpromising Items strategies, which allow it to greatly reduce the search space. Finally, experimental results demonstrate that TKUS can achieve sufficiently good top-k HUSPM performance compared to state-of-the-art algorithm TKHUS-Span.

研究の動機と目的

  • ハイユーティリティ逐次パターン抽出(HUSPM)における適切な最小ユーティリティ閾値の設定という課題に取り組むこと。これは、分野知識が不足しているため、しばしば困難である。
  • トップ-k HUSPM問題を体系的に定式化し、初めて明確な問題定義を提示すること。
  • 探索空間を削減し、実行時間、メモリ消費量、スケーラビリティの観点で性能を向上させる効率的なアルゴリズムを設計すること。
  • 実世界および合成データセットを対象としたトップ-k HUSPs抽出において、既存の最先端手法(例:TKHUS-Span)を上回ること。

提案手法

  • TKUSは、有望な部分列ブランチに計算を集中させるため、プロジェクションおよびローカルサーチ機構を採用し、グローバルな探索空間を削減する。
  • 探索の初期段階で高ユーティリティ候補を推定・優先順位付けするため、Sequence Utility Raising(SUR)戦略を統合する。
  • 現在のk番目の最高ユーティリティを超えることがない部分木は、不要な探索を避けるために、Terminate Descendants Early(TDE)戦略で pruning する。
  • ユーティリティの上限とシーケンス構造に基づき、トップ-k HUSPsに寄与できないと判明したアイテムを、Eliminate Unpromising Items(EUI)戦略で削除する。
  • 1-および2-シーケンスのユーティリティとPEU(Projected Estimated Utility)値を維持することで、効率的な pruning と候補生成を支援する。
  • SURを用いて最小ユーティリティ閾値を動的に調整し、収束を加速させるとともに、候補生成を削減する。

実験結果

リサーチクエスチョン

  • RQ1トップ-kハイユーティリティ逐次パターン抽出問題を、体系的かつ形式的に定式化する方法は何か?
  • RQ2完全性を損なわずに、トップ-k HUSPMにおける探索空間を効果的に削減するアルゴリズム的戦略は何か?
  • RQ3実行時間、メモリ使用量、スケーラビリティの観点から、TKUSは既存の最先端手法(例:TKHUS-Span)と比較してどのように差をつけるか?
  • RQ4SUR、TDE、EUIといった異なる pruning 戦略が、トップ-k HUSPMの効率性およびパフォーマンスに与える影響は何か?
  • RQ5データセットサイズの増加およびkの値の変化に伴い、TKUSのパフォーマンスはどのようにスケーリングするか?

主な発見

  • すべてのデータセットにおいて、TKUSはTKHUS-Spanよりも著しく高速な実行時間を達成しており、kが増加するにつれて性能差が拡大する傾向にあり、特に大きなデータセットで顕著である。
  • テストした5つのデータセットのうち4つにおいて、TKUSはTKHUS-Spanよりも少ないメモリを使用しており、特に効果的な pruning 戦略による候補処理の削減が要因である。
  • TKUSのメモリ使用量はkの増加に伴い上昇するが、一部のデータセット(例:Signデータセット)ではk=1000で急激に低下する非単調な挙動を示す。
  • 合成データベース(10K〜120Kシーケンス)を用いた実験から、データセットサイズに対して実行時間およびメモリ使用量の両方が線形にスケーリングすることが示された。
  • 実世界データ(Yoochoose、Sign、Kosarak、Syn80k)および合成データを含む多様なデータセットにおいて、TKUSは安定したパフォーマンスを示し、強靭性と一般化能力を確認した。
  • Yoochooseデータセットでは1-および2-シーケンスの計算コストが非常に高いため、計算負荷は高くなるが、全体としての性能とスケーラビリティは維持されており、競争力がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。