Skip to main content
QUICK REVIEW

[論文レビュー] Towards Target Sequential Rules

Wensheng Gan, Gengsen Huang|arXiv (Cornell University)|Jun 9, 2022
Data Mining Algorithms and Applications被引用数 4
ひとこと要約

この論文は、ユーザー指定のターゲットイベントに関連するルールのみを効率的に発見する、新たな手法である標的順序ルールマイニング(TSRM)を導入する。これは、関係のないルールの爆発的増加を回避する。提案されたTaSRMアルゴリズムは、標的プルーニングと最適化戦略を用い、さまざまなクエリシナリオとデータセットにおいて、実行時間、メモリ使用量、スケーラビリティの面でベースライン手法を著しく上回る性能を発揮する。

ABSTRACT

In many real-world applications, sequential rule mining (SRM) can provide prediction and recommendation functions for a variety of services. It is an important technique of pattern mining to discover all valuable rules that belong to high-frequency and high-confidence sequential rules. Although several algorithms of SRM are proposed to solve various practical problems, there are no studies on target sequential rules. Targeted sequential rule mining aims at mining the interesting sequential rules that users focus on, thus avoiding the generation of other invalid and unnecessary rules. This approach can further improve the efficiency of users in analyzing rules and reduce the consumption of data resources. In this paper, we provide the relevant definitions of target sequential rule and formulate the problem of targeted sequential rule mining. Furthermore, we propose an efficient algorithm, called targeted sequential rule mining (TaSRM). Several pruning strategies and an optimization are introduced to improve the efficiency of TaSRM. Finally, a large number of experiments are conducted on different benchmarks, and we analyze the results in terms of their running time, memory consumption, and scalability, as well as query cases with different query rules. It is shown that the novel algorithm TaSRM and its variants can achieve better experimental performance compared to the existing baseline algorithm.

研究の動機と目的

  • 大規模データセットをマイニングする際、従来の順序ルールマイニング(SRM)が過剰で関係のないルールを生成するという非効率性に対処すること。
  • ユーザー指定のターゲットイベントに焦点を当てた、標的順序ルールマイニング(TSRM)の問題を定義し、形式化すること。
  • 非関連ルールを早期にプルーニングし、ユーザー定義のクエリルールに基づいて検索を最適化する、効率的なアルゴリズムTaSRMを設計すること。
  • 異なるデータサイズ、サポート閾値、クエリパターンにおけるTaSRMのバリアントのスケーラビリティと性能を評価すること。
  • マイニングの効率は、データセット全体のサイズではなく、ターゲットルールの数に依存するという点を示すこと。

提案手法

  • ユーザー指定のターゲットイベントを含む結果部を持つ、標的順序ルールの形式的定義を提案する。
  • クエリルールの前件と結果に基づいて、シーケンスとルールをフィルタリングすることで、標的マイニングを実行するTaSRMアルゴリズムを導入する。
  • 関連するシーケンスのみを格納・走査できる最適化された木構造(UTP)を採用し、メモリ使用量と計算量を削減する。
  • クエリ構造に一致しない候補ルールをプロセスの初期段階で早期にプルーニングする戦略を適用する。
  • 異なるクエリタイプに対応するための強化されたプルーニングと最適化を備えた、2つのバリアント(TaSRM V2およびTaSRM V3)を導入する。
  • 最小サポート(minsup)と最小信頼度(minconf)の閾値を用いるが、計算はターゲットに関連するルールに限定して実行する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして順序ルールマイニングを見直し、ユーザー指定のターゲットイベントに関連するルールにのみ焦点を当てるようにできるか?
  • RQ2標的ルールマイニングの効率を向上させるために、どのようなプルーニングおよび最適化技術を適用できるか?
  • RQ3実行時間、メモリ使用量、スケーラビリティの観点から、TaSRMはRuleGrowthなどのベースラインアルゴリズムと比べてどのように性能を発揮するか?
  • RQ4前件のみ、または結果部のみが指定されたクエリ(例:前件のみ指定)のような異なるクエリパターンが、マイニング効率にどのように影響を与えるか?
  • RQ5データセットサイズではなく、ターゲット順序ルールの数が、アルゴリズムのスケーラビリティを決定づけるか?

主な発見

  • すべてのテストデータセットにおいて、ベースラインのRuleGrowthアルゴリズムと比較して、TaSRMおよびそのバリアントは著しく優れた実行時間と低いメモリ使用量を達成している。
  • フィルタリング率が高いケース(例:前件のみ指定時、99.03%のフィルタリング率)では、TaSRM V2およびTaSRM V3が優れた性能を示している。
  • フィルタリング率が低いケース(例:結果部のみ指定時)では、TaSRM V1は有効なプルーニングが不十分なため性能が低く、一方でTaSRM V3はTaSRM V2に比べ顕著な改善を示している。
  • TaSRMバリアントの実行時間およびメモリ使用量は、主にターゲット順序ルールの数に応じて増加するが、データセット全体のサイズとは無関係であるため、強力なスケーラビリティを示している。
  • 最小サポートを低く設定しても、アルゴリズムは高い効率性を維持しており、低閾値マイニング環境でも頑健であることが実験で確認された。
  • 実験により、TaSRMの性能は多様な実世界のデータセットおよびクエリパターンにおいて安定的かつ効率的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。