Skip to main content
QUICK REVIEW

[論文レビュー] Safe Pattern Pruning: An Efficient Approach for Predictive Pattern Mining

Kazuya Nakagawa, Shinya Suzumura|arXiv (Cornell University)|Feb 15, 2016
Data Mining Algorithms and Applications参考文献 9被引用数 6
ひとこと要約

本稿では、1回のデータベース走査で最適な予測モデルに必要なすべてのパターンの上位集合を特定する、効率的な予測パターンマイニングのための新規手法であるSafe Pattern Pruning (SPP) を提案する。安全特徴スクリーニングにインspiredされ、予測に寄与しないパターンおよびその子孫を保証的に削除するプルーニングルールを採用しており、繰り返しデータベーススキャンを要するブースティング手法と比較して、大幅に計算量を削減する。

ABSTRACT

In this paper we study predictive pattern mining problems where the goal is to construct a predictive model based on a subset of predictive patterns in the database. Our main contribution is to introduce a novel method called safe pattern pruning (SPP) for a class of predictive pattern mining problems. The SPP method allows us to efficiently find a superset of all the predictive patterns in the database that are needed for the optimal predictive model. The advantage of the SPP method over existing boosting-type method is that the former can find the superset by a single search over the database, while the latter requires multiple searches. The SPP method is inspired by recent development of safe feature screening. In order to extend the idea of safe feature screening into predictive pattern mining, we derive a novel pruning rule called safe pattern pruning (SPP) rule that can be used for searching over the tree defined among patterns in the database. The SPP rule has a property that, if a node corresponding to a pattern in the database is pruned out by the SPP rule, then it is guaranteed that all the patterns corresponding to its descendant nodes are never needed for the optimal predictive model. We apply the SPP method to graph mining and item-set mining problems, and demonstrate its computational advantage.

研究の動機と目的

  • 複数回のデータベーススキャンを要する従来の直接的手法による予測パターンマイニングの計算非効率性を解消すること。
  • パターン選択とモデル適合を別々に最適化する2段階的手法の限界を克服し、部分最適な結果を避けること。
  • すべての可能なパターンの全探索を伴わずに、最適な予測モデルに必要なすべてのパターンを特定する手法を開発すること。
  • パターンツリーの構造的性質を活用することで、グラフやアイテムセットなどの高次元パターン空間におけるスケーラブルな予測パターンマイニングを可能にすること。

提案手法

  • 最適モデルに寄与しないパターンおよびその子孫を保証的に削除できる、新しいプルーニングルールであるSafe Pattern Pruning (SPP) を導入する。
  • パターンツリー構造を1回の走査で適用し、データベースの繰り返しスキャンの必要性を排除する。
  • 凸最適化における安全特徴スクリーニングの概念を活用し、パターンが考慮から安全に除外できる条件を導出する。
  • パターンインジケーター上の線形モデルを用いて予測パターンマイニング問題をスパース学習タスクとして定式化し、プルーニングされたパターン集合上で最適化を実行する。
  • 正則化パスを用いてパターンの複雑さを体系的に探索し、SPPが最適化に必要なパターンのみを保持することを保証する。
  • gSpan(グラフ用)、Apriori-類似(アイテムセット用)などのツリーに基づくパターン生成アルゴリズムにSPPルールを統合し、パターン空間の効率的探索を支援する。

実験結果

リサーチクエスチョン

  • RQ11回のデータベース走査で、パターンマイニングにおける最適な予測モデルに必要なすべてのパターンを特定できるか?
  • RQ2特徴選択からの安全スクリーニング原則を、データベース内のパターンの階層的構造にどのように適応できるか?
  • RQ3パターンとその子孫を削除しても、最適モデルに必要な有用な予測パターンが除外されないよう保証するプルーニングルールは何か?
  • RQ4SPPの計算コストは、グラフおよびアイテムセットマイニングタスクにおいて反復的ブースティングベース手法と比べてどの程度か?
  • RQ5従来の直接的手法と比較して、SPPはパターンの走査回数および最適化呼び出し回数をどの程度削減できるか?

主な発見

  • SPPは、特に多くのパターンが活性化されている場合に、ブースティングと比較してパターンツリー内の走査ノード数を数個のオーダーも減少させる。
  • SPPの計算時間はブースティングと比較して顕著に低く抑えられており、主に正則化パラメータλごとに1回の凸最適化問題を解くだけで済むのに対し、ブースティングは各ステップで繰り返し最適化を実行するためである。
  • グラフマイニングタスク(CPDB, mutagenicity, Bergstrom, Karthikeyan)において、SPPはブースティングを上回る高速な合計計算時間を達成しており、特にソルブ時間の向上が性能向上の主因となっている。
  • アイテムセットマイニング(splice, a9a, dna, protein)において、SPPは走査時間および合計計算時間を顕著に短縮しており、特に最大パターンサイズが増加する際の効果が顕著である。
  • SPP手法は、最適セットA*に属するすべてのパターンを保持するため、最終的なモデルが最適であることを保証する。
  • 大規模なデータベースおよび高次元パターン空間に対しても計算的に効率的であり、実世界の予測パターンマイニング応用に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。