Skip to main content
QUICK REVIEW

[論文レビュー] Constraint-based sequence mining using constraint programming

Benjamin Négrevergne, Tias Guns|arXiv (Cornell University)|Jan 6, 2015
Data Mining Algorithms and Applications参考文献 13被引用数 11
ひとこと要約

本稿では、制約に基づくシーケンスマイニングのための制約プログラミング(CP)フレームワークを提案し、パターンの包含関係を効率的に符号化し、パフォーマンスを向上させるために「exists-embedding」という新しいグローバル制約を導入するとともに、プロジェクトドデータベースをサポートする。このアプローチにより、ユーザー定義の制約下で柔軟かつ拡張可能な頻出シーケンスのマイニングが可能となり、低レベルのデータ構造を変更せずに制約に配慮した探索と伝播を用いることで、柔軟性を維持しつつも競争力のある効率性を実現する。

ABSTRACT

The goal of constraint-based sequence mining is to find sequences of symbols that are included in a large number of input sequences and that satisfy some constraints specified by the user. Many constraints have been proposed in the literature, but a general framework is still missing. We investigate the use of constraint programming as general framework for this task. We first identify four categories of constraints that are applicable to sequence mining. We then propose two constraint programming formulations. The first formulation introduces a new global constraint called exists-embedding. This formulation is the most efficient but does not support one type of constraint. To support such constraints, we develop a second formulation that is more general but incurs more overhead. Both formulations can use the projected database technique used in specialised algorithms. Experiments demonstrate the flexibility towards constraint-based settings and compare the approach to existing methods.

研究の動機と目的

  • 多様なユーザー指定制約をサポートする一般的かつ拡張可能な制約ベースのシーケンスマイニングフレームワークの欠如に対処すること。
  • 既存の最適化および探索技術とシームレスに統合可能な宣言的で制約プログラミングに基づくアプローチを開発すること。
  • 低レベルのデータ構造を変更せずに、複雑な制約下での頻出シーケンスの効率的マイニングを可能にすること。
  • グローバル制約による高速計算と分解による完全な一般性の両立を図り、パフォーマンスと表現力のバランスを取ること。
  • 最先端のシーケンスマイニングアルゴリズムとの実験的比較を通じて、フレームワークの柔軟性とスケーラビリティを示すこと。

提案手法

  • パターンシーケンスがトランザクションシーケンスに埋め込まれているかどうかを効率的に符号化するための新しいグローバル制約「exists-embedding」を導入すること。
  • パターンの記号、埋め込み位置、トランザクションの包含を示す指標をCP変数として定式化し、シーケンスマイニング問題を定式化すること。
  • 「exists-embedding」制約を二項不等式および再構築可能な制約に分解することで、より複雑な制約のサポートを可能にするが、パフォーマンスのオーバーヘッドを伴う。
  • 従来のシーケンスマイニングで用いられるプロジェクトドデータベース技術をCPフレームワークに統合し、共有の補助変数を介して頻度カウントを高速化すること。
  • 各トランザクションごとに有効な埋め込みを独立してチェックするサブサーチブランチャーを実装し、マスタープロブレムに結果を伝播させることで、重複した探索を回避すること。
  • 補助変数と要素制約を用いて頻度制約を再定式化し、トランザクション全体にわたるプロジェクトド出現回数を効率的にカウントすること。

実験結果

リサーチクエスチョン

  • RQ1制約プログラミングは、多様な制約タイプにわたる制約ベースのシーケンスマイニングの一般的かつ拡張可能なフレームワークとして機能できるか?
  • RQ2専用のグローバル制約「exists-embedding」を用いたCP定式化は、分解に基づくアプローチと比較して、効率性およびスケーラビリティの面でどの程度優れているか?
  • RQ3プロジェクトドデータベース技術は、CPベースのシーケンスマイニングパイプラインにどの程度効果的に統合可能か?
  • RQ4提案されたCPフレームワークは、既存の特殊化されたアルゴリズムではネイティブにサポートされない複雑な制約をどのように処理するか?
  • RQ5分解に基づく定式化とグローバル制約に基づく定式化の間で、表現力とパフォーマンスのトレードオフはどの程度か?

主な発見

  • 「exists-embedding」というグローバル制約を用いた定式化は、実行時間および探索作業量において、分解に基づくアプローチを著しく上回る高い効率性を達成した。
  • 分解に基づく定式化は、グローバル制約と互換性のない制約タイプを含め、すべての制約タイプをサポートするが、計算オーバーヘッドが増加する。
  • CPフレームワークへのプロジェクトドデータベースの統合により、効率的な頻度カウントが可能となり、従来のプロジェクトドデータベース手法と同等またはそれ以上のパフォーマンスを達成した。
  • サブサーチブランチャー機構は、各トランザクションごとに埋め込みを独立して隔離・検証でき、探索空間を削減し、スケーラビリティを向上させた。
  • 実験的評価により、CPベースのアプローチは、cSpadeなどの最先端のアルゴリズムと同等またはそれ以上の実行時間およびスケーラビリティを示した。
  • フレームワークは、長さ、ギャップ、識別力に関する制約を含む多様なユーザー制約を、コアデータ構造を変更せずに強力に処理できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。