Skip to main content
QUICK REVIEW

[論文レビュー] On SAT Models Enumeration in Itemset Mining

Saïd Jabbour, Lakhdar Saïs|arXiv (Cornell University)|Jun 8, 2015
Data Mining Algorithms and Applications参考文献 21被引用数 3
ひとこと要約

この論文は、頻度付きアイテムセットマイニングに符号化されたSATにおけるモデルの列挙のための、CDCLベースのSATソルバーの適応について調査している。特に、多くのモデルを含むインスタンスでは、学習された節やブロッキング節のオーバーヘッドが低減されるため、Jeroslow-Wang分岐ヒューリスティクスを用いた単純なDPLLに類似した手続きが、CDCLソルバーに比べて優れていることが判明した。

ABSTRACT

Frequent itemset mining is an essential part of data analysis and data mining. Recent works propose interesting SAT-based encodings for the problem of discovering frequent itemsets. Our aim in this work is to define strategies for adapting SAT solvers to such encodings in order to improve models enumeration. In this context, we deeply study the effects of restart, branching heuristics and clauses learning. We then conduct an experimental evaluation on SAT-Based itemset mining instances to show how SAT solvers can be adapted to obtain an efficient SAT model enumerator.

研究の動機と目的

  • CDCLソルバーの部品を適応させることで、頻度付きアイテムセットマイニングにおけるSATベースのモデル列挙の効率を向上させること。
  • 再起動、分岐ヒューリスティクス、節の学習がモデル列挙性能に与える影響を調査すること。
  • 閉じた頻度付きアイテムセットを列挙するための、DPLLに類似した手続きとブロッキング節を追加したCDCLベースのソルバーを比較すること。
  • 指数的に出力が大きいデータマイニング問題のSAT符号化において、最も効果的なソルバー設定を特定すること。
  • 節の学習とブロッキング節の限界を、高頻度モデル数の状況において実証的に示すこと。

提案手法

  • ブロッキング節や学習された節を一切使用しないDPLLに類似したモデル列挙器(DPLL-Enum)を実装し、ソルバー部品の影響を隔離した。
  • MiniSAT 2.2のCDCLソルバーにモデル列挙手順を拡張(CDCL-Enum)し、各モデルを発見した後にノーガッド節を追加し、再起動をトリガーした。
  • DPLL-Enumフレームワーク内で、3つの分岐ヒューリスティクス(VSIDS、Jeroslow-Wang(JW)、ランダム選択)を評価した。
  • FIMIおよびCP4IMリポジトリの複数のデータセットを用い、最小サポート閾値を変化させた上で、カクタスプロットを用いてCPU時間を比較した。
  • 15分間のCPU時間制限を各インスタンスに設定し、Intel Xeon 4コアマシン上で実験を実施した。
  • 閉じた頻度付きアイテムセット列挙に注目し、多様な実世界のデータセットを用いて性能を測定した。

実験結果

リサーチクエスチョン

  • RQ1再起動、分岐ヒューリスティクス、節の学習は、アイテムセットマイニングのモデル列挙におけるSATソルバーの性能にどのように影響するか?
  • RQ2ブロッキング節と節の学習を備えたCDCLベースのアプローチは、SAT符号化されたアイテムセットマイニングにおけるモデル列挙において、純粋なDPLLに類似した手続きよりも効率的か?
  • RQ3VSIDS、Jeroslow-Wang、ランダムのうち、どの分岐ヒューリスティクスが、この問題におけるDPLLに類似したモデル列挙で最高のパフォーマンスを発揮するか?
  • RQ4SAT符号化において指数的多くのモデルが存在する場合、節の学習とブロッキング節は逆効果をもたらすか?
  • RQ5高頻度モデル数のモデル列挙タスクにおいて、軽量なDPLLに類似した手続きが、最先端のCDCLソルバーを上回ることができるか?

主な発見

  • DPLLに類似した手続き(DPLL-Enum)は、特にモデル数が多いインスタンスにおいて、CDCLベースのアプローチ(CDCL-Enum)を上回った。
  • DPLL-Enum+JW(Jeroslow-Wangヒューリスティクス)は、複数のデータセットにおいて、DPLL-Enum+VSIDSおよびDPLL-Enum+RANDを一貫して上回った。
  • チェス、kr-vs-kp、splice-1などのデータセットでは、DPLL-Enum+JWが他のヒューリスティクスおよびCDCLアプローチと比較して、列挙時間を顕著に短縮した。
  • CDCL-EnumおよびDPLL-Enum+RANDは、複数のインスタンスで15分のタイムアウト内に列挙を完了できず、スケーラビリティに欠けることが判明した。
  • CDCL-Enumにおけるブロッキング節と節の学習の使用は、顕著なオーバーヘッドをもたらし、高頻度モデル数の問題には実用的でないことがわかった。
  • 結果から、モデル数が多い状況では節の学習とブロッキング節がモデル列挙に悪影響を及ぼすことが示され、単純なDPLLに類似した戦略が好ましいことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。