Skip to main content
QUICK REVIEW

[논문 리뷰] On SAT Models Enumeration in Itemset Mining

Saïd Jabbour, Lakhdar Saïs|arXiv (Cornell University)|2015. 06. 08.
Data Mining Algorithms and Applications참고 문헌 21인용 수 3
한 줄 요약

이 논문은 CDCL 기반 SAT 솔버의 적응을 통해 SAT 인코딩된 빈도 높은 항목집합 탐색에서 모델의 효율적 열거를 연구한다. 특히 모델 수가 많은 인스턴스에서, 절차적 브랜칭 히우리스틱을 사용하는 단순한 DPLL 유사 절차가 차단 절호와 함께 학습된 절호를 사용하는 CDCL 솔버보다 성능이 뛰어나며, 이는 절호 학습 및 차단 메커니즘의 오버헤드가 감소하기 때문이다.

ABSTRACT

Frequent itemset mining is an essential part of data analysis and data mining. Recent works propose interesting SAT-based encodings for the problem of discovering frequent itemsets. Our aim in this work is to define strategies for adapting SAT solvers to such encodings in order to improve models enumeration. In this context, we deeply study the effects of restart, branching heuristics and clauses learning. We then conduct an experimental evaluation on SAT-Based itemset mining instances to show how SAT solvers can be adapted to obtain an efficient SAT model enumerator.

연구 동기 및 목표

  • CDCL 솔버 구성 요소를 적응시켜 빈도 높은 항목집합 탐색에서 SAT 기반의 모델 열거 효율성을 향상시키기.
  • 재시작, 브랜칭 히우리스틱, 절호 학습이 모델 열거 성능에 미치는 영향을 조사하기.
  • 차단 절호가 추가된 CDCL 기반 솔버와 DPLL 유사 절차를 비교하여 닫힌 빈도 높은 항목집합을 열거하기.
  • 지수적으로 큰 출력을 가진 데이터 마이닝 문제의 SAT 인코딩에 가장 효과적인 솔버 구성 설정을 특정하기.
  • 지수적으로 많은 모델이 존재하는 상황에서 절호 학습과 차단 절호의 한계에 대한 실증적 증거를 제공하기.

제안 방법

  • 차단 절호 및 학습된 절호 없이 DPLL 유사 모델 열거기(DPLL-Enum)를 구현하여 솔버 구성 요소의 영향을 고립시켰다.
  • MiniSAT 2.2의 CDCL 솔버를 확장하여, 각 모델을 찾을 때마다 불가능한 조합(No-good) 절호를 추가하고 재시작을 트리거하는 모델 열거 절차를 구현한 CDCL-Enum을 개발했다.
  • DPLL-Enum 프레임워크 내에서 세 가지 브랜칭 히우리스틱(VSIDS, Jeroslow-Wang(JW), 무작위 선택)을 평가했다.
  • FIMI 및 CP4IM 레포지터리의 다양한 데이터셋을 대상으로 최소 지원도 기준을 변화시켜 CPU 시간을 비교하기 위해 카투스 플롯을 사용했다.
  • 15분의 CPU 시간 제한을 가진 Intel Xeon 사내 코어 4개 장치에서 실험을 수행했다.
  • 다양한 실세계 데이터셋을 대상으로 닫힌 빈도 높은 항목집합 열거에 중점을 두고 성능을 측정했다.

실험 결과

연구 질문

  • RQ1재시작, 브랜칭 히우리스틱, 절호 학습이 항목집합 탐색의 모델 열거에 대한 SAT 솔버 성능에 어떻게 영향을 미치는가?
  • RQ2차단 절호와 절호 학습을 포함한 CDCL 기반 접근법이, SAT 인코딩된 항목집합 탐색에서 모델을 열거하는 데 있어 순수한 DPLL 유사 절차보다 더 효율적인가?
  • RQ3VSIDS, Jeroslow-Wang, 또는 무작위 선택 중 어떤 브랜칭 히우리스틱이 이 문제에 대해 DPLL 유사 모델 열거에서 가장 뛰어난 성능을 낼 수 있는가?
  • RQ4SAT 인코딩에서 지수적으로 많은 모델이 존재할 경우, 절호 학습과 차단 절호가 오히려 비효율적인가?
  • RQ5경량 DPLL 유사 절차가 높은 모델 수를 가진 모델 열거 작업에서 최신 CDCL 솔버를 능가할 수 있는가?

주요 결과

  • DPLL 유사 절차(DPLL-Enum)는 대부분의 인스턴스에서 CDCL 기반 접근법(CDCL-Enum)을 능가했으며, 특히 모델 수가 많은 경우에 뚜렷한 성능 향상을 보였다.
  • DPLL-Enum+JW(variant, Jeroslow-Wang 히우리스틱)는 다양한 데이터셋에서 DPLL-Enum+VSIDS 및 DPLL-Enum+RAND를 일관되게 앞섰다.
  • 체스, kr-vs-kp, splice-1 등의 데이터셋에서 DPLL-Enum+JW는 다른 히우리스틱과 CDCL 접근법 대비 열거 시간을 크게 단축시켰다.
  • CDCL-Enum 및 DPLL-Enum+RAND는 여러 인스턴스에서 15분 타임아웃 내에 열거를 완료하지 못해 확장성에 문제가 있음을 보여주었다.
  • CDCL-Enum에서 차단 절호와 절호 학습의 사용은 상당한 오버헤드를 유발하여 고모델 수 문제에는 실용적이지 않았다.
  • 결과적으로, 모델 수가 많을 경우 절호 학습과 차단 절호가 모델 열거에 악영향을 미치며, 더 단순한 DPLL 유사 전략이 유리하다는 것이 제안된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.