Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Generation of Best Interval Patterns for Nonmonotonic Constraints

Aleksey Buzmakov, Sergei O. Kuznetsov|arXiv (Cornell University)|2015. 06. 02.
Data Mining Algorithms and Applications참고 문헌 1인용 수 8
한 줄 요약

이 논문은 안정성 및 \Delta-측도와 같은 비단조화 제약 조건 하에서 최고의 간격 튜플 패턴을 효율적으로 추출하기 위해 \texttheta-\textSigma\textomikron\textphi\textiota\textalpha (Sofia) 알고리즘을 제안한다. 프로젝션-반단조화성의 특성을 활용함으로써, 기존의 비용이 많이 드는 후행 필터링을 피하고, 기존 방법들인 MinIntChange에 비해 최대 100배 빠른 성능 향상을 이룩한다. 특히 패턴 다양성이 높은 대규모 데이터셋에서 두드러진 성능 향상을 보였다.

ABSTRACT

In pattern mining, the main challenge is the exponential explosion of the set of patterns. Typically, to solve this problem, a constraint for pattern selection is introduced. One of the first constraints proposed in pattern mining is support (frequency) of a pattern in a dataset. Frequency is an anti-monotonic function, i.e., given an infrequent pattern, all its superpatterns are not frequent. However, many other constraints for pattern selection are not (anti-)monotonic, which makes it difficult to generate patterns satisfying these constraints. In this paper we introduce the notion of projection-antimonotonicity and $θ$-$\Sigmaøϕια$ algorithm that allows efficient generation of the best patterns for some nonmonotonic constraints. In this paper we consider stability and $Δ$-measure, which are nonmonotonic constraints, and apply them to interval tuple datasets. In the experiments, we compute best interval tuple patterns w.r.t. these measures and show the advantage of our approach over postfiltering approaches. KEYWORDS: Pattern mining, nonmonotonic constraints, interval tuple data

연구 동기 및 목표

  • 기존의 반단조화 제거 기법으로 처리하기 어려운 비단조화 제약 조건 하에서 고품질의 간격 튜플 패턴을 효율적으로 추출하는 문제를 해결하기 위해.
  • 후보 패턴의 조합 폭발 문제를 해결하기 위해, 프로젝션-반단조화 측정법이라는 새로운 측정법 클래스를 도입하여 효율적인 탐색을 가능하게 하기 위해.
  • 모든 후보 패턴을 생성하지 않고도 최고의 패턴을 직접 타겟으로 삼는 알고리즘 설계를 통해 후행 필터링에 의존도를 줄이기 위해.
  • MinIntChange와 같은 후행 필터링 기반 방법에 비해 런타임과 확장성 면에서 제안된 방법의 우수성을 실증적으로 검증하기 위해.

제안 방법

  • 프로젝션 체인에 대해 반단조화성을 가지는 측정법이라는 개념을 제안함으로써, 패턴 생성 과정에서의 제거를 가능하게 한다.
  • 이 성질을 활용해 패턴 공간을 탐색하는 \texttheta-\textSigma\textomikron\textphi\textiota\textalpha (Sofia) 알고리즘을 설계함으로써, 유망한 후보 패턴들만 탐색하도록 보장한다.
  • 수치적 속성을 임계값 \gamma를 사용해 간격으로 이산화함으로써 간격 트리플 데이터에 알고리즘을 적용하고, 포함관계 기반의 패턴 구조를 형성한다.
  • 최고의 패턴을 찾는 데 지도를 내기 위해 지지도수 \theta를 사용하며, \Delta-측도 또는 안정성의 수치가 높은 패턴에 집중한다.
  • 깊이 우선 탐색 전략과 함께 제거 기법을 적용함: 패턴의 측정값이 부모 패턴보다 열 劣하지 않은 경우에만 확장한다. 이는 프로젝션-반단조화 성질에 기반한다.
  • 동적 임계값 \theta 조정을 통한 상위-K 스타일 탐색을 구현함으로써, 모든 최고의 패턴을 완전히 찾되, 전체 후보를 탐색하지는 않도록 한다.

실험 결과

연구 질문

  • RQ1후행 필터링에 의존하지 않고도 안정성 및 \Delta-측도와 같은 비단조화 제약 조건 하에서 최고의 간격 튜플 패턴을 효율적으로 추출할 수 있는가?
  • RQ2프로젝션-반단조화성의 개념이 비단조화 측정법에 대해 탐색 공간에서 효과적인 제거를 가능하게 하는가?
  • RQ3제안된 Sofia 알고리즘의 성능은 MinIntChange와 같은 후행 필터링 기반 접근법에 비해 런타임과 확장성 면에서 어떻게 비교되는가?
  • RQ4다양한 프로젝션 체인과 파rameter 설정(예: \gamma)이 패턴 탐색의 효율성과 완전성에 어떤 영향을 미치는가?

주요 결과

  • 105개의 객체를 가진 데이터셋에 대해 Sofia 알고리즘은 최고의 \Delta-안정 패턴을 모두 계산하는 데 3초 미만이 소요되었으며, MinIntChange는 28초 이상 소요되었고 메모리 오버플로우로 인해 중단되었다.
  • 가장 큰 데이터셋(AB, 4177개의 객체)에서 Sofia는 11초 내로 완료되었고, MinIntChange는 86초가 걸렸으며, 작업의 10%만 완료된 상태에서 중단되었다.
  • CA 데이터셋(8192개의 객체)에서 Sofia는 6개의 최고 패턴을 찾는 데 112초가 소요되었고, MinIntChange는 24초 후에 10% 작업만 완료된 채 중단되었다.
  • 모든 테스트된 데이터셋에서 Sofia는 MinIntChange를 모두 압도했으며, 런타임 면에서 2배에서 100배 이상의 성능 향상을 기록했다. 이는 확장성과 효율성의 우수성을 입증한다.
  • CN 데이터셋(105개의 객체)에 대해 Sofia는 단 2.4초 만에 최고의 \Delta-안정 패턴 5362개를 성공적으로 추출했으며, 동일한 결과를 얻기 위해 후행 필터링을 위해 지지도수 30이 필요했다.
  • 결과는 프로젝션-반단조화성이 효과적인 제거를 가능하게 하여, 최고의 패턴을 직접 탐색하는 것이 후행 필터링에 비해 훨씬 빠르고 실현 가능하다는 것을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.