Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Candidacy Reduction For Frequent Pattern Mining

Mohammad H. Nadimi-Shahraki, Norwati Mustapha|arXiv (Cornell University)|2010. 01. 13.
Data Mining Algorithms and Applications참고 문헌 17인용 수 5
한 줄 요약

이 논문은 빈번한 패턴 마이닝에서 후보 패턴 수를 극적으로 줄이기 위한 새로운 후보 헤드 세트(H) 방법을 제안한다. 이는 지지도수 비교 횟수를 크게 줄이며, 모든 빈번한 패턴을 유도할 수 있는 최소이면서 완전한 후보 세트를 생성함으로써 정확도를 훼손하지 않고도 효율성을 향상시킨다. 실험 결과를 통해 후보 생성과 계산 오버헤드가 상당히 감소함을 입증하였다.

ABSTRACT

Certainly, nowadays knowledge discovery or extracting knowledge from large amount of data is a desirable task in competitive businesses. Data mining is a main step in knowledge discovery process. Meanwhile frequent patterns play central role in data mining tasks such as clustering, classification, and association analysis. Identifying all frequent patterns is the most time consuming process due to a massive number of candidate patterns. For the past decade there have been an increasing number of efficient algorithms to mine the frequent patterns. However reducing the number of candidate patterns and comparisons for support counting are still two problems in this field which have made the frequent pattern mining one of the active research themes in data mining. A reasonable solution is identifying a small candidate pattern set from which can generate all frequent patterns. In this paper, a method is proposed based on a new candidate set called candidate head set or H which forms a small set of candidate patterns. The experimental results verify the accuracy of the proposed method and reduction of the number of candidate patterns and comparisons.

연구 동기 및 목표

  • 빈번한 패턴 마이닝에서 막대한 후보 패턴 세트를 생성하고 평가하는 데 드는 높은 계산 비용을 해결하기 위해.
  • 후보 패턴 수와 지지도수 비교 횟수를 줄여, 빈번한 패턴 마이닝의 주요 병목 현상인 이들을 개선하기 위해.
  • 후보 세트 크기를 최소화하면서도 완전성과 정확성을 유지하는 방법을 개발하기 위해.
  • 모든 빈번한 패턴을 효율적으로 생성할 수 있는 새로운 후보 세트인 후보 헤드 세트(H)를 제안하기 위해.

제안 방법

  • 모든 빈번한 패턴을 유도할 수 있는 최소의 패턴 세트인 후보 헤드 세트(H)를 도입한다.
  • 패턴 확장 및 닫힘 성질에 기반한 정렬 전략을 사용하여 후보 생성 범위를 제한한다.
  • H에서 시작하여 계층적인 패턴 생성 메커니즘을 적용해 모든 가능한 빈번한 패턴을 탐색한다.
  • H 세트와 그 확장에만 지지도수 계산 메커니즘을 적용하여 중복 계산을 줄인다.
  • 빈번한 패턴의 구조적 성질을 활용해 비 promising한 후보를 조기에 제거하는 필터링 프로세스를 구현한다.
  • 실제 데이터 세트를 사용하여 방법을 검증하고, 기준 알고리즘과 비교해 후보 세트 크기와 처리 시간을 분석한다.

실험 결과

연구 질문

  • RQ1모든 빈번한 패턴을 생성할 수 있는 최소 후보 세트를 구성할 수 있는가? 이는 검색 공간을 줄이는 데 기여할 수 있는가?
  • RQ2伝통적 방법에 비해 후보 헤드 세트(H)가 후보 패턴 수를 얼마나 효과적으로 줄이는가?
  • RQ3제안된 방법이 빈번한 패턴 마이닝에서 지지도수 비교 횟수를 어느 정도 줄이는가?
  • RQ4후보 패턴 수의 감소가 빈번한 패턴 마이닝의 완전성 또는 정확성에 영향을 미치는가?

주요 결과

  • 제안된 후보 헤드 세트(H) 방법은 전통적 방법에 비해 후보 패턴 수를 상당히 줄였다.
  • 모든 빈번한 패턴을 식별하는 데 100%의 정확도를 유지하여 완전성을 보장한다.
  • 실험 결과, 지지도수 비교 횟수에 측정 가능한 감소가 있었으며, 전체 마이닝 효율성이 향상됨을 보여주었다.
  • 후보 세트 크기의 감소로 인해 대규모 트랜잭션 데이터베이스에서 특히 빠른 실행 시간을 기록하였다.
  • 확장성과 계산 오버헤드 측면에서 기준 알고리즘보다 뛰어난 성능을 보였다.
  • 다양한 데이터 세트에서 뚜렷한 성능 향상이 일관되게 나타나, 이 방법이 강건함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.