Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Algorithms for Mining Interesting Frequent Itemsets without Minimum Support

Shariq Bashir, Zahoor Jan|ArXiv.org|2009. 04. 21.
Data Mining Algorithms and Applications참고 문헌 16인용 수 4
한 줄 요약

이 논문은 사용자 정의 최소 지원도가 필요하지 않은 상위-K개의 가장 흥미로운 빈도 있는 항목집합을 추출하기 위한 두 가지 효율적인 알고리즘, N-MostMiner와 Top-K-Miner를 제안한다. 빈도 수세기의 빠른 처리를 위해 비트 벡터 표현을 활용하고, 최적화된 거래 투영 기법을 적용함으로써 검색 공간과 처리 오버헤드를 크게 줄였으며, 벤치마크 데이터셋에서 BOMO와 TFP와 같은 기존 방법들보다 런타임 성능에서 뛰어나다.

ABSTRACT

Real world datasets are sparse, dirty and contain hundreds of items. In such situations, discovering interesting rules (results) using traditional frequent itemset mining approach by specifying a user defined input support threshold is not appropriate. Since without any domain knowledge, setting support threshold small or large can output nothing or a large number of redundant uninteresting results. Recently a novel approach of mining only N-most/Top-K interesting frequent itemsets has been proposed, which discovers the top N interesting results without specifying any user defined support threshold. However, mining interesting frequent itemsets without minimum support threshold are more costly in terms of itemset search space exploration and processing cost. Thereby, the efficiency of their mining highly depends upon three main factors (1) Database representation approach used for itemset frequency counting, (2) Projection of relevant transactions to lower level nodes of search space and (3) Algorithm implementation technique. Therefore, to improve the efficiency of mining process, in this paper we present two novel algorithms called (N-MostMiner and Top-K-Miner) using the bit-vector representation approach which is very efficient in terms of itemset frequency counting and transactions projection. In addition to this, several efficient implementation techniques of N-MostMiner and Top-K-Miner are also present which we experienced in our implementation. Our experimental results on benchmark datasets suggest that the NMostMiner and Top-K-Miner are very efficient in terms of processing time as compared to current best algorithms BOMO and TFP.

연구 동기 및 목표

  • 희귀한 실세계 데이터셋에서 사용자 정의 최소 지원도 기반의 기존 빈도 있는 항목집합 탐색 기법의 한계를 해결하기 위해, 이는 종종 결과 없음 또는 과도한 중복 출력을 초래한다.
  • 모든 지원도 기준 입력 없이도 가장 흥미로운 빈도 있는 항목집합만을 추출하는 효율적인 알고리즘 개발
  • 데이터베이스 표현, 거래 투영, 알고리즘 구현의 세 가지 핵심 요소를 최적화하여 성능 향상
  • 대규모 희박한 데이터셋에서 흥미로운 항목집합을 탐색할 때 계산 비용과 검색 공간 탐색을 줄이기

제안 방법

  • 항목집합 빈도 수세기를 가속화하기 위해 비트 벡터 표현을 사용하여 더 빠르고 메모리 효율적인 계산을 가능하게 한다.
  • 검색 공간의 하위 수준 노드로 전달되는 거래를 관련 있는 것들로만 제한함으로써 최적화된 거래 투영 기법을 적용해 불필요한 계산을 최소화한다.
  • N-MostMiner와 Top-K-Miner에서 고도화된 알고리즘 기법을 구현하여 성능을 향상시키며, 효율적인 데이터 구조 처리 및 가지치기 전략을 포함한다.
  • 최소 지원도 기준이 필요 없이 가장 흥미로운 항목집합을 식별하는 상위-K 선택 메커니즘을 적용한다.
  • 흥미로움 정도에 기반해 항목집합을 동적으로 순위 매기며, 유의미한 결과에만 집중하도록 알고리즘 설계한다.
  • 이중 단계 접근 방식을 사용한다: 첫 번째 단계는 비트 벡터를 사용해 후보 항목집합을 식별하고, 두 번째 단계는 흥미로움 점수에 따라 상위-K개를 순위 매기고 선택한다.

실험 결과

연구 질문

  • RQ1사용자 정의 최소 지원도 기반의 의존 없이 빈도 있는 항목집합 탐색을 어떻게 효율적으로 수행할 수 있는가?
  • RQ2상위-K 흥미로운 항목집합 탐색에서 처리 오버헤드를 최소화하는 데 가장 효과적인 데이터 표현 기법은 무엇인가?
  • RQ3항목집합 탐색에서 검색 공간 탐색을 줄이기 위해 거래 투영을 어떻게 최적화할 수 있는가?
  • RQ4흥미로운 항목집합 탐색에서 성능을 크게 향상시키는 알고리즘 기법은 무엇인가?
  • RQ5비트 벡터 기반 접근 방식은 기존 방법 대비 런타임과 확장성 측면에서 어떻게 비교되는가?

주요 결과

  • N-MostMiner와 Top-K-Miner는 벤치마크 데이터셋에서 최신 기술인 BOMO와 TFP보다 상당히 빠른 처리 시간을 달성한다.
  • 비트 벡터 표현은 대규모 데이터셋에서 높은 효율성으로 항목집합의 빈도 수세기를 가능하게 하여 계산 오버헤드를 감소시킨다.
  • 최적화된 거래 투영은 관련 없는 계산의 수를 줄여 전체 알고리즘의 효율성을 향상시킨다.
  • 제안된 알고리즘은 최소 지원도 기준 입력 없이도 상위-K개의 가장 흥미로운 항목집합만을 성공적으로 추출한다.
  • 메모리 효율적인 데이터 처리 및 순위 매기기 최적화를 포함한 구현 기법들이 알고리즘의 뛰어난 성능에 기여한다.
  • 실험 결과는 제안된 방법이 잘 스케일업되며, 특히 희박하고 고차원적인 실세계 데이터셋에 매우 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.