Skip to main content
QUICK REVIEW

[논문 리뷰] An Enhanced Apriori Algorithm for Discovering Frequent Patterns with Optimal Number of Scans

Sudhir Tirumalasetty, Aruna Jadda|arXiv (Cornell University)|2015. 06. 23.
Data Mining Algorithms and Applications인용 수 5
한 줄 요약

이 논문은 후보 생성 단계에서 관련성이 있는 트랜잭션만 선택적으로 스캔함으로써 빈번한 패턴을 발견하는 데 필요한 데이터베이스 스캔 수를 줄이는 개선된 Apriori 알고리즘을 제안한다. 스캔 빈도를 최적화함으로써 정확도를 훼손하지 않은 채 효율성을 크게 향상시키며, 트랜잭션 처리 시간에서 최적의 성능을 달성한다.

ABSTRACT

Data mining is wide spreading its applications in several areas. There are different tasks in mining which provides solutions for wide variety of problems in order to discover knowledge. Among those tasks association mining plays a pivotal role for identifying frequent patterns. Among the available association mining algorithms Apriori algorithm is one of the most prevalent and dominant algorithm which is used to discover frequent patterns. This algorithm is used to discover frequent patterns from small to large databases. This paper points toward the inadequacy of the tangible Apriori algorithm of wasting time for scanning the whole transactional database for discovering association rules and proposes an enhancement on Apriori algorithm to overcome this problem. This enhancement is obtained by dropping the amount of time used in scanning the transactional database by just limiting the number of transactions while calculating the frequency of an item or item-pairs. This improved version of Apriori algorithm optimizes the time used for scanning the whole transactional database.

연구 동기 및 목표

  • 빈번한 패턴 탐색 과정에서 반복적인 전체 데이터베이스 스캔으로 인해 발생하는 기존 Apriori 알고리즘의 비효율성을 해결하기 위해.
  • 대규모 트랜잭셔널 데이터베이스에서 반복적인 스캔 작업을 최소화함으로써 계산 오버헤드를 줄이기 위해.
  • 후보 아이템세트 생성을 위한 데이터베이스 스캔 수를 최적화하면서도 정확도를 유지하는 방법을 개발하기 위해.
  • 트랜잭셔널 데이터베이스에서 빈번한 패턴 마이닝을 위한 최적의 스캔 횟수를 확보하여 확장성과 성능을 향상시키기 위해.

제안 방법

  • 알고리즘이 후보 아이템을 포함하는 트랜잭션들만 스캔하여 각 반복 단계에서 전체 스캔를 피함으로써 데이터베이스 스캔 범위를 제한한다.
  • 후보 아이템세트의 지원도를 세는 동안 관련성이 있는 트랜잭션들만 접근하는 선택적 스캔 전략을 적용한다.
  • 비약물적인 아이템세트를 조기에 걸러내는 후보 생성 메커니즘을 사용함으로써 반복적인 전체 스캔의 필요성을 줄인다.
  • 이전에 트랜잭션 내 존재 여부를 알고 있는 정보를 바탕으로 데이터베이스의 관련 부분 집합에서만 지원도를 계산한다.
  • 아이템세트 크기와 빈도에 따라 스캔 범위를 동적으로 조정함으로써 I/O 오버헤드를 최소화한다.
  • 핵심 Apriori 프레임워크를 유지하면서도 반복 단계에서 불필요한 액세스를 줄이기 위해 지능적인 트랜잭션 필터링 메커니즘을 도입한다.

실험 결과

연구 질문

  • RQ1빈번한 패턴 탐지 과정에서 전체 데이터베이스 스캔 수를 정확도를 잃지 않고 최소화할 수 있는 방법은 무엇인가요?
  • RQ2후보 아이템세트의 지원도 계산 시, 관련이 없는 트랜잭션을 식별하고 제외하기 위한 기준은 무엇인가요?
  • RQ3선택적 스캔 전략은 대규모 데이터베이스에서 연관 규칙 마이닝의 시간 효율성을 향상시킬 수 있는가요?
  • RQ4스캔 빈도를 줄임으로써 Apriori 알고리즘의 전체 성능과 확장성에 미치는 영향은 어느 정도인가요?
  • RQ5트랜잭셔널 데이터베이스에서 효과적인 빈번한 패턴 마이닝을 위해 필요한 최적의 스캔 횟수는 얼마인가요?

주요 결과

  • 제안된 알고리즘은 데이터베이스 스캔 수를 최적 수준으로 줄여 처리 시간을 크게 단축시켰다.
  • 아이템 존재 여부를 기반으로 한 선택적 스캔는 전체 데이터베이스 스캔보다 후보 지원도 계산 속도가 빠르다.
  • 기존 Apriori 알고리즘과 동일한 정확도를 유지하면서도 효율성을 향상시켰다.
  • 관련성이 있는 트랜잭션에만 집중함으로써 I/O 오버헤드를 줄이고 대규모 데이터베이스에 대한 확장성을 향상시켰다.
  • 특히 대규모 트랜잭셔널 데이터셋에서 실행 시간에 눈에 띄는 성능 향상이 나타났다.
  • 각 반복 단계에서 관련 없는 트랜잭션을 지능적으로 걸러내는 방식으로 최적의 스캔 횟수를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.