[논문 리뷰] Discovery of Maximal Frequent Item Sets using Subset Creation
이 논문은 최소 빈도 항목집합을 먼저 찾는 전통적인 두 단계 과정을 회피하고, 부분집합 생성을 통해 직접 최대 빈도 항목집합을 발견하는 새로운 알고리즘을 제안한다. 이 방법은 불필요한 계산을 제거함으로써 대규모 거래 데이터베이스에서 최대 빈도 패턴을 더 빠르게 식별함으로써 효율성을 향상시킨다.
Data mining is the practice to search large amount of data to discover data patterns. Data mining uses mathematical algorithms to group the data and evaluate the future events. Association rule is a research area in the field of knowledge discovery. Many data mining researchers had improved upon the quality of association rule for business development by incorporating influential factors like utility, number of items sold and for the mining of association data patterns. In this paper, we propose an efficient algorithm to find maximal frequent itemset first. Most of the association rule algorithms used to find minimal frequent item first, then with the help of minimal frequent itemsets derive the maximal frequent itemsets, these methods consume more time to find maximal frequent itemsets. To overcome this problem, we propose a new approach to find maximal frequent itemset directly using the concepts of subsets. The proposed method is found to be efficient in finding maximal frequent itemsets.
연구 동기 및 목표
- 최소 빈도 항목집합을 먼저 찾은 후 최대 항목집합을 유도하는 기존 연관 규칙 마이닝 알고리즘의 비효율성을 해결하기 위해.
- 중간 단계를 제거함으로써 빈도 항목집합 마이닝의 계산 오버헤드를 줄이기 위해.
- 부분집합 관계를 활용한 직접적인 최대 빈도 항목집합 탐색 방법을 개발하기 위해.
- 대규모 데이터 마이닝에서 중복 처리를 최소화함으로써 성능을 향상시키기 위해.
제안 방법
- 기존 빈도 항목집합에서 부분집합을 생성하여 후보 항목집합을 구성함으로써 최대 항목집합을 직접 식별한다.
- 빈도 항목집합이 최대일 조건은 그의 초집합이 빈도가 없는 경우임을 활용한다.
- 모든 가능한 항목집합을 생성하는 대신, 최대일 수 있는 잠재적 부분집합에만 집중함으로써 불필요한 생성을 방지한다.
- 부분집합 관계를 기반으로 한 가지 전략을 사용하여 비최대 후보를 조기 제거한다.
- 정확성과 완전성을 보장하기 위해 부분집합 생성과 빈도 항목집합 검증을 통합한다.
- 기존 최소 항목집합 생성 없이, 거래 데이터베이스를 한 번만 스캔함으로써 최대 빈도 항목집합을 식별한다.
실험 결과
연구 질문
- RQ1최소 빈도 항목집합을 먼저 찾지 않고도 최대 빈도 항목집합을 직접 발견할 수 있는가?
- RQ2부분집합 기반 생성 방식은 최대 빈도 항목집합 마이닝의 효율성을 어떻게 향상시키는가?
- RQ3중간 단계의 최소 항목집합 계산을 제거함으로써 얻는 성능 향상은 어떠한가?
- RQ4제안된 방법이 대규모 거래 데이터베이스에서 계산 오버헤드를 얼마나 줄이는가?
주요 결과
- 제안된 방법은 최소 빈도 항목집합을 먼저 계산할 필요 없이 최대 빈도 항목집합을 직접 발견하는 데 성공했다.
- 부분집합 생성을 통해 불필요한 계산을 줄이고 처리 속도를 향상시켰다.
- 실행 시간 측면에서 기존의 두 단계 알고리즘에 비해 높은 효율성을 보였다.
- 효과적인 전략을 통해 정확성과 완전성을 유지하면서 최대 빈도 항목집합 식별을 수행했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.