Skip to main content
QUICK REVIEW

[논문 리뷰] Probabilistic Frequent Pattern Growth for Itemset Mining in Uncertain Databases (Technical Report)

Thomas Bernecker, Hans‐Peter Kriegel|arXiv (Cornell University)|2010. 08. 13.
Data Mining Algorithms and Applications참고 문헌 21인용 수 14
한 줄 요약

이 논문은 후보 생성 없이 불확실한 데이터베이스에서 확률적 빈도 항목집합을 추출하기 위한 첫 번째 FP-Growth 기반 알고리즘인 ProFP-Growth를 제안한다. ProFP-Tree라는 데이터 구조와 생성 함수 기반 방법을 도입하여 선형 시간 내에 지지도 확률 분포를 계산함으로써, ProApriori와 같은 최신 기술 대비 뚜렷한 성능 향상을 달성한다.

ABSTRACT

Frequent itemset mining in uncertain transaction databases semantically and computationally differs from traditional techniques applied on standard (certain) transaction databases. Uncertain transaction databases consist of sets of existentially uncertain items. The uncertainty of items in transactions makes traditional techniques inapplicable. In this paper, we tackle the problem of finding probabilistic frequent itemsets based on possible world semantics. In this context, an itemset X is called frequent if the probability that X occurs in at least minSup transactions is above a given threshold. We make the following contributions: We propose the first probabilistic FP-Growth algorithm (ProFP-Growth) and associated probabilistic FP-Tree (ProFP-Tree), which we use to mine all probabilistic frequent itemsets in uncertain transaction databases without candidate generation. In addition, we propose an efficient technique to compute the support probability distribution of an itemset in linear time using the concept of generating functions. An extensive experimental section evaluates the our proposed techniques and shows that our ProFP-Growth approach is significantly faster than the current state-of-the-art algorithm.

연구 동기 및 목표

  • 항목 존재가 확률적일 때 불확실한 거래 데이터베이스에서 빈도 항목집합을 추출하는 데 도전하는 데 목적을 두며.
  • Apriori 유사 알고리즘의 한계, 즉 높은 메모리 사용량과 다중 데이터베이스 스캔를 해결하는 데 목적을 두며.
  • 후보 생성 없이 효율적인 방법을 개발하여 확률적으로 빈도가 높은 항목집합—즉, 최소 minSup 거래에서 확률이 임계값 τ를 초과하여 등장할 가능성이 있는 항목집합을 식별하는 데 목적을 두며.
  • 압축된 데이터 구조와 수학적 최적화를 활용하여 확장성 있고 정확한 탐색을 가능하게 하는 데 목적을 두며.

제안 방법

  • 불확실한 거래 데이터베이스를 압축하면서도 항목집합 존재 확률을 유지하는 확률적 FP-Tree의 변종인 ProFP-Tree를 제안한다.
  • 항목집합의 지지도 확률 분포를 아이템 수에 비례하는 선형 시간 내에 계산할 수 있는 새로운 생성 함수 기반 기법을 도입한다.
  • 가능 세계 의미론을 활용하여 확률적 빈도 항목집합을 정의한다: 항목집합이 최소 minSup 거래에 등장할 확률이 임계값 τ를 초과하면 빈도가 높다고 간주한다.
  • 조건부 패턴 기반과 트리 탐색을 활용하여 후보 생성 없이 모든 확률적 빈도 항목집합을 추출하는 ProFP-Growth 알고리즘을 설계한다.
  • 트리 구축 및 탐색 과정에서 불확실한 항목과 그 확률을 효율적으로 관리하기 위해 조회 테이블을 사용한다.
  • 모든 가능한 세계를 명시적으로 열거하지 않고도 생성 함수를 통해 포isson 이항 재귀 관계를 암묵적으로 적용한다.

실험 결과

연구 질문

  • RQ1모든 가능한 세계를 열거하지 않고도 불확실한 데이터베이스에서 항목집합의 지지도 확률 분포를 효율적으로 계산할 수 있는가?
  • RQ2FP-Growth 방식의 알고리즘이 후보 생성 없이 불확실한 데이터베이스에서 확률적 빈도 항목집합을 탐색하는 데 적합하게 변형될 수 있는가?
  • RQ3불확실한 데이터베이스를 효과적으로 압축하면서도 빈도 항목집합 탐색에 필요한 확률적 정보를 유지할 수 있는 데이터 구조는 무엇인가?
  • RQ4제안된 ProFP-Growth 알고리즘의 성능은 기존 Apriori 기반 접근법 대비 런타임과 확장성 측면에서 어떻게 비교되는가?
  • RQ5항목 발생에 대한 불확실성과 확실성 수준의 변화가 ProFP-Tree의 크기와 효율성에 어떤 영향을 미치는가?

주요 결과

  • ProFP-Growth는 모든 테스트 설정에서 최신 기술인 ProApriori 대비 런타임에서 뚜렷한 성능 향상을 보이며, 아이템 수와 거래 수가 증가할수록 성능 향상이 커진다.
  • ProFP-Tree의 노드 수는 초기 증가 후 아이템 수에 비례하여 선형적으로 증가함을 보이며, 접두어 공유 덕분에 공간 활용 효율성이 높음을 시사한다.
  • 확실한 항목 수(P1(x))가 증가할수록 ProFP-Tree의 크기가 감소하며, 이는 거래의 접두어 중복 증가 때문이며, 모든 항목이 확률적으로 존재할 경우 선형 리스트로 수렴한다.
  • 불확실한 항목 수가 고정되어 있을 경우, 거래 수가 증가하더라도 불확실한 항목 조회 테이블의 크기는 일정하게 유지된다.
  • 낮은 minSup 임계값에서는 두 알고리즘이 모두 확률적 빈도 항목집합의 수가 많아 런타임이 길어지지만, ProFP-Growth는 여전히 뚜렷한 성능 우위를 유지한다.
  • 거래 수가 증가함에 따라 거래 접두어의 중복 증가로 인해 ProFP-Tree의 크기가 포화 상태에 도달하며, 이는 고용량 데이터에서의 확장성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.