Skip to main content
QUICK REVIEW

[논문 리뷰] Fast Utility Mining on Complex Sequences

Wensheng Gan, Jerry Chun‐Wei Lin|arXiv (Cornell University)|2019. 04. 28.
Data Mining Algorithms and Applications참고 문헌 47인용 수 9
한 줄 요약

이 논문은 고유용량 순차 패턴 마이닝(HUSPM)을 빠르게 수행하기 위한 새로운 알고리즘인 HUSP-ULL을 제안한다. 이 알고리즘은 순서 기반 시퀀스(정렬 순서 기반) 트리(LS-tree)와 유용성 연결 리스트(UL-list)를 사용하여 유용성과 상한값을 효율적으로 계산한다. 또한 탐색 공간을 줄이기 위해 두 가지 가지치기 전략을 도입하여, 실제 및 합성 데이터셋에서 최신 기술 대비 런타임과 메모리 효율성이 크게 향상된다.

ABSTRACT

High-utility sequential pattern mining is an emerging topic in the field of Knowledge Discovery in Databases. It consists of discovering subsequences having a high utility (importance) in sequences, referred to as high-utility sequential patterns (HUSPs). HUSPs can be applied to many real-life applications, such as market basket analysis, E-commerce recommendation, click-stream analysis and scenic route planning. For example, in economics and targeted marketing, understanding economic behavior of consumers is quite challenging, such as finding credible and reliable information on product profitability. Several algorithms have been proposed to address this problem by efficiently mining utility-based useful sequential patterns. Nevertheless, the performance of these algorithms can be unsatisfying in terms of runtime and memory usage due to the combinatorial explosion of the search space for low utility threshold and large databases. Hence, this paper proposes a more efficient algorithm for the task of high-utility sequential pattern mining, called HUSP-ULL. It utilizes a lexicographic sequence (LS)-tree and a utility-linked (UL)-list structure to fast discover HUSPs. Furthermore, two pruning strategies are introduced in HUSP-ULL to obtain tight upper-bounds on the utility of candidate sequences, and reduce the search space by pruning unpromising candidates early. Substantial experiments both on real-life and synthetic datasets show that the proposed algorithm can effectively and efficiently discover the complete set of HUSPs and outperforms the state-of-the-art algorithms.

연구 동기 및 목표

  • 대규모 데이터베이스와 낮은 유용성 임계값에서 발생하는 기존 고유용량 순차 패턴 마이닝(HUSPM) 알고리즘의 비효율성, 즉 조합 폭발 문제를 해결하기 위해.
  • 모든 고유용량 순차 패턴(HUSPs)을 마이닝하는 동안 런타임과 메모리 소비를 줄이는 더 효율적인 알고리즘을 개발하기 위해.
  • 유용성 빠른 계산과 날카운 상한 추정을 가능하게 하는 새로운 데이터 구조인 LS-트리와 UL-리스트를 제안하기 위해.
  • 유망하지 않은 후보를 조기에 제거함으로써 탐색 공간을 줄이는 두 가지 가지치기 전략을 설계하기 위해.
  • 실생활 및 합성 데이터셋에서 제안된 알고리즘의 성능을 평가하여, 우수한 확장성과 효율성을 입증하기 위해.

제안 방법

  • HUSP-ULL 알고리즘은 후보 시퀀스를 계층적이고 순서 있는 구조로 조직하기 위해 정렬 순서 기반 시퀀스(LS)-트리를 사용하여 효율적인 탐색과 가지치기를 가능하게 한다.
  • 후보 시퀀스의 유용성과 상한값을 압축적이고 점진적인 방식으로 저장하고 계산하기 위해 유용성 연결(UL)-리스트를 활용한다.
  • 두 가지 가지치기 전략을 적용한다: (1) 상한 추정을 통한 유용성 기반 가지치기로 유망하지 않은 후보를 조기에 제거하고, (2) 정렬 순서 기반 가지치기를 통해 중복 탐색을 줄인다.
  • LS-트리는 정렬 순서와 접두사 기반 확장을 활용하여 효율적인 후보 생성과 유용성 계산을 가능하게 한다.
  • UL-리스트를 통해 마이닝 과정 중에 빠른 유용성 재계산과 상한값 전파가 가능하여 중복 계산을 줄인다.
  • 이러한 구성 요소들을 통합하여 메모리 사용량과 런타임을 최소화하면서도 체계적인 탐색 공간 탐색을 수행한다.

실험 결과

연구 질문

  • RQ1압축된 데이터 구조와 효과적인 가지치기를 통해 고유용량 순차 패턴 마이닝을 어떻게 가속화할 수 있는가?
  • RQ2LS-트리와 UL-리스트 구조가 HUSPM에서 메모리 소비와 런타임을 크게 줄일 수 있는가?
  • RQ3제안된 두 가지 가지치기 전략은 기존 방법 대비 HUSP 탐지의 효율성을 어떻게 향상시키는가?
  • RQ4다양한 크기와 유용성 임계값을 가진 대규모 합성 데이터셋에서 HUSP-ULL의 확장성은 어떠한가?
  • RQ5런타임과 메모리 효율성 측면에서 HUSP-ULL은 최신 기술 HUSPM 알고리즘을 초월하는가?

주요 결과

  • HUSP-ULL은 모든 테스트 데이터셋에서 가장 낮은 런타임을 기록하여 HUS-Span, USpan, ProUM 및 기타 최신 기술 알고리즘을 크게 앞섰다.
  • Leviathan 데이터셋에서 HUSP-ULL은 모든 δ 값에서 마이닝을 완료했으며, δ가 1.20% 이하일 경우 USpan은 메모리가 부족해 실패했다.
  • 모든 알고리즘 중에서 HUSP-ULL이 가장 낮은 메모리 소비를 보였으며, Kosarak10k에서는 약 200MB로 안정적인 사용을 유지했고, yoochoose-buys에서는 δ 값이 변하더라도 500–600MB 수준에서 일정했다.
  • 합성 데이터셋에서 최대 400K개의 시퀀스까지 우수한 확장성을 보였으며, 런타임은 점진적으로 증가했고 장애 없이 작동했다. 반면 HUS-Span은 낮은 임계값에서 메모리 오버플로우로 인해 실패했다.
  • 데이터셋 크기가 증가함에 따라 후보 수는 낮고 안정적인 수준을 유지했으며, 이는 높은 최소 유용성 임계값 덕분이지만, HUSP-ULL은 여전히 높은 효율성으로 후보를 평가했다.
  • 두 가지 가지치기 전략이 상한 추정치를 강화함으로써 탐색 공간을 효과적으로 줄였고, 이는 더 빠른 수렴과 낮은 자원 소비로 이어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.