Skip to main content
QUICK REVIEW

[논문 리뷰] TKUS: Mining Top-K High-Utility Sequential Patterns

Chunkai Zhang, Zilin Du|arXiv (Cornell University)|2020. 11. 26.
Data Mining Algorithms and Applications참고 문헌 45인용 수 6
한 줄 요약

이 논문은 정량적 순차 데이터베이스에서 상위-k 고유용성 순차 패턴(HUSPs)을 추출하기 위한 새로운 알고리즘인 TKUS를 제안한다. Sequence Utility Raising, Terminate Descendants Early, Eliminate Unpromising Items 등의 전략을 활용한 프로젝션 및 국소 탐색 기반 메커니즘을 통해, 탐색 공간을 효율적으로 단순화하고, 다양한 데이터셋에서 런타임, 메모리 사용량, 확장성 측면에서 최신 기술보다 뛰어난 성능을 발휘한다.

ABSTRACT

High-utility sequential pattern mining (HUSPM) has recently emerged as a focus of intense research interest. The main task of HUSPM is to find all subsequences, within a quantitative sequential database, that have high utility with respect to a user-defined minimum utility threshold. However, it is difficult to specify the minimum utility threshold, especially when database features, which are invisible in most cases, are not understood. To handle this problem, top-k HUSPM was proposed. Up to now, only very preliminary work has been conducted to capture top-k HUSPs, and existing strategies require improvement in terms of running time, memory consumption, unpromising candidate filtering, and scalability. Moreover, no systematic problem statement has been defined. In this paper, we formulate the problem of top-k HUSPM and propose a novel algorithm called TKUS. To improve efficiency, TKUS adopts a projection and local search mechanism and employs several schemes, including the Sequence Utility Raising, Terminate Descendants Early, and Eliminate Unpromising Items strategies, which allow it to greatly reduce the search space. Finally, experimental results demonstrate that TKUS can achieve sufficiently good top-k HUSPM performance compared to state-of-the-art algorithm TKHUS-Span.

연구 동기 및 목표

  • 고유용성 순차 패턴 마이닝(HUSPM)에서 적절한 최소 유용성 임계값을 설정하는 데 어려움이 존재하는 문제를 해결하기 위해, 도메인 지식 부족으로 인한 곤란함을 해결한다.
  • 상위-k HUSPM 문제를 처음으로 체계적으로 정의하고, 명확한 문제 기술을 제공한다.
  • 탐색 공간을 줄이고 런타임, 메모리 소비, 확장성 측면에서 성능을 향상시키는 효율적인 알고리즘을 설계한다.
  • 실제 세계 및 합성 데이터셋에서 다양한 상황에서 기존 최신 기술인 TKHUS-Span보다 뛰어난 성능을 보이는 상위-k HUSPs 마이닝을 달성한다.

제안 방법

  • TKUS는 유망한 부분수열 분지에 집중하기 위해 프로젝션 및 국소 탐색 기반 메커니즘을 활용하여 전역 탐색 공간을 줄인다.
  • 탐색 과정 초반에 높은 유용성 후보를 추정하고 우선순위를 정하기 위해 Sequence Utility Raising(SUR) 전략을 통합한다.
  • 현재 k번째로 높은 유용성보다 하위 트리의 유용성이 도달할 수 없는 경우 탐색을 조기에 종료하기 위해 Terminate Descendants Early(TDE) 전략을 적용한다.
  • 유용성 한계와 순서 구조를 기반으로 하위-k HUSPs에 기여할 수 없는 아이템을 제거하기 위해 Eliminate Unpromising Items(EUI) 전략을 활용한다.
  • 1-시퀀스 및 2-시퀀스의 유용성과 PEU(Projected Estimated Utility) 값을 유지하여 효율적인 단순화와 후보 생성을 유도한다.
  • SUR 전략을 활용해 최소 유용성 임계값을 동적으로 조정함으로써 수렴 속도를 향상시키고 후보 생성을 줄인다.

실험 결과

연구 질문

  • RQ1상위-k 고유용성 순차 패턴 마이닝 문제는 어떻게 체계적으로 공식화하고 정의할 수 있는가?
  • RQ2완전성을 훼손하지 않으면서 상위-k HUSPM에서 탐색 공간을 효과적으로 줄일 수 있는 알고리즘 전략은 무엇인가?
  • RQ3TKUS는 기존 최신 기술인 TKHUS-Span과 비교해 런타임, 메모리 사용량, 확장성 측면에서 어떻게 성능을 냈는가?
  • RQ4SUR, TDE, EUI와 같은 다양한 단순화 전략이 상위-k HUSPM의 효율성과 성능에 미치는 영향은 무엇인가?
  • RQ5데이터셋 크기 증가와 k 값의 변화에 따라 TKUS의 성능은 어떻게 변화하는가?

주요 결과

  • 모든 데이터셋에서 TKHUS-Span보다 뚜렷한 런타임 단축 효과를 보이며, k 값이 증가함에 따라 성능 격차가 커지며 특히 대규모 데이터셋에서 두드러진다.
  • 테스트한 다섯 데이터셋 중 네 개에서 TKUS는 TKHUS-Span보다 메모리 사용량을 줄였다. 이는 효과적인 단순화 전략에 기인한 후보 처리 감소 때문이었다.
  • TKUS의 메모리 사용량은 k 값 증가에 따라 증가하지만, 일부 데이터셋(예: Sign 데이터셋)에서는 k=1000에서 급격한 감소를 보이며 비단조화적인 행동을 보였다.
  • 합성 데이터베이스에서 10K에서 120K 시퀀스까지의 데이터 크기 변화에 따라 런타임과 메모리 사용량이 선형적으로 확장됨을 보여, 선형 확장성(스케일러빌리티)을 입증했다.
  • 실제 세계 데이터(Yoochoose, Sign, Kosarak, Syn80k)와 합성 데이터를 포함한 다양한 데이터셋에서 안정적인 성능을 보이며, 강건성과 일반화 능력을 입증했다.
  • Yoochoose 데이터셋에서는 1-시퀀스 및 2-시퀀스 계산이 많아 계산 비용이 높지만, TKUS는 여전히 경쟁력 있고 전체적으로 확장 가능한 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.