[논문 리뷰] Utility-driven Mining of Contiguous Sequences
이 논문은 복잡한 다중 항목 시퀀스 데이터베이스에서 연속 순차 패턴(UCSPM)을 이용해 채굴하는 데 전용된 새로운 알고리즘인 FUCPM을 제안한다. FUCPM는 시퀀스 정보 목록과 인스턴스 체인이라는 압축된 데이터 구조를 활용하고, 시퀀스 가중치 기반 및 항목 확장 기반의 유효도 상한을 바탕으로 한 두 가지 가지치기 전략(GUIP 및 LUIP)을 적용하여, 최신 기술 대비 뛰어난 효율성과 확장성을 확보한다. 이로 인해 런타임과 메모리 사용량이 크게 감소하고, 연속 패턴에만 집중함으로써 결과가 더욱 간결해진다.
Recently, contiguous sequential pattern mining (CSPM) gained interest as a research topic, due to its varied potential real-world applications, such as web log and biological sequence analysis. To date, studies on the CSPM problem remain in preliminary stages. Existing CSPM algorithms lack the efficiency to satisfy users' needs and can still be improved in terms of runtime and memory consumption. In addition, existing algorithms were developed to deal with simple sequence data, working with only one event at a time. Complex sequence data, which represent multiple events occurring simultaneously, are also commonly observed in real life. In this paper, we propose a novel algorithm, fast utility-driven contiguous sequential pattern mining (FUCPM), to address the CSPM problem. FUCPM adopts a compact sequence information list and instance chain structures to store the necessary information of the database and candidate patterns. For further efficiency, we develop the global unpromising items pruning and local unpromising items pruning strategies, based on sequence-weighted utilization and item-extension utilization, to reduce the search space. Extensive experiments on real-world and synthetic datasets demonstrate that FUCPM outperforms the state-of-the-art algorithms and is scalable enough to handle complex sequence data.
연구 동기 및 목표
- 기존 연속 순차 패턴 채굴(CSPM) 알고리즘의 한계를 해결하기 위해, 높은 런타임과 메모리 소비 문제를 해결하고 복잡한 다중 항목 시퀀스를 지원하지 못하는 점을 개선한다.
- 기존 순차 패턴 채굴(SPM) 및 고유효도 순차 패턴 채굴(HUSPM)의 단점을 극복하기 위해 빈도나 유효도만 기반으로 하며 연속성 조건을 적용하지 않아 해석이 어려운 또는 현실과 맞지 않는 패턴을 도출한다는 점을 개선한다.
- 실제 연속성(예: 이동 경로 또는 DNA 서열 등)을 반영하는 연속 고유효도 순차 패턴(HUCSPs)만을 효율적으로 탐색하는 확장 가능한 알고리즘을 개발한다.
- 상한 유효도 추정 기반의 새로운 가지치기 전략을 통해 검색 공간을 줄임으로써 채굴 효율성을 향상시키되, 완전성은 유지한다.
제안 방법
- FUCPM은 후보 패턴의 유효도 및 상한 값 계산을 효율적으로 수행하기 위해 시퀀스 정보 목록과 인스턴스 체인 데이터 구조를 사용한다.
- 전체 시퀀스 프리픽스의 최대 가능한 유효도를 추정하기 위해 시퀀스 가중 유효도(SWU)를 도입하여 전역적인 가지치기를 가능하게 한다.
- 패턴 확장 중에 더 날카운 가지치기를 위해 국소적 가지치기의 더 엄격한 상한으로서 항목 확장 유효도(IEU)를 제안한다.
- 전역 비망설 항목 가지치기(GUIP) 전략은 SWU를 기반으로 비망설 항목을 조기에 제거하고, 국소 비망설 항목 가지치기(LUIP) 전략은 패턴 확장 중에 IEU를 적용하여 검색 공간을 추가로 축소한다.
- 다중 항목 시퀀스는 각 아이템세트를 동시에 발생하는 사건으로 간주하여 처리함으로써 차량 이동 경로나 생물학적 서열과 같은 복잡한 실제 데이터를 지원한다.
- FUCPM은 데이터셋 크기에 비례해 런타임과 메모리 소비가 선형적으로 증가하는 방식으로 설계되어, 유효도 임계값이 증가하더라도 확장성이 뛰어나다.
실험 결과
연구 질문
- RQ1기존 최신 기술 대비 CSPM 및 HUSPM 방법에 비해 런타임과 메모리 효율성 측면에서 더 뛰어난 성능을 보일 수 있는 유효도 기반 연속 순차 패턴 채굴 알고리즘이 존재하는가?
- RQ2제안된 GUIP 및 LUIP 가지치기 전략이 연속 고유효도 순차 패턴의 검색 공간을 얼마나 효과적으로 줄이는가?
- RQ3실제 및 합성 다중 항목 시퀀스 데이터에서 FUCPM의 성능은 데이터셋 크기와 복잡도 증가에 따라 어떻게 확장되는가?
- RQ4일반 HUSPM 알고리즘과 비교해 FUCPM의 출력 결과는 비연속 패턴을 포함하는 경우에 비해 얼마나 더 간결한가?
주요 결과
- FUCPM은 모든 6개의 실제 데이터셋에서 최신 기술인 ProUM을 능가했으며, 모든 케이스에서 2초 이내로 채굴을 완료했다. 반면 ProUM은 BMS, Kosarak10k, FIFA 데이터셋에서 2시간 내로 완료하지 못했다.
- 성경 데이터셋에서 FUCPM은 ProUM 대비 메모리 사용량을 69% 감소시켰다(417.35 MB 대비 1352.71 MB), 런타임은 93% 감소시켰다(2.12초 대비 29.20초).
- 제거 실험을 통해 GUIP와 LUIP 전략 모두 가지치기 기여를 확인했으며, LUIP가 검색 공간 축소에 더 효과적임을 입증했다.
- FUCPM은 선형 확장성을 보였다: 데이터셋 크기가 10K에서 400K로 증가함에 따라 런타임과 메모리 사용량이 거의 선형적으로 증가하여 강력한 확장성 잠재력을 입증했다.
- 발견된 HUCSP의 수는 일반 HUSPM에서 발견되는 HUSP의 수보다 크게 줄어들었으며, 성경 데이터셋에서 36개 대비 2,760개로 나타나 연속성 제약으로 인한 결과의 간결성이 확인되었다.
- 합성 데이터셋에서 FUCPM은 총 유효도 기반 적응형 임계값 덕분에 데이터셋 크기가 증가함에 따라 후보 수와 HUCSP 수가 최소한으로 증가하는 안정적인 성능을 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.