Skip to main content
QUICK REVIEW

[논문 리뷰] Towards a Near Universal Time Series Data Mining Tool: Introducing the Matrix Profile

Chin‐Chia Michael Yeh|arXiv (Cornell University)|2018. 11. 05.
Time Series Analysis and Forecasting참고 문헌 128인용 수 8
한 줄 요약

이 논문은 시간 시리즈 서브시퀀스에 대한 모든 쌍의 유사도 검색 결과를 캐시하는 파rameter-free, 정확하고 확장 가능한 데이터 구조인 매트릭스 프로파일을 소개한다. 이는 단일 및 다중 차원 시간 시리즈에서 무용성 탐지, 클러스터링 등의 다양한 시간 시리즈 마이닝 작업에 대해 효율적이고 통합된 솔루션을 가능하게 한다.

ABSTRACT

The last decade has seen a flurry of research on all-pairs-similarity-search (or, self-join) for text, DNA, and a handful of other datatypes, and these systems have been applied to many diverse data mining problems. Surprisingly, however, little progress has been made on addressing this problem for time series subsequences. In this thesis, we have introduced a near universal time series data mining tool called matrix profile which solves the all-pairs-similarity-search problem and caches the output in an easy-to-access fashion. The proposed algorithm is not only parameter-free, exact and scalable, but also applicable for both single and multidimensional time series. By building time series data mining methods on top of matrix profile, many time series data mining tasks (e.g., motif discovery, discord discovery, shapelet discovery, semantic segmentation, and clustering) can be efficiently solved. Because the same matrix profile can be shared by a diverse set of time series data mining methods, matrix profile is versatile and computed-once-use-many-times data structure. We demonstrate the utility of matrix profile for many time series data mining problems, including motif discovery, discord discovery, weakly labeled time series classification, and representation learning on domains as diverse as seismology, entomology, music processing, bioinformatics, human activity monitoring, electrical power-demand monitoring, and medicine. We hope the matrix profile is not the end but the beginning of many more time series data mining projects.

연구 동기 및 목표

  • 시간 시리즈 서브시퀀스에 대한 모든 쌍의 유사도 검색을 위한 확장 가능하고 통합적인 도구의 부족을 해결한다.
  • 다양한 시간 시리즈 마이닝 작업을 위해 유사도를 재계산하지 않고도 재사용 가능한 단일 데이터 구조를 개발한다.
  • 정확하고 파rameter-free이며 단변량 및 다변량 시간 시리즈 모두에 적용 가능한 솔루션을 확보한다.
  • 의료, 음악, 전력 수요, 곤충학 등 다양한 분야에서 광범위한 적용 가능성을 입증한다.
  • 다양하고 조합 가능한 도구를 제공하여 향후 시간 시리즈 데이터 마이닝 연구의 기반을 마련한다.

제안 방법

  • 모든 서브시퀀스가 주어진 길이의 다른 모든 서브시퀀스와의 최소 거리를 저장하는 데이터 구조로 매트릭스 프로파일을 제안한다.
  • 최적화된 컨볼루션과 슬라이딩 윈도우 기법을 사용하여 매트릭스 프로파일을 효율적으로 계산하기 위한 STAMP 및 STOMP 알고리즘을 구현한다.
  • 다차원 유사도 측정법을 사용하여 다차원 시간 시리즈로의 방법 확장에 대해 mSTAMP 및 mSTOMP 알고리즘을 도입한다.
  • 모든 하위문제에 대한 사전 계산 기반의 기초로 매트릭스 프로파일을 활용하여 무용성 탐지, 디스카드 탐지, 클러스터링 등의 후행 작업을 수행한다.
  • 매트릭스 프로파일 기반의 이웃 영역을 활용한 표현 학습을 위한 neighbor-encoder 프레임워크를 제안하며, 노이즈에 대한 강건성을 향상시킨다.
  • SDTS 알고리즘을 통해 매트릭스 프로파일 기반의 사전을 활용해 약한 레이블이 부여된 분류 작업을 수행한다.

실험 결과

연구 질문

  • RQ1다양한 시간 시리즈 마이닝 문제를 효율적으로 해결할 수 있는 단일 재사용 가능한 데이터 구조를 설계할 수 있는가?
  • RQ2파rameter 조정이 필요 없이 정확하고 확장 가능한 방식으로 시간 시리즈 서브시퀀스에 대한 모든 쌍의 유사도 검색을 어떻게 수행할 수 있는가?
  • RQ3매트릭스 프로파일은 해석 가능성과 성능을 유지하면서 다차원 시간 시리즈로 얼마나 일반화될 수 있는가?
  • RQ4매트릭스 프로파일이 표현 학습 및 약한 지도 학습 분류의 기초 구성 요소로 기능할 수 있는가?
  • RQ5매트릭스 프로파일 기반 neighbor-encoder는 기존 오토인코더에 비해 노이즈에 대한 강건성과 표현 품질 측면에서 어떻게 비교되는가?

주요 결과

  • 매트릭스 프로파일은 시간 시리즈 서브시퀀스에 대한 모든 쌍의 유사도 검색을 정확하고 파rameter-free이며 확장 가능한 방식으로 수행할 수 있으며, 실질적으로 선형 시간 복잡도를 가진다.
  • STAMP 및 STOMP 알고리즘은 거의 선형 시간 성능을 달성하며, anytime 성질을 지원하여 진행 상황 표시와 점진적 결과를 제공한다.
  • 매트릭스 프로파일은 음악(예: 코러스 탐지), 지질학, 인간 활동 모니터링 등 다양한 분야에서 무용성, 디스카드, 샤프트를 성공적으로 식별한다.
  • 약한 레이블이 부여된 분류 작업에서 매트릭스 프로파일 기반 사전을 사용하는 SDTS 알고리즘은 벌 EPG 및 신경과학 데이터셋에서 높은 정확도를 달성하며, 기준 방법을 능가한다.
  • 특히 노이즈 제거 버전인 neighbor-encoder 프레임워크는 노이즈가 있는 시간 시리즈 데이터에서 클러스터링 및 분류 작업에서 표준 오토인코더를 크게 능가한다.
  • PAMAP2 인간 활동 데이터셋에서 k-neighbor-encoder는 깨끗한 환경에서 조정된 랜드 지수 0.4272(노이즈 제거 버전), 노이즈 있는 환경에서 0.3948를 기록하며 오토인코더 성능을 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.