Skip to main content
QUICK REVIEW

[논문 리뷰] A General Framework for Density Based Time Series Clustering Exploiting a Novel Admissible Pruning Strategy

Nurjahan Begum, Liudmila Ulanova|arXiv (Cornell University)|2016. 12. 02.
Time Series Analysis and Forecasting참고 문헌 49인용 수 6
한 줄 요약

이 논문은 동적 시간 왜곡(DTW)-기반 클러스터링을 가속화하기 위해 새로운 허용 가능한 잘라내기 전략을 사용하는 일반적인 밀도 기반 시계열 클러스터링 프레임워크를 제안한다. 이 전략은 거리 계산의 불필요한 부분을 제거하기 위해 상한과 하한을 동시에 활용한다. 이 방법은 브루트 포스 DTW 클러스터링 대비 최소 10배의 속도 향상을 달성하면서 정확한 결과를 유지하며, 남은 계산을 히우리스틱 순서로 정렬함으로써 anytime 실행 모델을 지원한다. 이는 천문학, 의학, 단백질 서열 등 다양한 분야에서 검증되었다.

ABSTRACT

Time Series Clustering is an important subroutine in many higher-level data mining analyses, including data editing for classifiers, summarization, and outlier detection. It is well known that for similarity search the superiority of Dynamic Time Warping (DTW) over Euclidean distance gradually diminishes as we consider ever larger datasets. However, as we shall show, the same is not true for clustering. Clustering time series under DTW remains a computationally expensive operation. In this work, we address this issue in two ways. We propose a novel pruning strategy that exploits both the upper and lower bounds to prune off a very large fraction of the expensive distance calculations. This pruning strategy is admissible and gives us provably identical results to the brute force algorithm, but is at least an order of magnitude faster. For datasets where even this level of speedup is inadequate, we show that we can use a simple heuristic to order the unavoidable calculations in a most-useful-first ordering, thus casting the clustering into an anytime framework. We demonstrate the utility of our ideas with both single and multidimensional case studies in the domains of astronomy, speech physiology, medicine and entomology. In addition, we show the generality of our clustering framework to other domains by efficiently obtaining semantically significant clusters in protein sequences using the Edit Distance, the discrete data analogue of DTW.

연구 동기 및 목표

  • 대규모 데이터셋에서 DTW 기반 시계열 클러스터링의 높은 계산 비용을 해결하기 위해.
  • 정확한 클러스터링 결과를 유지하면서도 거리 계산을 극도로 줄일 수 있는 잘라내기 전략을 개발하기 위해.
  • 필수적인 계산을 순서대로 정렬하여 점진적인 결과 향상이 가능한 anytime 클러스터링을 가능하게 하기 위해.
  • 다양한 도메인, 특히 다차원 시계열과 단백질 서열과 같은 이산 서열을 포함한 일반성 있는 프레임워크를 입증하기 위해.
  • 연속적인 시계열을 넘어 이산 데이터에 적용 가능한 편집 거리(Edit Distance)를 사용하도록 프레임워크를 확장하여 적용 가능성을 보여주기 위해.

제안 방법

  • DTW 거리에 대한 상한과 하한을 동시에 사용하여 중복 계산을 제거하는 새로운 허용 가능한 잘라내기 전략을 도입한다.
  • 이 잘라내기 전략을 밀도 기반 클러스터링 프레임워크에 적용하여 브루트 포스 클러스터링과 정확히 동일한 결과를 보장한다.
  • 남은 거리 계산을 히우리스틱 기반 순서로 정렬하여 가장 유용한 계산을 우선 처리함으로써, anytime 클러스터링 프레임워크를 구현한다.
  • 이산 서열에 대해 편집 거리를 사용할 수 있도록 프레임워크를 적응시켜 연속적인 시계열을 넘어서도 일반적으로 적용 가능함을 입증한다.
  • 천문학, 음성 생리학, 의학, 곤충학 등 다양한 도메인의 시계열 데이터를 클러스터링하기 위해 프레임워크를 활용한다.
  • 지역 밀도와 도달 가능성 기반으로 시계열을 군집화하는 계층적 밀도 기반 클러스터링 접근 방식을 사용한다.

실험 결과

연구 질문

  • RQ1DTW 거리에 대한 상한과 하한을 동시에 사용하는 잘라내기 전략이 정확도에 영향을 주지 않으면서도 계산 비용을 크게 줄일 수 있는가?
  • RQ2이 잘라내기 전략이 어떻게 브루트 포스 클러스터링과 동일한 결과를 보장할 수 있는가?
  • RQ3남은 거리 계산을 순서대로 정렬함으로써 anytime 클러스터링을 지원할 수 있는가?
  • RQ4다차원 시계열과 단백질 서열과 같은 이산 서열에 적용했을 때도 이 프레임워크가 효과적이고 효율적인가?
  • RQ5천문학과 의학과 같은 다양한 실제 응용 분야에서 이 프레임워크가 상당한 속도 향상을 달성할 수 있는가?

주요 결과

  • 제안된 잘라내기 전략은 브루트 포스 DTW 클러스터링 대비 최소 10배의 속도 향상을 달성하면서도 정확한 결과를 유지한다.
  • 이 잘라내기 전략은 허용 가능하므로 브루트 포스 방법과 동일한 클러스터링 결과를 보장한다.
  • 필수적인 거리 계산을 순서대로 정렬함으로써 anytime 실행 모델을 지원하여 점진적으로 개선되는 결과를 제공한다.
  • 천문학, 음성 생리학, 의학, 곤충학 등 다양한 분야의 시계열 데이터를 의미 있고 의미 있는 군집으로 성공적으로 클러스터링하였다.
  • 편집 거리를 사용함으로써 이산 서열에 대한 일반화가 효과적으로 이루어졌으며, 단백질 서열 데이터에서 의미 있는 군집을 생성하였다.
  • 이 방법은 단일 및 다차원 시계열 모두에서 뛰어난 성능을 보이며, 넓은 적용 가능성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.