Skip to main content
QUICK REVIEW

[論文レビュー] A General Framework for Density Based Time Series Clustering Exploiting a Novel Admissible Pruning Strategy

Nurjahan Begum, Liudmila Ulanova|arXiv (Cornell University)|Dec 2, 2016
Time Series Analysis and Forecasting参考文献 49被引用数 6
ひとこと要約

本稿では、上界と下界の両方を活用して不要な距離計算を排除する、新規の許容可能なプルーニング戦略を用いて、動的時系列適合(DTW)に基づくクラスタリングの計算を高速化する一般化された密度ベースの時系列クラスタリングフレームワークを提案する。この手法は、正確な結果を保ちながら、ブルートフォースなDTWクラスタリングに比べて少なくとも10倍の高速化を達成し、残りの計算をヒューリスティックに順序付けることで、プログレッシブな結果の改善が可能な「いつでも実行可能(anytime)」の実行モデルをサポートする。有効性は、天文学、医学、タンパク質配列を含む多様な分野で検証された。

ABSTRACT

Time Series Clustering is an important subroutine in many higher-level data mining analyses, including data editing for classifiers, summarization, and outlier detection. It is well known that for similarity search the superiority of Dynamic Time Warping (DTW) over Euclidean distance gradually diminishes as we consider ever larger datasets. However, as we shall show, the same is not true for clustering. Clustering time series under DTW remains a computationally expensive operation. In this work, we address this issue in two ways. We propose a novel pruning strategy that exploits both the upper and lower bounds to prune off a very large fraction of the expensive distance calculations. This pruning strategy is admissible and gives us provably identical results to the brute force algorithm, but is at least an order of magnitude faster. For datasets where even this level of speedup is inadequate, we show that we can use a simple heuristic to order the unavoidable calculations in a most-useful-first ordering, thus casting the clustering into an anytime framework. We demonstrate the utility of our ideas with both single and multidimensional case studies in the domains of astronomy, speech physiology, medicine and entomology. In addition, we show the generality of our clustering framework to other domains by efficiently obtaining semantically significant clusters in protein sequences using the Edit Distance, the discrete data analogue of DTW.

研究の動機と目的

  • 大規模なデータセットにおけるDTWベースの時系列クラスタリングの高い計算コストに対処すること。
  • 正確なクラスタリング結果を維持しながら、距離計算を著しく削減するプルーニング戦略の開発。
  • 残りの距離計算を順序付けすることで、段階的な結果の改善が可能な「いつでもクラスタリング」を実現すること。
  • 多変数時系列やタンパク質配列のような離散的シーケンスを含む、多様な分野への汎用性を示すこと。
  • 連続的時系列にとどまらず、離散的データに対しても適用可能な編集距離(Edit Distance)を用いた拡張を実現すること。

提案手法

  • DTW距離の上界と下界の両方を活用して、冗長な距離計算を排除する、新規の許容可能なプルーニング戦略を導入する。
  • プルーニング戦略を密度ベースのクラスタリングフレームワークに組み込み、ブルートフォースクラスタリングと同一の結果が保証されるようにする。
  • 残りの距離計算をヒューリスティックに順序付け、最も有用な計算を優先することで、プログレッシブな結果の改善が可能な「いつでもクラスタリング」フレームワークを実現する。
  • 離散的シーケンスに対応するため、フレームワークを編集距離(Edit Distance)に適応させ、連続的時系列にとどまらない汎用性を示す。
  • 天文学、発声生理学、医学、昆虫学を含む、複数の分野における時系列のクラスタリングにフレームワークを適用する。
  • 局所的な密度と到達可能性に基づいて時系列をグループ化する階層的密度ベースのクラスタリングアプローチを採用する。

実験結果

リサーチクエスチョン

  • RQ1DTW距離の上界と下界の両方を用いたプルーニング戦略が、クラスタリングの正確性に影響を与えることなく、計算コストを著しく削減できるか。
  • RQ2このプルーニング戦略が許容可能(admissible)であることで、ブルートフォースクラスタリングと同一の結果が保証されるか。
  • RQ3残りの距離計算を順序付けすることで、「いつでもクラスタリング」を実現できるか。
  • RQ4多変数時系列やタンパク質配列のような離散的シーケンスに対しても、このフレームワークが効果的かつ効率的であるか。
  • RQ5天文学や医学のような多様な分野における実世界の応用で、顕著な高速化が達成できるか。

主な発見

  • 提案されたプルーニング戦略は、ブルートフォースなDTWクラスタリングに比べて、少なくとも10倍の高速化を達成しながら、正確な結果を維持している。
  • プルーニング戦略は許容可能であり、網羅的なアプローチと同一のクラスタリング結果を保証している。
  • 残りの距離計算を順序付けることで、「いつでも実行可能」な実行モデルをサポートし、段階的な結果の改善が可能である。
  • 天文学、発声生理学、医学、昆虫学における時系列クラスタリングにおいて、意味的に有意義なクラスタが得られ、意味的・意味論的に重要なクラスタを生成している。
  • 編集距離(Edit Distance)を用いることで、離散的シーケンスに対してもフレームワークが効果的に一般化され、タンパク質配列データにおいても意味的・意味論的に重要なクラスタが得られている。
  • 本手法は単変数時系列および多変数時系列の両方で、優れた性能を示しており、広範な適用可能性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。