Skip to main content
QUICK REVIEW

[論文レビュー] Time series clustering based on the characterisation of segment typologies

David Guijo-Rubio, Antonio M. Durán-Rosal|arXiv (Cornell University)|Oct 27, 2018
Time Series Analysis and Forecasting被引用数 5
ひとこと要約

本稿では、時系列データを可変長の多項式フィットしたセグメントに分割し、統計的特徴量を抽出した後、階層的クラスタリングによりセグメントタイプをグループ化し、各時系列をセグメントクラスタ重心に基づいてコンパクトな特徴ベクトルにマップする二段階型時系列クラスタリング手法TS3Cを提案する。84個のUCRデータセットにおいて、クラスタリング精度と効率性の両面で最先端手法を上回り、内部的バリデーションを用いた自動パrameterチューニングにより統計的に有意な改善が得られた。

ABSTRACT

Time series clustering is the process of grouping time series with respect to their similarity or characteristics. Previous approaches usually combine a specific distance measure for time series and a standard clustering method. However, these approaches do not take the similarity of the different subsequences of each time series into account, which can be used to better compare the time series objects of the dataset. In this paper, we propose a novel technique of time series clustering based on two clustering stages. In a first step, a least squares polynomial segmentation procedure is applied to each time series, which is based on a growing window technique that returns different-length segments. Then, all the segments are projected into same dimensional space, based on the coefficients of the model that approximates the segment and a set of statistical features. After mapping, a first hierarchical clustering phase is applied to all mapped segments, returning groups of segments for each time series. These clusters are used to represent all time series in the same dimensional space, after defining another specific mapping process. In a second and final clustering stage, all the time series objects are grouped. We consider internal clustering quality to automatically adjust the main parameter of the algorithm, which is an error threshold for the segmenta- tion. The results obtained on 84 datasets from the UCR Time Series Classification Archive have been compared against two state-of-the-art methods, showing that the performance of this methodology is very promising.

研究の動機と目的

  • 既存の時系列クラスタリング手法が系列内セグメント類似性を無視するという制限を解消すること。
  • セグメンテーションと特徴抽出を通じて個々の時系列内におけるタイプ的パターンを活用し、クラスタリング品質を向上させること。
  • 計算コストを低減するため、時系列をクラスタベースの表現に要約することで、ドメインに依存しない、パrameter調整可能な手法を開発すること。
  • 教師なしラベルが存在する状況でも、内部クラスタリング基準を用いてセグメンテーション誤差しきい値を自動的にチューニングし、安定したパフォーマンスを実現すること。

提案手法

  • 成長するウィンドウ手法を用いた最小二乗多項式セグメンテーションを適用し、各時系列を可変長のセグメントに分割する。
  • 各セグメントから多項式係数、分散、歪度、自己相関などの統計的特徴量を抽出し、固定次元の特徴ベクトルを構成する。
  • セグメント特徴量に対して階層的クラスタリングを実行し、各時系列内での類似したセグメントタイプをグループ化する。
  • 各時系列を、クラスタ重心、セグメント分散、平均二乗誤差(MSE)差、およびセグメント数からなるベクトルとして表現する。
  • 内部クラスタリングバリデーション(調整ランダ指数)を用いて、最適なセグメンテーション誤差しきい値を自動選択する。
  • 標準的なクラスタリングアルゴリズムを用いて、マップされた時系列表現の最終的クラスタリング段階を実行する。

実験結果

リサーチクエスチョン

  • RQ1セグメントタイプの特徴抽出は、標準的な距離ベース手法と比較して時系列クラスタリング性能を向上させるか?
  • RQ2系列内セグメント類似性を活用することで、クラスタリング精度と計算効率にどのような影響を与えるか?
  • RQ3教師なしラベルが存在する状況でも、内部クラスタリングバリデーションがセグメンテーション誤差しきい値を効果的にチューニングできるか?
  • RQ4二段階アプローチにより、元の時系列処理と比較して最終的クラスタリングのコストを低減できるか?
  • RQ5TS3Cは、$DD_{DTW}$-HC や KSC といった最先端手法と比較して、精度と実行時間の両面で優れているか?

主な発見

  • TS3Cは$DD_{DTW}$-HCを著しく上回り、クラスタリング精度において統計的に有意なp値(有意水準α=0.05)を示した。TS3C CHとTS3C MVのp値はそれぞれ0.016および0.013であった。
  • TS3C MVはα=0.10の有意水準においてKSCを統計的に上回り、p値0.057を示し、より優れたロバストネスを示した。
  • TS3Cは$DD_{DTW}$-HCと比較して著しく効率的であり、$DD_{DTW}$-HCを含むすべての比較においてp値が0.000であった。
  • 最終的クラスタリング段階の計算コストは、元の時系列長に依存せず、各系列を表現するためのクラスタ数にのみ依存する。
  • 内部バリデーションを用いたパrameterチューニングにより、多様なUCRデータセットにわたって安定的かつ一貫性のあるパフォーマンスが得られた。
  • ウィルコクソン符号順位検定の結果、TS3Cは$DD_{DTW}$-HCよりも精度と効率性に優れており、実行時間ではKSCと同等であり、α=0.05の有意水準においてTS3CとKSCの間で精度に有意差は認められなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。