Skip to main content
QUICK REVIEW

[論文レビュー] A Review and Evaluation of Elastic Distance Functions for Time Series Clustering

Chris Holder, Matthew Middlehurst|arXiv (Cornell University)|May 30, 2022
Time Series Analysis and Forecasting参考文献 33被引用数 6
ひとこと要約

この論文は、UCRの時系列データセットを用いてk-meansおよびk-medoidsを用いた時系列クラスタリングにおいて、9種類の弾性距離関数を評価している。驚くべきことに、動的時系列ワープ(DTW)はk-meansではユークリッド距離を下回る性能を示すが、移動・分割・マージ(MSM)距離を用いたk-medoidsは、他のすべての手法を常に上回り、弾性距離に基づくクラスタリングの推奨されるベンチマークとして浮上する。

ABSTRACT

Time series clustering is the act of grouping time series data without recourse to a label. Algorithms that cluster time series can be classified into two groups: those that employ a time series specific distance measure; and those that derive features from time series. Both approaches usually rely on traditional clustering algorithms such as $k$-means. Our focus is on distance based time series that employ elastic distance measures, i.e. distances that perform some kind of realignment whilst measuring distance. We describe nine commonly used elastic distance measures and compare their performance with k-means and k-medoids clustering. Our findings are surprising. The most popular technique, dynamic time warping (DTW), performs worse than Euclidean distance with k-means, and even when tuned, is no better. Using k-medoids rather than k-means improved the clusterings for all nine distance measures. DTW is not significantly better than Euclidean distance with k-medoids. Generally, distance measures that employ editing in conjunction with warping perform better, and one distance measure, the move-split-merge (MSM) method, is the best performing measure of this study. We also compare to clustering with DTW using barycentre averaging (DBA). We find that DBA does improve DTW k-means, but that the standard DBA is still worse than using MSM. Our conclusion is to recommend MSM with k-medoids as the benchmark algorithm for clustering time series with elastic distance measures. We provide implementations in the aeon toolkit, results and guidance on reproducing results on the associated GitHub repository.

研究の動機と目的

  • k-meansおよびk-medoidsを用いた時系列クラスタリングにおける9種類の弾性距離測度の性能を評価すること。
  • k-meansでは、時系列分類と同様に、弾性距離がユークリッド距離を上回るのかを検証すること。
  • DTWに基づくk-meansクラスタリングにおけるバリセントラ平均化(DBA)の影響を評価すること。
  • 新しい時系列クラスタリングアルゴリズムを弾性距離に基づいて評価するための、堅牢で再現可能なベンチマークを特定すること。
  • 特に正規化およびテストセット評価下での計算効率とクラスタリング品質の比較を行うこと。

提案手法

  • ユークリッド距離、DTW、wDTW、MSM、EDR、LCSS、DDTW、ERP、TWE、WDDTWの合計9種類の弾性距離測度を評価した。
  • すべての系列を正規化してスケールバイアスを除去した後、112個のUCR時系列データセットに対してk-meansおよびk-medoidsクラスタリングを適用した。
  • k-medoidsの効率を高めるために、事前計算された距離行列を用い、重心の平均化に起因する問題を回避した。
  • DTWを用いたk-meansの重心を、アライメントと平均化により改善するためにバリセントラ平均化(DBA)を適用した。
  • 一貫性のある実装と再現性を確保するため、aeonおよびtslearnライブラリを用いて結果を再現した。
  • 過学習バイアスを避けるために、訓練データではなく別個のテストセットを用いて性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1時系列データにおいて、k-meansクラスタリングの性能が、ユークリッド距離と比較して弾性距離測度を用いることで向上するのか。
  • RQ2時系列クラスタリングにおいて、弾性距離を用いた場合にk-medoidsはk-meansに比べてどのように優れているのか。
  • RQ3バリセントラ平均化(DBA)は、DTWに基づくk-meansクラスタリングをどの程度改善するのか。
  • RQ4多様な時系列データセットにおいて、どの弾性距離測度が最も高いクラスタリング精度を達成するのか。
  • RQ5新しい時系列クラスタリングアルゴリズムを評価するための、計算効率が高く、高い性能を示すベースラインは存在するのか。

主な発見

  • k-meansを用いたDTWは、時系列分類における強力な性能とは対照的に、ユークリッド距離を下回る性能を示した。
  • k-medoidsは、9種類のすべての弾性距離測度において、k-meansを著しく上回り、弾性距離では重心の平均化が最適でないことが示された。
  • 移動・分割・マージ(MSM)距離は、DTW や TWE を含む、他のすべての弾性距離を上回り、k-medoidsと組み合わせて使用した場合に最も優れた性能を示した。
  • DBAはDTWに基づくk-meansクラスタリングを改善したが、依然としてMSMとk-medoidsを上回ることはできず、高い計算コストを要した。
  • tslearnにおけるDBAの実装は、元の実装よりも著しく高速であるが、依然としてMSMを上回る性能には至らず、計算コストは依然として高い。
  • MSMとk-medoidsの組み合わせは、優れた正確性と効率性を兼ね備えているため、弾性距離に基づく時系列クラスタリングの新しいベンチマークとして推奨される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。