Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Clustering using Auto-encoded Compact Representation for Time-series Analysis

Soma Bandyopadhyay, Anish Datta|arXiv (Cornell University)|Jan 11, 2021
Time Series Analysis and Forecasting参考文献 13被引用数 4
ひとこと要約

本稿では、時系列データのための階層的クラスタリング手法HC-AECSを提案する。この手法は、時系列データのコン pact な潜在表現(AECS)を学習するためのシーケンス・ツー・シーケンス自動エンコーダを用い、計算コストを顕著に低減するとともにクラスタリング性能を向上させる。本手法は最適化された距離測度(チェビシェフ、マンハッタン、マハラノビス)を用いた凝集型階層的クラスタリングを適用し、最良のクラスタリングを修正Hubert統計量を用いて選択する。UCR/UCIデータセットにおける単変量および多変量時系列データにおいて、DTWベースの代替手法と比較して最大47倍の高速化を達成し、最先端の手法を上回る性能を発揮する。

ABSTRACT

Getting a robust time-series clustering with best choice of distance measure and appropriate representation is always a challenge. We propose a novel mechanism to identify the clusters combining learned compact representation of time-series, Auto Encoded Compact Sequence (AECS) and hierarchical clustering approach. Proposed algorithm aims to address the large computing time issue of hierarchical clustering as learned latent representation AECS has a length much less than the original length of time-series and at the same time want to enhance its performance.Our algorithm exploits Recurrent Neural Network (RNN) based under complete Sequence to Sequence(seq2seq) autoencoder and agglomerative hierarchical clustering with a choice of best distance measure to recommend the best clustering. Our scheme selects the best distance measure and corresponding clustering for both univariate and multivariate time-series. We have experimented with real-world time-series from UCR and UCI archive taken from diverse application domains like health, smart-city, manufacturing etc. Experimental results show that proposed method not only produce close to benchmark results but also in some cases outperform the benchmark.

研究の動機と目的

  • 長期間の時系列データにおける階層的クラスタリングの高い計算コストを、コン pact な潜在表現を学習することで低減すること。
  • 最適な距離測度を用いた自動エンコーダベースの表現学習と階層的クラスタリングを統合し、クラスタリング性能を向上させること。
  • 従来の最先端手法が単変量時系列に限定されるのに対し、単変量および多変量時系列の両方で効果的なクラスタリングを可能にすること。
  • 修正Hubert統計量を用いた新たな内部評価メカニズムを構築し、教師なしラベルが存在する状況でも最適な距離測度およびクラスタリング設定を自動で選択すること。
  • 医療、製造業、スマートシティ分野の多様な実世界時系列データに対して、頑健性と効率性を示すこと。

提案手法

  • 長期間の時系列データのコン pact な潜在表現(AECS)を学習するために、深く、過剰な(undercomplete)シーケンス・ツー・シーケンス自動エンコーダ(Seq2Seq AE)を採用し、系列長を顕著に短縮する。
  • 学習されたAECS表現に基づいて凝集型階層的クラスタリングを適用し、計算複雑度を低減したクラスタリングを形成する。
  • 3つの距離測度(チェビシェフ(CH)、マンハッタン(MA)、マハラノビス(ML))を評価し、MLは内部評価にのみ使用する。
  • 最適な距離測度および対応するクラスタリング設定を特定するために、修正Hubert統計量(𝒯)を内部クラスタリング評価指標として使用する。
  • 再構成損失を用いてエンド・ツー・エンドで自動エンコーダを訓練し、コン pact な潜在空間に重要な時系列パターンを保持する。
  • 全パイプラインを統合型フレームワークとして統合し、𝒯に基づいて最良のクラスタリングを自動選択することで、多様なデータセットにわたる頑健性を確保する。

実験結果

リサーチクエスチョン

  • RQ1Seq2Seq自動エンコーダから得られる学習済みコン pact 表現は、長期間時系列データにおける階層的クラスタリングの効率性と性能を向上させ得るか?
  • RQ2自動エンコーディングされた時系列表現に適用する際、チェビシェフ、マンハッタン、マハラノビス距離測度のうち、どの距離測度がより一貫性があり、明確に分離されたクラスタを生成するか?
  • RQ3K-Shape や HC-DDTW といった最先端手法と比較して、本手法HC-AECSは単変量および多変量時系列において、クラスタリング精度と計算効率の両面で優れているか?
  • RQ4教師なしラベルが存在する状況でも、修正Hubert統計量は最適な距離測度の選択を効果的に導けるか?
  • RQ5医療や産業用IoTアプリケーションにおける高長さ時系列データに、本手法はどの程度スケーラブルか?

主な発見

  • HC-AECSはUCRアーカイブの9つの単変量時系列データセットのうち7つでベンチマーク手法HC-DDTWを上回り、HC-DDTWと比較して計算時間を27倍短縮した。
  • 多変量時系列データでは、最先端のMLSTM-FCNモデルを著しく上回り、Waferデータセットでは0.929の精度を達成したのに対し、MLSTM-FCNは0.906であった。
  • Coffee(286タイムステップ)やBeef(470タイムステップ)といった長期間系列では、K-Shape(単変量に限定)と比較して、それぞれ16倍および18倍の高速化を達成した。
  • AdiacデータセットではHC-DDTWと比較して47倍の高速化を達成し、系列長の増加に伴う強いスケーラビリティを示した。
  • 修正Hubert統計量評価におけるマハラノビス距離の使用は、新たな貢献であり、クラスタリング品質の向上と効果的な内部評価を可能にした。
  • ECG200、FordB、Waferなどの多様なデータセットにおいて、K-Shape や HC-DDTW と比較して、同等または優れたランダムインデックス(RI)スコアを達成した。これは、本手法の頑健性と一般化能力を裏付けるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。