Skip to main content
QUICK REVIEW

[論文レビュー] Similarity Preserving Representation Learning for Time Series Clustering

Qi Lei, Jinfeng Yi|arXiv (Cornell University)|Feb 12, 2017
Time Series Analysis and Forecasting参考文献 39被引用数 13
ひとこと要約

本稿では、時間系列データを類似度を保ったまま低次元の特徴ベクトルに変換する類似度保存型表現学習フレームワークSPIRALを提案する。これにより、標準的なアルゴリズムを用いた効率的なクラスタリングが可能になる。O(n log n)組の類似度をランダムにサンプリングし、パラメータフリーの巡回座標降下法を用いた低ランク行列分解により、実世界のデータセットにおいて最先端の精度を達成するとともに、従来手法と比較して最大100倍の高速化を実現した。

ABSTRACT

A considerable amount of clustering algorithms take instance-feature matrices as their inputs. As such, they cannot directly analyze time series data due to its temporal nature, usually unequal lengths, and complex properties. This is a great pity since many of these algorithms are effective, robust, efficient, and easy to use. In this paper, we bridge this gap by proposing an efficient representation learning framework that is able to convert a set of time series with various lengths to an instance-feature matrix. In particular, we guarantee that the pairwise similarities between time series are well preserved after the transformation, thus the learned feature representation is particularly suitable for the time series clustering task. Given a set of $n$ time series, we first construct an $n imes n$ partially-observed similarity matrix by randomly sampling $\mathcal{O}(n \log n)$ pairs of time series and computing their pairwise similarities. We then propose an efficient algorithm that solves a non-convex and NP-hard problem to learn new features based on the partially-observed similarity matrix. By conducting extensive empirical studies, we show that the proposed framework is more effective, efficient, and flexible, compared to other state-of-the-art time series clustering methods.

研究の動機と目的

  • 時間系列データと、インスタンス-特徴行列を必要とする静的クラスタリングアルゴリズムの間のギャップを埋める。
  • 時間系列クラスタリングにおける全組み合わせ類似度の計算コストの高さに対処する。
  • 低次元埋め込み空間において時間系列間の対比較類似度を保存することで、クラスタリング性能の向上を図る。
  • 表現学習を通じて、k-meansのような効率的で汎用のクラスタリングアルゴリズムを時間系列データに適用可能にする。
  • DTW や MSM などのさまざまな時間系列類似度測度と互換性を持つ柔軟なフレームワークを構築する。

提案手法

  • DTW やその他の類似度測度を用いて、n 個の時間系列間で O(n log n) 組の対比較類似度をランダムにサンプリングし、部分観測類似度行列を構築する。
  • 表現学習問題を対称行列因子分解として定式化する。n×d の特徴行列 X を学習し、X X^T がサンプリングされたエントリにおいて観測類似度行列を近似するようにする。
  • 非凸かつ NP 困難な行列因子分解問題を、スパース観測のみを用いて効率的に解くパラメータフリーの正確な巡回座標降下法を提案する。
  • 時間系列類似度行列の低ランク構造を活用し、行列補完理論的結果と共動的パターンの実証的証拠に基づく。
  • 学習された d 次元特徴表現を、k-means などの標準クラスタリングアルゴリズムの入力として使用し、高速かつ高精度なクラスタリングを実現する。
  • DTW や MSM などの類似度測度を複数サポートするモジュール型フレームワークを設計し、埋め込み空間においてそれらの固有の性質を保持する。

実験結果

リサーチクエスチョン

  • RQ1O(n log n) 個のランダムにサンプリングされたエントリからのみ、時間系列類似度行列の低ランク近似を効果的に学習できるか?
  • RQ2スパース類似度行列に対する対称行列因子分解のためのパラメータフリーで効率的なアルゴリズムが、クラスタリングに適した高品質な特徴表現を生成できるか?
  • RQ3提案フレームワークにより、k-means などの標準クラスタリングアルゴリズムが、専用の時間系列クラスタリング手法を上回る精度と効率を達成できるか?
  • RQ4長さや特徴が異なる多様な時間系列データセットにおいて、フレームワークはどのように性能を発揮するか?
  • RQ5DTW や MSM などの複数の類似度測度と互換性を持つほどフレームワークは柔軟か?

主な発見

  • SPIRAL-DTW-k-Means は、85 個のデータセットの 72.9% において正規化相互情報量(NMI)の観点で k-Shape や CLDS、k-Means-DTW を上回った。
  • SPIRAL-MSM-k-Means は、81.2% のデータセットで Laplace-MSM-k-Means よりも高い NMI を達成し、75.3% のデータセットで k-Medoids-MSM よりも高い NMI を達成した。
  • ElectricDevice データセット(16,637 個の時間系列)において、SPIRAL-DTW-k-Means は 2 分未満で実行されたが、k-Means-DTW は 169 分、Laplace-DTW-k-Means は 5 時間を要した。
  • 全 DTW 類似度行列(n=150,000)の計算に 28 時間以上かかっていたのを、O(n log n) のサンプリングにより 3 分に短縮した。
  • n=150,000、d=15 の場合、提案された巡回座標降下法は 25 秒で特徴を学習し、高い効率性を示した。
  • k-means などの単純なクラスタリングアルゴリズムですら、学習された表現上で強力な性能を発揮した。これは、特徴学習の質の高さを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。