Skip to main content
QUICK REVIEW

[論文レビュー] Towards a Near Universal Time Series Data Mining Tool: Introducing the Matrix Profile

Chin‐Chia Michael Yeh|arXiv (Cornell University)|Nov 5, 2018
Time Series Analysis and Forecasting参考文献 128被引用数 8
ひとこと要約

この論文では、時間系列部分列間の全ペア類似度検索の結果をキャッシュするパrameterフリーで正確かつスケーラブルなデータ構造、マトリックスプロファイルを導入している。これにより、単一および多次元時間系列におけるモチーフ発見、異常検知、クラスタリングといった多様な時間系列マイニングタスクに対して、効率的で統合的な解決策が可能になる。

ABSTRACT

The last decade has seen a flurry of research on all-pairs-similarity-search (or, self-join) for text, DNA, and a handful of other datatypes, and these systems have been applied to many diverse data mining problems. Surprisingly, however, little progress has been made on addressing this problem for time series subsequences. In this thesis, we have introduced a near universal time series data mining tool called matrix profile which solves the all-pairs-similarity-search problem and caches the output in an easy-to-access fashion. The proposed algorithm is not only parameter-free, exact and scalable, but also applicable for both single and multidimensional time series. By building time series data mining methods on top of matrix profile, many time series data mining tasks (e.g., motif discovery, discord discovery, shapelet discovery, semantic segmentation, and clustering) can be efficiently solved. Because the same matrix profile can be shared by a diverse set of time series data mining methods, matrix profile is versatile and computed-once-use-many-times data structure. We demonstrate the utility of matrix profile for many time series data mining problems, including motif discovery, discord discovery, weakly labeled time series classification, and representation learning on domains as diverse as seismology, entomology, music processing, bioinformatics, human activity monitoring, electrical power-demand monitoring, and medicine. We hope the matrix profile is not the end but the beginning of many more time series data mining projects.

研究の動機と目的

  • 時間系列部分列における全ペア類似度検索に、スケーラブルで包括的なツールが不足しているという問題に対処する。
  • 類似度の再計算を伴わずに、複数の時間系列マイニングタスクを実行可能な、単一で再利用可能なデータ構造を開発する。
  • 解が正確で、パrameterフリーであり、単変量および多変量時間系列の両方へ適用可能であることを保証する。
  • 医学、音楽、電力需要、昆虫学など多様な分野への広範な適用性を示す。
  • 多様で組み合わせ可能なツールを提供することで、将来的な時間系列データマイニング研究の基盤を築く。

提案手法

  • すべての部分列が、指定された長さの他のすべての部分列との最小距離を格納するデータ構造としてマトリックスプロファイルを提案する。
  • 最適化された畳み込みとスライディングウィンドウ技術を用いて、マトリックスプロファイルを効率的に計算するSTAMPおよびSTOMPアルゴリズムを実装する。
  • 多次元距離測定を用いて、mSTAMPおよびmSTOMPアルゴリズムを用いて、多次元時間系列への拡張を実現する。
  • 下流タスク(例:モチーフ発見、異常部分列検出、クラスタリング)のための事前計算された基盤としてマトリックスプロファイルを活用する。
  • マトリックスプロファイルに基づく近傍関係を利用したneighbor-encoderフレームワークを導入し、ノイズに強い表現学習を実現する。
  • マトリックスプロファイルに基づく辞書を用いて、弱教師あり分類にSDTSアルゴリズムを適用し、代表的部分列を学習する。

実験結果

リサーチクエスチョン

  • RQ1複数の時間系列マイニング問題を効率的に解決できる、単一で再利用可能なデータ構造を設計できるか?
  • RQ2パrameterチューニングを要せず、正確かつスケーラブルに時間系列部分列の全ペア類似度検索を実行する方法は何か?
  • RQ3マトリックスプロファイルは、解釈可能性とパフォーマンスを損なわずに、多次元時間系列へどの程度一般化可能か?
  • RQ4マトリックスプロファイルは、表現学習および弱教師あり分類の基盤的コンponentとして機能できるか?
  • RQ5ノイズのある時間系列データにおいて、マトリックスプロファイルに基づくneighbor-encoderは、従来のオートエンコーダーと比べて、どの程度優れた耐障害性と表現品質を示すか?

主な発見

  • マトリックスプロファイルは、時間系列部分列の全ペア類似度検索を正確に、パrameterフリーでスケーラブルに実行可能であり、実用的には線形時間計算量を達成する。
  • STAMPおよびSTOMPアルゴリズムは、ほぼ線形時間性能を達成し、プログレスバー表示や段階的結果の出力が可能な「anytime」性質を有する。
  • マトリックスプロファイルは、音楽(例:コーラス検出)、地震学、人的活動モニタリングなど多様な分野で、モチーフ、ディスコルドン、シープレットを効果的に同定した。
  • 弱教師あり分類において、マトリックスプロファイルに基づく辞書を用いたSDTSアルゴリズムは、昆虫EPGおよび神経科学のデータセットで高い精度を達成し、ベースライン手法を上回った。
  • 特にノイズ除去型のneighbor-encoderフレームワークは、ノイズのある時間系列データにおいて、クラスタリングおよび分類タスクで標準的なオートエンコーダーを著しく上回った。
  • PAMAP2人の活動データセットにおいて、k-neighbor-encoderは、クリーンな状況で調整ランダ指数0.4272(ノイズ除去型)を達成し、ノイズのある状況では0.3948を記録し、オートエンコーダーの性能を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。