Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Matrix Profile Computation Using Different Distance Functions

Reza Akbarinia, Bertrand Cloez|arXiv (Cornell University)|Jan 17, 2019
Time Series Analysis and Forecasting参考文献 10被引用数 6
ひとこと要約

本稿では、純粋なユークリッド距離およびz正規化ユークリッド距離をそれぞれ用いた行列プロファイルの計算に特化した効率的で正確なアルゴリズムAAMPおよびACAMPを提案する。両手法は増分的距離計算を活用し、顕著な高速化を実現する。AAMPは非正規化距離の計算においてSCRIMP++よりも数倍速く、ACAMPはz正規化ユークリッド距離の計算においてSCRIMP++を50%以上上回る性能を示し、多様な時系列データセットにおけるモチーフおよび異常値の高速同定を可能にする。

ABSTRACT

Matrix profile has been recently proposed as a promising technique to the problem of all-pairs-similarity search on time series. Efficient algorithms have been proposed for computing it, e.g., STAMP, STOMP and SCRIMP++. All these algorithms use the z-normalized Euclidean distance to measure the distance between subsequences. However, as we observed, for some datasets other Euclidean measurements are more useful for knowledge discovery from time series. In this paper, we propose efficient algorithms for computing matrix profile for a general class of Euclidean distances. We first propose a simple but efficient algorithm called AAMP for computing matrix profile with the "pure" (non-normalized) Euclidean distance. Then, we extend our algorithm for the p-norm distance. We also propose an algorithm, called ACAMP, that uses the same principle as AAMP, but for the case of z-normalized Euclidean distance. We implemented our algorithms, and evaluated their performance through experimentation. The experiments show excellent performance results. For example, they show that AAMP is very efficient for computing matrix profile for non-normalized Euclidean distances. The results also show that the ACAMP algorithm is significantly faster than SCRIMP++ (the state of the art matrix profile algorithm) for the case of z-normalized Euclidean distance.

研究の動機と目的

  • 既存の行列プロファイルアルゴリズムがz正規化ユークリッド距離にのみ依存するという限界を解決すること。これは標準偏差が0となる部分列では失敗する。
  • より広いクラスのユークリッド距離(純粋(非正規化)およびpノルム距離)を用いた行列プロファイルの効率的計算を可能にし、多様な時系列データにおける知識抽出を向上させること。
  • 正確で、いつでも利用可能(anytime)、増分的に更新可能で、決定論的なアルゴリズムを設計すること。実行時間は入力サイズおよび部分列長にのみ依存する。
  • 非正規化およびz正規化ユークリッド距離の両計算において、実行時間の面で最先端のSCRIMP++を上回ること。

提案手法

  • スライディングウィンドウを用い、走る和を維持することで再計算を回避する増分的アルゴリズムAAMPを提案。これにより、部分列間の純粋ユークリッド距離を計算する。
  • AAMPを一般化し、任意のp ≥ 1に対してpノルム距離を扱えるようにする。増分的距離式の一般化により、効率性を維持する。
  • AAMPと同様の増分的原理を応用したACAMPを設計。SCRIMP++で使用される高コストなFFT計算を回避する。
  • スライディングウィンドウ内で補助変数(和、二乗和)を維持し、z正規化距離を増分的に計算することで、重複計算を削減する。
  • 1回のパスで全行列プロファイルを正確に計算することで、アルゴリズムが正確かついつでも利用可能(anytime)であり、決定論的な時間計算量を保証する。
  • 実世界の時系列データを用いてアルゴリズムを実装・評価。異なる時系列長および部分列長において、実行時間をSCRIMP++と比較する。

実験結果

リサーチクエスチョン

  • RQ1純粋(非正規化)ユークリッド距離を用いた、効率的で正確な行列プロファイル計算アルゴリズムを設計できるか?
  • RQ2AAMPで用いられる増分的計算技術をpノルム距離へ一般化できるか?
  • RQ3FFTを回避し、SCRIMP++を上回る性能を発揮するz正規化ユークリッド距離用の効率的アルゴリズムを開発できるか?
  • RQ4異なる時系列長および部分列長において、提案手法とSCRIMP++の性能はどのように比較されるか?
  • RQ5実データセットにおいて、純粋ユークリッド距離(例:z正規化ユークリッド距離とは異なる)を用いることで、z正規化ユークリッド距離よりも優れた異常検出やモチーフ発見が可能になるか?

主な発見

  • AAMPは、純粋ユークリッド距離を用いた行列プロファイル計算において、SCRIMP++よりも顕著に低い実行時間を達成しており、時系列長が増加するにつれて性能向上が顕著になる。
  • ACAMPは、z正規化ユークリッド距離の計算において、平均で50%以上の性能向上を達成し、優れた効率性を示している。
  • AAMPおよびACAMPの実行時間は時系列長に線形に比例し、部分列長が長くなるにつれてより効率的になる。mがnに近づくと、O(n)の計算量に近づく。
  • 提案手法は正確性および増分的更新性を維持しており、決定論的な実行時間であり、入力サイズおよび部分列長にのみ依存する。
  • 実験により、純粋ユークリッド距離はz正規化距離では消失する重要な異常(例:図1の位置500付近)を保持できることを示しており、代替距離関数の必要性を裏付けている。
  • AAMPおよびACAMPの性能優位性は、大規模データセットにおいて最も顕著であり、nが増加するにつれて、実行時間の差が広がる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。