Skip to main content
QUICK REVIEW

[論文レビュー] Proximity Forest 2.0: A new effective and scalable similarity-based classifier for time series

Matthieu Herrmann, Chang Wei Tan|arXiv (Cornell University)|Apr 12, 2023
Time Series Analysis and Forecasting被引用数 4
ひとこと要約

Proximity Forest 2.0 (PF 2.0) は、時間系列の類似度ベース分類器として、3 つの最近の進展を統合した、より高速で高精度な新規手法である。これらは、効率的なエラスティック類似度計算のための早期放棄および pruning、新規の Amerced Dynamic Time Warping (ADTW) 衡量、およびコスト関数チューニングである。UCR ベンチマークにおいて、類似度ベース手法のすべての先行研究を上回り、類似度ベース学習に最も適したデータセット(例:SmoothSubspace)では、最先端のカーネル、ニューラルネットワーク、ハイブリッドモデルをも凌駕する。

ABSTRACT

Time series classification (TSC) is a challenging task due to the diversity of types of feature that may be relevant for different classification tasks, including trends, variance, frequency, magnitude, and various patterns. To address this challenge, several alternative classes of approach have been developed, including similarity-based, features and intervals, shapelets, dictionary, kernel, neural network, and hybrid approaches. While kernel, neural network, and hybrid approaches perform well overall, some specialized approaches are better suited for specific tasks. In this paper, we propose a new similarity-based classifier, Proximity Forest version 2.0 (PF 2.0), which outperforms previous state-of-the-art similarity-based classifiers across the UCR benchmark and outperforms state-of-the-art kernel, neural network, and hybrid methods on specific datasets in the benchmark that are best addressed by similarity-base methods. PF 2.0 incorporates three recent advances in time series similarity measures -- (1) computationally efficient early abandoning and pruning to speedup elastic similarity computations; (2) a new elastic similarity measure, Amerced Dynamic Time Warping (ADTW); and (3) cost function tuning. It rationalizes the set of similarity measures employed, reducing the eight base measures of the original PF to three and using the first derivative transform with all similarity measures, rather than a limited subset. We have implemented both PF 1.0 and PF 2.0 in a single C++ framework, making the PF framework more efficient.

研究の動機と目的

  • 多様な UCR ベンチマークデータセットにおいて、既存手法を上回る効果的でスケーラブルな類似度ベース時間系列分類器を構築すること。
  • 時間系列類似度測定分野における最近の進展(特に早期放棄、ADTW、コスト関数チューニング)を統合した包括的なフレームワークを構築すること。
  • 使用する類似度測定のセットを合理化し、冗長性を低減するとともに一般化性能を向上させるため、ADTW、cDTW、LCSS の 3 つのコア測定のみを選択する。各測定は一次微分変換を適用する。
  • 提案された類似度測定セットが、PF 2.0 に限らず、Elastic Ensemble などの他の類似度ベースモデルの性能向上にも寄与することを示すこと。
  • PF 1.0 と PF 2.0 を統合した高速な C++ フレームワークを実装することで、計算効率を向上させること。

提案手法

  • 時間系列マッチングにおけるロバスト性と精度を向上させる新規のエラスティック類似度測定である Amerced Dynamic Time Warping (ADTW) を導入する。
  • 特に DTW に基づく測定に適した、計算効率の良い早期放棄および pruning 技術を適用し、エラスティック類似度計算の高速化を実現する。
  • DTW に類似した測定にコスト関数チューニングを適用し、歪みペナルティやアラインメントコストなどのパラメータを最適化することで分類性能を向上させる。
  • ADTW、cDTW、LCSS の 3 つのコア類似度測定すべてに一次微分変換を適用し、形状およびトレンドパターンへの感受性を高める。
  • PF 1.0 の 8 つのベース類似度測定から、ADTW、cDTW、LCSS の 3 つに合理化し、重複または効果の薄い測定を排除する。
  • フレームワーク全体を単一の高性能 C++ ライブラリとして実装し、速度を著しく向上させるとともに、PF 1.0 と PF 2.0 の間で公平な計算比較を可能にする。

実験結果

リサーチクエスチョン

  • RQ1時間系列類似度測定分野における最近の進展を統合することで、類似度ベース分類器を著しく高速化・高精度化できるか?
  • RQ2より多くの冗長な測定を使用するのではなく、合理的に簡略化された測定セットを用いることで、一般化性能が向上し、過学習を回避できるか?
  • RQ3コスト関数チューニングおよび早期放棄が、類似度ベース時間系列分類における性能と効率にどの程度の向上効果をもたらすか?
  • RQ4提案された類似度測定セット(ADTW、cDTW、LCSS)は、Proximity Forest を超えて、他の類似度ベースモデルの性能向上にも再利用可能か?
  • RQ5PF 2.0 は、類似度ベース手法の先行研究を上回るだけでなく、類似度ベース手法が最も効果を発揮するデータセットにおいて、最先端のカーネル、ニューラルネットワーク、ハイブリッドモデルをも凌駆できるか?

主な発見

  • SmoothSubspace データセット(類似度ベース手法が優勢なベンチマーク)において、PF 2.0 は他のすべての最先端手法と比べて顕著に低い誤差を達成した。
  • 109 個のデータセットからなる UCR ベンチマーク全体において、PF 2.0 は PF 1.0 や Elastic Ensemble の変種を含む、すべての類似度ベース分類器を上回った。
  • UCR ベンチマークにおいて、PF 2.0 は最も正確かつ高速な類似度ベース TSC アルゴリズムであり、PF 1.0 に対して顕著な性能優位性を示した。
  • コスト関数チューニングの適用により、すべての DTW に類似した測定で性能が向上し、EE+ と PF+ は非チューニング版よりも高い精度を示した。
  • 一次微分変換を施した 3 つの類似度測定(ADTW、cDTW、LCSS)の新セットは、Elastic Ensemble の元の測定に代えて使用することで、速度と精度の両方を向上させた。
  • PF 2.0 の C++ 実装により計算オーバーヘッドが低減され、PF 1.0 との公平かつ効率的な比較が可能となり、以前の Java 実装に比べて顕著な高速化が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。