Skip to main content
QUICK REVIEW

[論文レビュー] Clustering functional data using wavelets

Anestis Antoniadis, Xavier Brossat|Jan 25, 2011
Time Series Analysis and Forecasting被引用数 12
ひとこと要約

本稿では、局所的パターンを検出するとともに類似曲線をグループ化するため、多スケール解析を活用した2つのウェーブレットベースのクラスタリング手法を提案する。1つ目の手法はk-meansクラスタリングを用いたウェーブレットエネルギー特徴に基づくものであり、2つ目の手法はk-centroidsを用いたウェーブレットコherエンスによる非類似度に基づくものである。両手法とも、フランスの電力需要データにおいて、標準的なL2ベースのクラスタリングを上回り、レアな休日パターンを含む微細な形状ベースのクラスタを明らかにした。

ABSTRACT

We present two methods for detecting patterns and clusters in high dimensional time-dependent functional data. Our methods are based on wavelet-based similarity measures, since wavelets are well suited for identifying highly discriminant local time and scale features. The multiresolution aspect of the wavelet transform provides a time-scale decomposition of the signals allowing to visualize and to cluster the functional data into homogeneous groups. For each input function, through its empirical orthogonal wavelet transform the first method uses the distribution of energy across scales generate a handy number of features that can be sufficient to still make the signals well distinguishable. Our new similarity measure combined with an efficient feature selection technique in the wavelet domain is then used within more or less classical clustering algorithms to effectively differentiate among high dimensional populations. The second method uses dissimilarity measures between the whole time-scale representations and are based on wavelet-coherence tools. The clustering is then performed using a k-centroid algorithm starting from these dissimilarities. Practical performance of these methods that jointly designs both the feature selection in the wavelet domain and the classification distance is demonstrated through simulations as well as daily profiles of the French electricity power demand.

研究の動機と目的

  • 非定常な関数的時系列のクラスタリングという課題に取り組むこと。特に、標準的手法が形状ベースのパターンを捉えきれない電力需要予測分野において有効であることを目的とする。
  • 局所的な時間スケール特徴を保持するクラスタリングフレームワークを構築し、関数的データにおける明確な行動パターンを同定することを目的とする。
  • 平均レベルでのみ曲線をグループ化する従来のL2ベースのクラスタリングを改善し、形状の違いを無視する問題を是正することを目的とする。
  • ウェーブレットドメインにおける特徴選択を統合することで、解釈可能で適応性のあるクラスタリングを実現し、モデルの性能向上と洞察の獲得を目的とする。

提案手法

  • 1番目の手法は、スケールごとのエネルギー分布を抽出するために離散ウェーブレット変換(DWT)を適用し、局所的特徴を保持したまま次元削減を実現する。
  • ウェーブレットドメインにおける特徴選択技術を用い、情報量の多い係数のみを保持した後、古典的なk-meansクラスタリングを適用する。
  • 2番目の手法は、曲線の完全な時間-スケール表現間のウェーブレットコherエンスに基づく非類似度を計算し、位相および振幅の関係を捉える。
  • これらの非類似度測定値を用いてk-centroidsアルゴリズムを適用し、ウェーブレットドメインにおける構造的類似性に基づくクラスタ形成を実現する。
  • ウェーブレット変換により多スケール分解が可能となり、時間的・スケール的側面で局所的特徴を検出できる。
  • 両手法は、実際の1日分の電力需要曲線を用いて検証され、調整ランダム係数とカレンダー基準ラベルを用いて結果を比較した。

実験結果

リサーチクエスチョン

  • RQ1標準的なL2ベースのベクトルクラスタリングと比較して、ウェーブレットベースの特徴抽出は、高次元関数的データにおけるクラスタリング性能を向上させるか?
  • RQ2ウェーブレットコherエンスによる非類似度は、関数的時系列における形状ベースの類似性をどれほど効果的に捉えられるか?
  • RQ3提案手法は、従来のクラスタリングで見逃されがちなレアなパターン(特定の休日や天候影響を受ける日など)を検出できるか?
  • RQ4ウェーブレットドメインにおける特徴選択は、クラスタリングの解釈可能性と正確性をどの程度向上させるか?
  • RQ5調整ランダム係数および実用的解釈可能性の観点から、ウェーブレットベースのクラスタリング結果は、古典的手法と比較してどの程度優れているか?

主な発見

  • ウェーブレットベースの特徴抽出手法は、ACクラスタリング手法と比較して調整ランダム係数0.26を達成し、標準的手法とは顕著な乖離を示した。
  • ウェーブレットコherエンス非類似度手法は、ACと比較してより高い調整ランダム係数0.32を達成し、意味のあるグループ化と良好な整合性を示した。
  • WERとMCAクラスタリング結果間の調整ランダム係数は0.57であり、2つの提案手法間に顕著な一貫性があることを示した。
  • WERベースの手法は、2つの明確な「特別日」クラスタを同定した。1つはクリスマスと元日(2日間)のみを含むクラスタであり、もう1つは冬の土曜日と時計のずれの日を含むクラスタであった。
  • MCAベースの手法は、より広範な特別日を検出できた。新年の前夜、クリスマスイブ、寒い週末日を含み、クラスタGには19件の観測値が含まれていた。
  • 本研究では、ウェーブレットベースのクラスタリングが、単なる平均レベルの違いではなく、形状ベースのパターンを捉えることで、従来のL2ベースのクラスタリングを上回ることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。