Skip to main content
QUICK REVIEW

[論文レビュー] Admissible Time Series Motif Discovery with Missing Data

Yan Zhu, Abdullah Mueen|arXiv (Cornell University)|Feb 15, 2018
Time Series Analysis and Forecasting参考文献 22被引用数 4
ひとこと要約

本稿では、最も高速なモチーフ発見アルゴリズムの変更版を活用して、欠損データを含むデータセットにおける時系列モチーフの発見に適した手法を提案する。この手法は偽陰性を発生させず、時間的・空間的コストの増加が非常に小さく抑えられ、さまざまな欠損データ率を示す現実世界のデータセットにおいても効率的なモチーフ検出を可能にする。

ABSTRACT

The discovery of time series motifs has emerged as one of the most useful primitives in time series data mining. Researchers have shown its utility for exploratory data mining, summarization, visualization, segmentation, classification, clustering, and rule discovery. Although there has been more than a decade of extensive research, there is still no technique to allow the discovery of time series motifs in the presence of missing data, despite the well-documented ubiquity of missing data in scientific, industrial, and medical datasets. In this work, we introduce a technique for motif discovery in the presence of missing data. We formally prove that our method is admissible, producing no false negatives. We also show that our method can piggy-back off the fastest known motif discovery method with a small constant factor time/space overhead. We will demonstrate our approach on diverse datasets with varying amounts of missing data

研究の動機と目的

  • 科学的・医療的・産業的データセットにおいて一般的に見られる欠損データを伴う時系列モチーフ発見のための手法の欠如に応えること。
  • 不完全な時系列においてモチーフを検出する際に、偽陰性を発生させない「適正性(admissibility)」を保証する手法を開発すること。
  • 最も高速に知られているモチーフ発見アルゴリズムに準拠し、時間的・空間的計算量の増加が定数倍にとどまるように、高い効率性を維持すること。
  • 異なる欠損データ率を示す多様な現実世界のデータセットにおいて、本手法の有効性を示すこと。

提案手法

  • 時系列モチーフ発見における距離計算の概念を拡張し、欠損値を含むデータに対応するため、欠損データポイントを比較時に無視する修正されたz正規化ユークリッド距離を用いる。
  • 真のモチーフが見逃されないことを保証するための下界計算技術を導入し、適正性を確保する。
  • マトリックスプロファイルフレームワークとシームレスに統合可能であり、最適化されたデータ構造とインデックスを再利用することで、高速なモチーフ発見を実現する。
  • 下界に基づくプルーニング戦略を採用し、有望でない候補サブシーケンスを早期に除外することで、計算コストを削減する。
  • 元のモチーフ発見アルゴリズムと同等の漸近的時間計算量を維持しており、欠損データ処理に起因するわずかな定数倍のオーバーヘッドのみが発生する。
  • 単変量および多変量時系列の両方をサポートしており、幅広い現実世界の応用に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1欠損データを伴う状況下でも、偽陰性を発生させることなく、信頼性高く時系列モチーフ発見が行えるか?
  • RQ2既存の高速モチーフ発見アルゴリズムを欠損データに対応させるために、最小限の計算コストオーバーヘッドが必要か?
  • RQ3本手法は、欠損データ率が異なるデータセットに対してもスケーリング可能か?
  • RQ4マトリックスプロファイルのような既存の高性能モチーフ発見パイプラインと、効率的に統合可能か?
  • RQ5多様な欠損データパターンを示す現実世界のデータセットにおいて、本手法は正確性と効率性を維持できるか?

主な発見

  • 提案手法は、証明可能な適正性を有しており、欠損データが存在する中でも真のモチーフが見逃されないことが保証される。
  • 最も高速に知られているモチーフ発見アルゴリズムと比較して、時間的・空間的計算量の増加がわずかに定数倍にとどまる。
  • 実験的評価により、欠損データ率が異なるデータセットにおいても、本手法は高い効率性とスケーラビリティを維持していることが示された。
  • 本手法は、心電図(ECG)、センサー、環境時系列データなど、欠損値を含む現実世界のデータセットにおいて、意味のあるモチーフを効果的に発見できた。
  • マトリックスプロファイルフレームワークとの統合により、長大な時系列データに対してもスケーラブルでありながら、パフォーマンスを損なわないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。