Skip to main content
QUICK REVIEW

[论文解读] Admissible Time Series Motif Discovery with Missing Data

Yan Zhu, Abdullah Mueen|arXiv (Cornell University)|Feb 15, 2018
Time Series Analysis and Forecasting参考文献 22被引用 4
一句话总结

本文提出了一种可接受的方法,用于在存在缺失数据的数据集中发现时间序列模式,该方法基于目前已知最快的模式发现算法的改进版本。该方法保证不会产生假阴性结果,且时间与空间复杂度仅增加少量常数因子,从而可在具有不同缺失数据率的各种真实世界数据集中高效地检测模式。

ABSTRACT

The discovery of time series motifs has emerged as one of the most useful primitives in time series data mining. Researchers have shown its utility for exploratory data mining, summarization, visualization, segmentation, classification, clustering, and rule discovery. Although there has been more than a decade of extensive research, there is still no technique to allow the discovery of time series motifs in the presence of missing data, despite the well-documented ubiquity of missing data in scientific, industrial, and medical datasets. In this work, we introduce a technique for motif discovery in the presence of missing data. We formally prove that our method is admissible, producing no false negatives. We also show that our method can piggy-back off the fastest known motif discovery method with a small constant factor time/space overhead. We will demonstrate our approach on diverse datasets with varying amounts of missing data

研究动机与目标

  • 为解决科学、医疗和工业数据集中普遍存在的缺失数据背景下时间序列模式发现技术的缺乏问题。
  • 开发一种可接受的方法,确保在不完整的时间序列中检测模式时不会产生假阴性结果。
  • 通过复用目前已知最快的模式发现算法,仅引入少量常数因子的时间与空间复杂度增加,保持高效率。
  • 在具有不同缺失数据率的多样化真实世界数据集上,验证该方法的有效性。

提出的方法

  • 通过使用忽略缺失数据点的改进型z标准化欧几里得距离,将时间序列模式发现中的距离计算概念扩展至处理缺失值。
  • 引入一种下界计算技术,确保不会遗漏任何真实模式,从而保证方法的可接受性。
  • 与Matrix Profile框架无缝集成,可重用其优化的数据结构与索引,实现快速模式发现。
  • 基于下界设计一种剪枝策略,提前剔除无希望的候选子序列,降低计算成本。
  • 该算法的时间复杂度与原始模式发现方法保持相同的渐近时间复杂度,仅因处理缺失数据而引入少量常数因子的开销。
  • 支持单变量与多变量时间序列,适用于广泛的真实世界应用场景。

实验结果

研究问题

  • RQ1在存在缺失数据的情况下,能否可靠地进行时间序列模式发现,且不引入假阴性结果?
  • RQ2将现有快速模式发现算法适配以处理缺失数据,所需的最小计算开销是多少?
  • RQ3该方法在具有不同缺失数据率的数据集上如何扩展?
  • RQ4该方法能否高效地与现有的高性能模式发现流水线(如Matrix Profile)集成?
  • RQ5该方法在具有多样化缺失数据模式的真实世界数据集上是否保持准确性和效率?

主要发现

  • 所提出的方法在理论上是可接受的,可确保在存在缺失数据的情况下不会遗漏任何真实模式。
  • 与目前已知最快的模式发现算法相比,该方法仅在时间和空间复杂度上引入少量常数因子的增加。
  • 实验评估表明,该方法在不同缺失数据率的数据集中均保持了高效率与可扩展性。
  • 该方法成功在存在缺失值的真实世界数据集(如ECG、传感器和环境时间序列)中发现了有意义的模式。
  • 与Matrix Profile框架的集成使该方法能够扩展至长时间序列,同时保持性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。