Skip to main content
QUICK REVIEW

[论文解读] Data Smashing 2.0: Sequence Likelihood (SL) Divergence For Fast Time Series Comparison

Yi Huang, Ishanu Chattopadhyay|arXiv (Cornell University)|Sep 26, 2019
Time Series Analysis and Forecasting参考文献 11被引用 4
一句话总结

本文提出Smash2.0,一种基于概率有限状态自动机(PFSA)推导出的序列似然(SL)散度的通用、快速且无需特征工程的时间序列比较度量。该方法通过测量其底层随机生成器之间的差异,实现了对时间序列模型级相似性的高效估计,在合成数据及真实世界EEG和步态数据上,其速度和区分准确率显著优于动态时间规整(DTW)和原始Data Smashing方法。

ABSTRACT

Recognizing subtle historical patterns is central to modeling and forecasting problems in time series analysis. Here we introduce and develop a new approach to quantify deviations in the underlying hidden generators of observed data streams, resulting in a new efficiently computable universal metric for time series. The proposed metric is in the sense that we can compare and contrast data streams regardless of where and how they are generated and without any feature engineering step. The approach proposed in this paper is conceptually distinct from our previous work on data smashing, and vastly improves discrimination performance and computing speed. The core idea here is the generalization of the notion of KL divergence often used to compare probability distributions to a notion of divergence in time series. We call this the sequence likelihood (SL) divergence, which may be used to measure deviations within a well-defined class of discrete-valued stochastic processes. We devise efficient estimators of SL divergence from finite sample paths and subsequently formulate a universal metric useful for computing distance between time series produced by hidden stochastic generators.

研究动机与目标

  • 开发一种无需领域特定特征工程的通用、计算高效的度量方法,用于时间序列比较。
  • 解决现有方法在区分由同一随机过程生成但点对点相似度较低的时间序列方面的局限性。
  • 通过一种新的散度度量——序列似然(SL)散度,将KL散度推广至随机过程,实现模型级比较。
  • 通过估计其底层生成过程的相似性,实现对来自不同来源(如EEG和步态数据)的时间序列的鲁棒分类与聚类。
  • 提供一种可扩展的时间序列分析框架,通过量化和PFSA推理,直接在原始数据流上操作。

提出的方法

  • 该方法使用概率有限状态自动机(PFSA)将时间序列建模为离散值随机过程的实现,能够表示非马尔可夫动态。
  • 定义序列似然(SL)散度作为KL散度在随机过程上的推广,量化其生成模型之间的偏差。
  • 通过有限样本路径的对数似然收敛性高效估计SL散度,避免了昂贵的降维处理。
  • 应用量化方案将连续时间序列数据映射到适合PFSA建模的有限字母表。
  • 使用GenESeSS推理算法从观测序列中学习PFSA模型,从而以闭式表达计算熵率和KL散度。
  • 最终度量Smash2.0基于SL散度计算时间序列之间的成对距离,形成用于下游任务的通用距离矩阵。

实验结果

研究问题

  • RQ1能否开发一种无需特征工程或领域知识的通用度量方法来比较时间序列?
  • RQ2如何将KL散度推广至随机过程,以测量模型级差异而非样本路径相似性?
  • RQ3能否从有限长度的时间序列高效估计SL散度,以实现快速准确的时间序列比较?
  • RQ4与DTW和原始Data Smashing等成熟方法相比,新度量在速度和区分准确率方面的表现如何?
  • RQ5该方法能否有效识别复杂真实世界时间序列中的细微差异,例如静息与(想象)运动状态下的EEG模式,或个体间步态模式的差异?

主要发现

  • Smash2.0在合成时间序列上的区分准确率显著优于原始Data Smashing和动态时间规整(DTW),且计算效率大幅提升。
  • 在EEG数据上,Smash2.0成功区分了S004受试者在静息与(想象)运动状态下的脑状态差异,其通道21的相关系数r(D)为.572,而在S001受试者中差异极小,与临床预期一致。
  • 在步态识别中,该方法识别出个体间不同的运动模式:在z方向上,前两位参与者的距离矩阵显示明显区分,相关系数r(D) = .340,支持可靠的用户识别。
  • 该方法在使用多通道加速度计数据进行用户识别时表现优异,通过结合各向测量与通道特定的量化方案,分类准确率超越单通道方法。
  • PFSA的使用支持熵率和KL散度的闭式计算,从而实现从有限样本路径中快速稳定地估计SL散度。
  • 该框架在多种数据类型上表现出鲁棒性,包括非均匀采样和非平稳时间序列,因其建模的是底层随机生成器而非原始信号特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。