[论文解读] Autocorrelation type functions for big and dirty data series
本文引入了序数自相关函数——具体为 $\tilde{\tau}(d)$、$\tilde{\beta}(d)$、$\tilde{\rho}(d)$ 和 $\tilde{\tau}$——作为分析大规模、噪声大且不规则时间序列的稳健工具,无需预处理。通过关注等级顺序模式而非原始数值,这些函数能够在多样化数据(如呼吸信号、潮汐、脑电图、激光信号)中检测节律结构、状态转换和周期性,即使在高分辨率和存在缺失数据的情况下也有效,为经典自相关函数和频谱图提供了一种无需校准的替代方案。
One form of big data are signals - time series of consecutive values. In physical experiments, billions of values can now be measured within a second. Signals of heart and brain in intensive care, as well as seismic waves, are measured with 100 up to 1000 Hz over hours, days or even years. A song of 3 minutes on CD comprises 16 million values. Music and seismic vibrations basically consist of harmonic oscillations for which classical tools like autocorrelation and spectrogram work well. This note presents similar tools for all kinds of rhythmic processes, with non-linear distortion, artefacts, and outliers. Permutation entropy has been used in physics, medicine, and engineering. Big data allow a detailed analysis of ordinal patterns. As new version of permutation entropy, we define a distance to white noise consisting of four curious components. Applications to a variety of data are discussed.
研究动机与目标
- 开发适用于分析大规模、杂乱时间序列的稳健工具,这些时间序列存在非线性失真、异常值和缺失数据,且无需预处理。
- 通过引入基于序数模式的与白噪声偏离程度的度量,扩展排列熵,以适用于大数据。
- 证明序数统计量能够揭示现实世界信号中隐藏的节律和结构模式,而经典方法无法识别。
- 倡导在传感器设计中保留高分辨率数据,认为预处理会丢失关键信息。
- 提供一种基于序数自相关特征的时序数据分类与区分框架。
提出的方法
- 定义上下平衡度 $\beta(d) = p_{12}(d) - p_{21}(d)$,其中 $p_{12}(d)$ 表示 $x_t < x_{t+d}$ 的相对频率,仅基于数值之间的等级顺序关系。
- 引入 $\tilde{\tau}(d)$,一种基于序数模式的‘椭圆对称性’归一化度量,用于检测时间序列中的周期性和结构变化。
- 采用固定长度的滑动窗口计算 $\beta(d)$、$\tilde{\tau}(d)$ 及相关函数,将结果可视化为类似频谱图的映射,以检测状态转换。
- 利用 $\Delta^2$ 的划分(偏离白噪声的度量)来评估序数模式的显著性,并估计误差边界。
- 将该方法应用于多样化数据集:24小时呼吸信号、潮汐水位、每小时PM10与温度数据,以及超快激光信号。
- 通过与经典自相关函数和频谱图对比验证该方法,结果表明其在检测多尺度周期性和细微节律方面表现更优。
实验结果
研究问题
- RQ1序数自相关函数是否能在经典方法失效的大规模、噪声大且未经清理的时间序列中检测到周期性和节律结构?
- RQ2$\tilde{\tau}(d)$、$\tilde{\beta}(d)$ 及相关函数与经典自相关函数和频谱图相比,在揭示隐藏模式方面表现如何?
- RQ3这些函数在无需数据预处理的情况下,能在多大程度上检测到生理状态(如睡眠阶段)或环境状态之间的转换?
- RQ4这些函数的统计可靠性如何?不同窗口长度和延迟下的误差边界如何估计?
- RQ5与传统降采样分析相比,是否能更有效地利用高分辨率数据进行序数统计分析?
主要发现
- 函数 $\tilde{\tau}(d)$ 在无需预处理的情况下成功揭示了24小时呼吸数据中的睡眠阶段、小睡和呼吸节律,检测到睡眠中4秒周期及日常生活中更短的周期。
- 在潮汐数据中,$\tilde{\beta}(d)$ 的特征在18年中保持稳定,并能唯一表征每个沿海站点,其中 $\beta(12.5) = 0$ 表明存在25小时周期,证实了周期性。
- 在圣贝纳迪诺PM10数据中,仅在夏季出现的每日节律通过 $\tilde{\beta}(d)$ 和 $\tilde{\tau}(d)$ 检测到,尽管在原始数据和经典自相关函数中均不可见。
- 对于超快激光数据,$\tilde{\tau}(d)$ 在半波长处($d=L/2$)以高可靠性检测到真实周期 $L=1544$,优于 $\rho(d)$ 和经典自相关函数。
- 估计 $\tilde{\tau}$ 的平均误差为0.54%,且96%的 $\Delta^2$ 值较小,表明大多数数据窗口中序数模式具有一致性。
- 仅2%的数据点满足 $\Delta^2 < 15/n$,而在这些点中 $\tilde{\tau}$ 的平均值为76%,表明高质量数据子集中信号一致性极强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。