Skip to main content
QUICK REVIEW

[论文解读] An empirical evaluation of alternative methods of estimation for Permutation Entropy in time series with tied values

Francisco Traversaro, Marcelo Risk|arXiv (Cornell University)|May 31, 2017
Heart Rate Variability and Autonomic Control被引用 4
一句话总结

本文提出了一种新颖的贝叶斯缺失数据填补方法,用于在存在重复值的时间序列中估计排列熵,其性能优于现有的随机填补、完整案例法和时间有序填补方法。通过将重复模式视为缺失数据,并利用基于时间序列结构的先验概率,该贝叶斯方法能够保留动力学模式,并显著降低偏差和均方误差,尤其在频繁出现重复值的心率变异性(HRV)数据中表现优异。

ABSTRACT

Bandt and Pompe introduced Permutation Entropy in 2002 for Time Series where equal values, xt1 = xt2, t1 = t2, were neglected and only inequalities between the xt were considered. Since then, this measure has been modified and extended, in particular in cases when the amount of equal values in the series can not be neglected, (i.e. heart rate variability (HRV) time series). We review the different existing methodologies that treats this subject by classifying them according to their different strategies. In addition, a novel Bayesian Missing Data Imputation is presented that proves to outperform the existing methodologies that deals with type of time series. All this facts are illustrated by simulations and also by distinguishing patients suffering from Congestive Heart Failure from a (healthy) control group using HRV time series

研究动机与目标

  • 为解决Bandt和Pompe原始排列熵方法的局限性,该方法假设数据为连续型,忽略了重复值的影响。
  • 评估并比较现有处理排列熵估计中重复值的方法,包括完整案例法、随机填补和时间有序填补。
  • 提出并验证一种新颖的贝叶斯缺失数据填补方法,将重复模式视为缺失数据,并利用先验概率分配符号。
  • 通过模拟实验和使用HRV时间序列对充血性心力衰竭患者的真实分类,证明该方法的优越性。
  • 表明扩展符号字母表或使用随机噪声无法保留动力学结构,反而导致熵估计产生偏差。

提出的方法

  • 该贝叶斯填补方法将重复模式视为缺失数据,并基于时间序列完整案例中有效排列的频率,利用先验概率分配符号。
  • 以非重复模式的经验分布(即完整案例估计器)作为先验,确定将特定排列分配给重复模式的概率。
  • 对于每个重复模式,方法从与观测值结构一致的可能排列集合中进行抽样,权重为其在非重复数据中的相对频率。
  • 该方法不施加固定的破缺规则来处理重复值,从而避免人为排序,与时间有序填补方法不同,因此能更好地保留真实动力学结构。
  • 通过计算非重复模式中每种排列的相对频率,并将其用作权重,在概率分配中处理重复模式,实现该方法的实现。
  • 该方法与替代策略(如扩展符号字母表,例如Bian等,2012)和随机填补进行对比,后者被证明会扭曲模式结构。

实验结果

研究问题

  • RQ1在偏差和均方误差(MSE)方面,不同处理排列熵估计中重复值的方法表现如何比较?
  • RQ2一种将重复模式视为缺失数据的贝叶斯填补方法,是否能优于现有方法,更好地保留时间序列的真实动力学结构?
  • RQ3扩展符号字母表(例如使用秩扩展或时间顺序扩展字母表)是否能提高熵估计的准确性,还是反而会扭曲底层动力学?
  • RQ4随机填补在排列熵估计中产生何种影响,特别是在高估熵值和掩盖禁止模式方面?
  • RQ5在重复值频繁出现的情况下,该贝叶斯填补方法能否可靠地区分健康个体与充血性心力衰竭患者,基于HRV时间序列?

主要发现

  • 贝叶斯缺失数据填补方法在各种模拟场景下,显著优于其他所有方法,在最小化偏差和均方误差(MSE)方面表现突出。
  • 随机填补会高估排列熵,并通过人为引入禁止模式而掩盖其真实存在,导致动力学推断不准确。
  • 当重复模式数量相对于时间序列长度较小时,完整案例法仍为良好估计器;但当重复模式较多时,该方法会引入非恒定偏差。
  • 扩展符号字母表(如使用秩扩展或时间顺序扩展字母表)无法保留不同模式之间的结构差异,因为多个不同模式被映射到同一符号。
  • 贝叶斯方法成功保留了时间序列的真实动力学结构,这一点通过其在使用HRV数据对充血性心力衰竭患者与健康对照组分类中的优越表现得到验证。
  • 在真实HRV数据中,贝叶斯填补方法的分类准确率高于其他方法,证实了其鲁棒性和实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。