[论文解读] anomaly : Detection of Anomalous Structure in Time Series Data
本文介绍了 R 包 'anomaly',用于检测单变量和多变量时间序列中的点异常和集体异常。该包实现了先进的方法,如 CAPA(集体与点异常检测)、PASS(比例自适应段选择)和 BARD(贝叶斯异常区域检测),这些方法通过基于似然的证据融合以及惩罚似然或高阶批评来检测结构变化,在模拟数据和真实世界数据(包括机器温度和基因芯片数据集)上表现出色。
One of the contemporary challenges in anomaly detection is the ability to detect, and differentiate between, both point and collective anomalies within a data sequence or time series. The anomaly package has been developed to provide users with a choice of anomaly detection methods and, in particular, provides an implementation of the recently proposed Collective And Point Anomaly family of anomaly detection algorithms. This article describes the methods implemented whilst also highlighting their application to simulated data as well as real data examples contained in the package.
研究动机与目标
- 解决传统异常检测方法常忽略的点异常和集体异常检测挑战。
- 提供一个统一的 R 软件包,实现近期用于异常检测的统计方法,特别针对数据序列中的结构变化。
- 在存在自相关性以及多变量时间序列中异常在不同分量间错位的情况下,提升检测的鲁棒性。
- 通过 BARD 方法实现贝叶斯推断,提供异常位置和分量参与的后验样本,实现不确定性量化。
- 通过实际数据应用展示实用性,包括机器温度监控和基因组数据,参数调优以适应自相关性。
提出的方法
- 在单变量和多变量时间序列中实现 CAPA(集体与点异常检测),采用惩罚似然方法检测具有异常均值或方差变化的段落。
- 在多变量数据中应用 PASS(比例自适应段选择),通过高阶批评融合各分量的异常证据,检测仅少数分量受影响时的集体异常。
- 使用 BARD(贝叶斯异常区域检测)作为贝叶斯替代方法,通过先验分布建模异常区域,并返回后验样本,实现不确定性量化。
- 通过基于估计自相关系数(rho_hat)的惩罚参数膨胀来调整自相关性,减少依赖数据中的误报。
- 集成预处理步骤,如去趋势和去季节化,以提高非平稳时间序列检测的准确性。
- 提供可视化与汇总函数以解释结果,包括异常起止点检测和各段的检验统计量。
实验结果
研究问题
- RQ1如何通过单一方法有效检测时间序列数据中的点异常和集体异常?
- RQ2在检测集体异常时,CAPA 中的惩罚似然方法与 PASS 中的高阶批评相比,特别是在仅少数分量异常时,表现如何?
- RQ3通过惩罚参数膨胀来考虑自相关性,在真实世界时间序列中在多大程度上能提升检测性能?
- RQ4与频率学方法相比,BARD 的贝叶斯推断能否提供更具可解释性的不确定性量化?
- RQ5这些方法在已知异常的真实世界数据集(如机器温度和基因芯片基因组数据)上的表现如何?
主要发现
- CAPA 在机器温度数据集中成功检测到四个集体异常,其中第二、第三和第四个异常与已知事件高度吻合,而第一个异常可能是假阳性或未被检测到的事件。
- 通过使用估计的自相关系数(rho_hat)调整惩罚参数后,CAPA 减少了误报,表明在自相关数据中具有更高的鲁棒性。
- CAPA 中的检验统计量定义为均值变化与段持续时间的乘积,这解释了为何均值变化较小但持续时间较长的段可能产生更高的检验统计量。
- PASS 和 CAPA 均使用基于似然的各分量证据融合,但 PASS 使用的高阶批评在仅一个或少数几个分量异常时可能损失检验效能。
- BARD 提供异常位置和分量参与的后验样本,提供灵活且具备不确定性感知的输出,支持更深层次的推断。
- 该包的实现支持单变量和多变量异常检测,具备清晰的模型选择、参数调优和结果可视化功能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。