Skip to main content
QUICK REVIEW

[论文解读] Is it worth it? Comparing six deep and classical methods for unsupervised anomaly detection in time series

Ferdinand Rewicki, Joachim Denzler|arXiv (Cornell University)|Dec 21, 2022
Anomaly Detection Techniques and Applications被引用 6
一句话总结

本研究在UCR异常数据集上对比了六种无监督异常检测方法——三种经典方法(RRCF、MDI、MERLIN)和三种深度学习方法(AE、GANF、TranAD)。结果表明,经典方法,尤其是MDI和MERLIN,在多种异常类型下表现优于深度学习模型,挑战了‘模型越深性能越好’的假设,尽管其可解释性较低。

ABSTRACT

Detecting anomalies in time series data is important in a variety of fields, including system monitoring, healthcare, and cybersecurity. While the abundance of available methods makes it difficult to choose the most appropriate method for a given application, each method has its strengths in detecting certain types of anomalies. In this study, we compare six unsupervised anomaly detection methods of varying complexity to determine whether more complex methods generally perform better and if certain methods are better suited to certain types of anomalies. We evaluated the methods using the UCR anomaly archive, a recent benchmark dataset for anomaly detection. We analyzed the results on a dataset and anomaly type level after adjusting the necessary hyperparameters for each method. Additionally, we assessed the ability of each method to incorporate prior knowledge about anomalies and examined the differences between point-wise and sequence-wise features. Our experiments show that classical machine learning methods generally outperform deep learning methods across a range of anomaly types.

研究动机与目标

  • 评估在无监督时间序列异常检测中,深度学习模型因复杂度增加而带来的可解释性降低是否值得。
  • 在缺乏通用方法的前提下,识别最适合特定类型异常的异常检测方法。
  • 评估特征表示方式(点级 vs. 子序列级)以及超参数调优对方法性能的影响。
  • 通过为16种不同的异常类型添加标注,提升UCR异常数据集的细粒度基准测试能力。
  • 在标准化实验条件下,通过超参数调优与统一评估协议,提供公平且全面的对比。

提出的方法

  • 本研究评估了六种最先进的无监督异常检测方法:RRCF(基于孤立森林)、MDI(最大差异区间)、MERLIN(基于密度)、AE(自编码器)、GANF(图增强归一化流)、TranAD(基于Transformer)。
  • 所有方法均在UCR异常数据集上进行评估,该数据集是来自医学、工业、生物学和气象学四个领域的250个单变量时间序列的基准数据集。
  • 作者使用贝叶斯优化对GANF及其他方法进行了广泛的超参数调优,仅在无先前调优数据时使用默认值。
  • 异常检测性能通过F1分数和UCR分数进行衡量,结果在数据集层面及16种标注异常类型上进行分析。
  • 研究比较了RRCF的点级特征(如原始数据点)与子序列级特征(如滑动窗口)的性能,并评估了MDI与MERLIN对子序列长度的敏感性。
  • UCR异常数据集通过增加16种不同的异常类型标注得到扩展,以支持对不同异常模式下方法性能的细粒度分析。

实验结果

研究问题

  • RQ1在无监督时间序列异常检测中,深度学习方法的优越性能是否足以弥补其相比经典机器学习方法可解释性降低的代价?
  • RQ2哪些方法能够检测哪些类型的异常?特征表示方式(点级 vs. 子序列级)如何影响检测能力?
  • RQ3超参数调优与模型复杂度如何影响经典方法与深度学习方法的性能?
  • RQ4基于子序列的方法能否同时检测‘陡增’与‘平滑增加’异常?基于点级特征的方法在检测行为上与之有何不同?
  • RQ5哪些方法在多种异常类型下表现最稳健?哪些异常类型始终被所有模型漏检?

主要发现

  • 经典方法MDI与MERLIN在多数异常类型与数据集上优于所有深度学习方法,MDI在整体F1与UCR分数上均取得最高值。
  • 在深度学习模型中,GANF表现最佳,其在使用默认超参数时UCR分数下降19%,凸显了超参数选择的敏感性。
  • RRCF在原始点级特征上表现较差,但使用子序列级统计特征后性能显著提升,表明特征工程可弥补模型简单性。
  • AE在深度学习模型中检测到的异常最多,但其性能仍低于MDI与MERLIN,且对超参数选择敏感。
  • 所有基于子序列的方法均可检测‘陡增’异常,但无法检测‘平滑增加’异常,而基于点级特征的方法则表现出相反行为,表明其检测机制存在根本差异。
  • ‘异常模式’、‘时间偏移’、‘反转’与‘平坦’四类异常始终被全部六种模型漏检,表明当前方法在处理复杂或细微时间偏差方面仍存在能力缺口。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。