Skip to main content
QUICK REVIEW

[论文解读] A Revealing Large-Scale Evaluation of Unsupervised Anomaly Detection Algorithms

Maxime Alvarez, Jean-Charles Verdier|arXiv (Cornell University)|Apr 21, 2022
Anomaly Detection Techniques and Applications被引用 7
一句话总结

本文提出了一套标准化、可复现的无监督异常检测算法评估协议,将其应用于五个表格数据集上的12种方法。研究发现,以往的评估存在不一致,原因在于数据划分、评估指标和超参数选择的差异。研究发现,在CSE-CIC-IDS2018等具有挑战性的数据集上,更简单的模型如DAE表现优于更复杂的模型,而DROCC和DeepSVDD则因数据分布和类别不平衡问题表现不佳。

ABSTRACT

Anomaly detection has many applications ranging from bank-fraud detection and cyber-threat detection to equipment maintenance and health monitoring. However, choosing a suitable algorithm for a given application remains a challenging design decision, often informed by the literature on anomaly detection algorithms. We extensively reviewed twelve of the most popular unsupervised anomaly detection methods. We observed that, so far, they have been compared using inconsistent protocols - the choice of the class of interest or the positive class, the split of training and test data, and the choice of hyperparameters - leading to ambiguous evaluations. This observation led us to define a coherent evaluation protocol which we then used to produce an updated and more precise picture of the relative performance of the twelve methods on five widely used tabular datasets. While our evaluation cannot pinpoint a method that outperforms all the others on all datasets, it identifies those that stand out and revise misconceived knowledge about their relative performances.

研究动机与目标

  • 识别并解决以往无监督异常检测研究中评估协议不一致的问题。
  • 建立一个公平、可复现的基准,用于比较12种流行的无监督异常检测算法。
  • 通过一致的数据划分、评估指标和超参数调优,重新评估这些方法的相对性能。
  • 挑战关于算法性能的误解,特别是关于深度学习和重建型模型的看法。
  • 通过统一的评估协议,促进未来机器学习评估的透明度和可靠性。

提出的方法

  • 提出了一套一致的评估协议,仅在正常数据上进行训练,并在测试集中使用全部异常样本,以消除数据泄露和偏差。
  • 将所有模型的阈值选择标准化为最优F1-score阈值,确保公平比较。
  • 以精确率、召回率、F1-score和AUPR为主要指标,主张在类别不平衡情况下优先使用AUPR而非AUROC。
  • 在所有模型中采用相同的超参数搜索策略和随机种子,以确保可复现性和公平性。
  • 采用五个广泛使用的表格数据集:KDDCUP、NSL-KDD、CSE-CIC-IDS2018、Arrhythmia和Thyroid进行评估。
  • 将正类固定为少数类(异常类),以避免性能解释出现偏差。

实验结果

研究问题

  • RQ1以往研究中不一致的评估协议如何影响无监督异常检测算法的报告性能?
  • RQ2在多样化表格数据集上,采用标准化、公平的评估协议时,哪些无监督异常检测方法表现最佳?
  • RQ3为何一些复杂模型如DROCC和DeepSVDD在真实世界、具有挑战性的数据集上表现不如更简单的基线模型如DAE?
  • RQ4AUROC和AUPR在性能评估中有多大差异?哪种指标在异常检测任务中更具信息量?
  • RQ5一致的评估协议能否揭示以往被忽视的成熟异常检测方法的优势或缺陷?

主要发现

  • 原始自编码器(DAE)在CSE-CIC-IDS2018数据集上优于更复杂的重建型模型如DAGMM和MemAE,尽管结构简单,但仍取得了更高的F1-score。
  • DROCC在CSE-CIC-IDS2018上报告了高召回率(0.996)但低精确率(0.296),表明存在较高的假阳性率,而这一问题在仅报告F1-score时被掩盖。
  • AUPR指标在CSE-CIC-IDS2018上的表现相比AUROC显著下降(超过10%),凸显了AUROC在类别不平衡异常检测场景下的过度乐观倾向。
  • KDD和NSL-KDD被发现是过于简单的数据集,大多数模型的F1-score超过0.90,因此不足以区分模型性能差异。
  • NeuTraLAD作为一种基于变换的方法,在所有数据集上均表现出稳定且高于平均水平的性能,尤其在小样本数据上通过数据增强获得了显著收益。
  • DeepSVDD及其他一类分类模型在CSE-CIC-IDS2018上表现欠佳,原因在于类内变化大且数据规模大,表明其在复杂分布下的泛化能力存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。