Skip to main content
QUICK REVIEW

[论文解读] ADBench: Anomaly Detection Benchmark

Songqiao Han, Xiyang Hu|arXiv (Cornell University)|Jun 19, 2022
Anomaly Detection Techniques and Applications被引用 15
一句话总结

ADBench 是一个全面的异常检测基准,评估了 30 种算法在 57 个数据集上的表现,涵盖不同监督水平、异常类型和数据损坏情况。结果表明,仅使用 1% 标注异常的半监督方法优于表现最佳的无监督方法,且算法选择在很大程度上取决于数据特征和先验知识。

ABSTRACT

Given a long list of anomaly detection algorithms developed in the last few decades, how do they perform with regard to (i) varying levels of supervision, (ii) different types of anomalies, and (iii) noisy and corrupted data? In this work, we answer these key questions by conducting (to our best knowledge) the most comprehensive anomaly detection benchmark with 30 algorithms on 57 benchmark datasets, named ADBench. Our extensive experiments (98,436 in total) identify meaningful insights into the role of supervision and anomaly types, and unlock future directions for researchers in algorithm selection and design. With ADBench, researchers can easily conduct comprehensive and fair evaluations for newly proposed methods on the datasets (including our contributed ones from natural language and computer vision domains) against the existing baselines. To foster accessibility and reproducibility, we fully open-source ADBench and the corresponding results.

研究动机与目标

  • 为解决当前异常检测领域缺乏全面、公平且可复现的评估基准的问题,这些基准需覆盖多样化的监督水平、异常类型和数据损坏场景。
  • 为研究人员提供一个统一、可访问且开源的平台,以便公平地将新型异常检测方法与现有基线进行比较。
  • 基于监督可用性、异常类型和对数据损坏的鲁棒性,揭示关键的算法性能洞察。
  • 通过在 BSD-2 许可证下完全开源基准和结果,推动异常检测研究的可复现性和可及性。
  • 通过实证分析监督、异常特征和数据质量对模型性能的影响,为未来算法设计提供指导。

提出的方法

  • 该基准评估了 30 种异常检测算法——14 种无监督、7 种半监督和 9 种有监督——在 57 个数据集上的表现,其中包括 47 个公开数据集和 10 个来自自然语言处理与计算机视觉领域的全新贡献数据集。
  • 实验从三个核心评估角度展开:(1) 不同的监督水平(无监督、半监督、有监督),(2) 四类模拟异常(局部异常、全局异常、对抗性异常和概念漂移),以及 (3) 三种数据损坏设置(标签噪声、无关特征和特征损坏)。
  • 性能通过标准指标(如 AUC-ROC)进行衡量,并使用非参数检验验证统计显著性,以确保可靠的比较。
  • 基准采用标准化流程,确保公平性和可复现性,包括一致的数据划分、超参数调优和评估协议。
  • 结果被系统性地聚合与可视化,按数据集和算法报告模型排名,支持方法间的直接比较。
  • 整个基准(包括代码、数据集和结果)已通过 GitHub 以 BSD-2 许可证发布,供社区使用和扩展。

实验结果

研究问题

  • RQ1在不同监督水平(无监督、半监督、有监督)下,异常检测算法的表现如何?即使仅提供极少标注,其影响是什么?
  • RQ2异常类型(如局部异常与全局异常)如何影响不同检测算法的性能?
  • RQ3异常检测算法对数据损坏(如标签噪声和无关特征)的鲁棒性如何?哪些方法表现出最强的稳定性?
  • RQ4是否存在某些算法族在受控条件下始终优于其他方法?它们在何种数据特征下表现最佳?
  • RQ5在现实世界中存在噪声的设置下,半监督方法是否能实现比完全有监督或无监督方法更好的鲁棒性和性能?

主要发现

  • 在评估的 14 种无监督异常检测算法中,没有一种在统计上显著优于其他算法,凸显了根据数据背景选择算法的关键性。
  • 仅使用 1% 的标注异常,大多数半监督方法的表现优于表现最佳的无监督方法,表明即使是最小程度的监督也能显著提升检测性能。
  • 在受控环境中,针对特定异常类型(如局部异常)表现最佳的无监督方法,其性能优于半监督和有监督方法,表明算法选择必须与数据特征和异常模式相匹配。
  • 半监督方法在数据损坏下表现出强大的鲁棒性,可能归因于其对标签和特征选择的高效利用,表明其在真实场景部署中具有潜力。
  • 该基准揭示,性能在不同数据集和异常类型之间存在显著差异,且没有任何单一算法在所有设置中均占主导地位。
  • 开源的 ADBench 框架使得在多样化数据类型和条件下,对新型异常检测方法与广泛基线进行公平、可复现且全面的评估成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。