Skip to main content
QUICK REVIEW

[论文解读] ADGym: Design Choices for Deep Anomaly Detection

Minqi Jiang, Chaochuan Hou|arXiv (Cornell University)|Sep 27, 2023
Anomaly Detection Techniques and Applications被引用 5
一句话总结

ADGym 是一个用于深度弱监督异常检测(WSAD)中设计选择的系统性评估与自动选择的平台,可针对不同数据集实现最优模型配置。它通过元学习选择适配特定数据分布的超参数、网络架构和预处理策略,显著提升了各类基准测试及真实世界噪声条件下的 AUCROC 与 AUCPR 性能,优于当前最先进方法。

ABSTRACT

Deep learning (DL) techniques have recently found success in anomaly detection (AD) across various fields such as finance, medical services, and cloud computing. However, most of the current research tends to view deep AD algorithms as a whole, without dissecting the contributions of individual design choices like loss functions and network architectures. This view tends to diminish the value of preliminary steps like data preprocessing, as more attention is given to newly designed loss functions, network architectures, and learning paradigms. In this paper, we aim to bridge this gap by asking two key questions: (i) Which design choices in deep AD methods are crucial for detecting anomalies? (ii) How can we automatically select the optimal design choices for a given AD dataset, instead of relying on generic, pre-existing solutions? To address these questions, we introduce ADGym, a platform specifically crafted for comprehensive evaluation and automatic selection of AD design elements in deep methods. Our extensive experiments reveal that relying solely on existing leading methods is not sufficient. In contrast, models developed using ADGym significantly surpass current state-of-the-art techniques.

研究动机与目标

  • 识别影响深度异常检测性能的关键设计选择(如损失函数、网络架构和数据预处理技术)。
  • 解决现有深度 AD 方法中对组件交互作用缺乏系统性评估的问题,这些方法通常将模型视为整体单元。
  • 开发一种基于元学习的自动化框架,为给定数据集选择最优设计选择组合,超越预定义的模型列表。
  • 评估设计选择在真实世界数据问题(如重复异常、无关特征和标签噪声)下的鲁棒性。
  • 证明不存在一种设计选择能普遍优于其他选择,从而证明需进行数据集特定的优化。

提出的方法

  • ADGym 在五个维度上构建了全面的设计选择搜索空间:数据处理、网络构建、网络训练和预处理技术。
  • 采用元学习方法,基于基准数据集的历史性能,预测新数据集的最佳设计选择组合。
  • 平台在大规模 WSAD 基准数据集(包括真实世界和噪声数据设置)上,使用标准化指标(AUCROC、AUCPR)评估所有组合。
  • 采用两阶段流程:第一阶段,元预测器学习历史数据集-设计选择-性能映射关系;第二阶段,为新数据集选择最优配置。
  • 实验包括在三种真实世界噪声条件下进行的受控评估:重复异常、无关特征和标签噪声,性能通过 AUCROC 和 AUCPR 衡量。
  • 该方法支持端到端和两阶段训练范式,支持不同训练策略的比较。

实验结果

研究问题

  • RQ1在深度异常检测中,哪些个体设计选择对模型性能影响最大?
  • RQ2不同设计选择之间如何相互作用,其对异常检测性能的相对贡献如何?
  • RQ3能否通过元学习框架自动为新数据集选择最优设计选择组合,超越现有 SOTA 模型?
  • RQ4不同设计选择在真实世界数据问题(如标签噪声、无关特征和重复异常)下的鲁棒性如何?
  • RQ5是否存在一种在所有数据集上均最优的配置,还是必须进行数据集特定的优化?

主要发现

  • 最优设计选择组合在不同数据集中差异显著,不存在一种配置能普遍优于其他配置。
  • ADGym 自动选择的模型始终优于现有最先进方法,在包含 20 个异常样本的基准数据集上,AUCROC 最高达 0.685,AUCPR 最高达 0.659。
  • ResNet 架构在所有噪声条件下均表现出优越且稳定的性能,尤其在重复异常条件下,性能提升且方差增大。
  • 无关特征和标签噪声显著降低大多数设计选择的性能,且结果方差极小,表明在这些条件下模型性能趋于收敛。
  • 重复异常导致所有设计选择的性能均有所提升,表明在真实场景中可能缓解了数据不平衡问题。
  • 元预测器方法能持续选择高性能配置,ADGym 的端到端与两阶段流程在所有测试设置中 AUCROC 和 AUCPR 的相对排名均最高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。