[论文解读] Self-Trained One-class Classification for Unsupervised Anomaly Detection.
本文提出 STOC,一种用于无监督异常检测的自训练单类分类框架,通过在不相交的数据子集上使用集成单类分类器,迭代地优化数据和深度表征。该方法在 CIFAR-10 数据集上以 10% 异常比例时达到最先进性能,AUC 提升 6.3,平均精度提升 12.5。
Anomaly detection (AD), separating anomalies from normal data, has various applications across domains, from manufacturing to healthcare. While most previous works have shown to be effective for cases with fully or partially labeled data, they are less practical for AD applications due to tedious data labeling processes. In this work, we focus on unsupervised AD problems whose entire training data are unlabeled and may contain both normal and anomalous samples. To tackle this problem, we build a robust one-class classification framework via data refinement. To refine the data accurately, we propose an ensemble of one-class classifiers, each of which is trained on a disjoint subset of training data. Moreover, we propose a self-training of deep representation one-class classifiers (STOC) that iteratively refines the data and deep representations. In experiments, we show the efficacy of our method for unsupervised anomaly detection on benchmarks from image and tabular data domains. For example, with a 10% anomaly ratio on CIFAR-10 data, the proposed method outperforms state-of-the-art one-class classification method by 6.3 AUC and 12.5 average precision.
研究动机与目标
- 解决无监督异常检测中的挑战,即所有训练数据均为无标签,且可能同时包含正常与异常样本。
- 通过实现无需任何标注异常样本的高效异常检测,减少对昂贵且繁琐的数据标注的依赖。
- 开发一种鲁棒的单类分类框架,通过迭代优化数据与表征来提升泛化能力。
- 在图像与表格数据领域的真实无监督设置下,提升基准数据集上的性能。
提出的方法
- 构建一组单类分类器,每个分类器在无标签训练数据的不相交子集上进行训练,以提升鲁棒性与多样性。
- 实施一种自训练机制,通过基于集成预测结果过滤出高置信度异常样本,迭代优化训练数据。
- 通过对比学习目标更新深度表征,增强正常与异常模式之间的特征区分能力。
- 在数据优化与表征学习步骤之间交替进行,逐步提升分类器性能,而无需任何标签。
- 采用置信度阈值策略,在每次自训练迭代中识别并从训练集中移除潜在异常样本。
- 利用集成中预测结果的一致性,提升数据优化与表征学习的可靠性。
实验结果
研究问题
- RQ1在不相交数据子集上训练的单类分类器集成,是否能提升无监督异常检测中的鲁棒性?
- RQ2迭代自训练在优化单类分类的数据与深度表征方面有多有效?
- RQ3所提出的 STOC 框架在图像与表格基准上相较于最先进单类分类方法的性能提升程度如何?
- RQ4在高异常比例(如 CIFAR-10 上的 10%)下,该方法表现如何?
主要发现
- 在 CIFAR-10 数据集上,以 10% 异常比例时,所提出的 STOC 方法相比最先进单类分类方法,AUC 提升 6.3 个百分点。
- 在同一 CIFAR-10 基准上,该方法将平均精度提升 12.5 个百分点,表明在精度敏感场景中表现优异。
- 基于集成的数据优化策略能有效减少无标签数据中的噪声,提升模型泛化能力。
- 迭代自训练过程持续提升了表征质量与异常检测性能。
- 该方法在不同领域间具有良好的泛化能力,在图像与表格数据基准上均表现强劲。
- 当训练数据中包含显著比例的异常样本时,该框架仍保持高性能,表明对数据污染具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。