[论文解读] Self-supervise, Refine, Repeat: Improving Unsupervised Anomaly Detection
本文提出 SRR(Self-supervise, Refine, Repeat),一种面向完全无监督异常检测的数据中心框架,通过使用一组一类分类器(OCCs)迭代优化训练数据,从而逐步提升模型的鲁棒性。通过利用自监督表征和基于共识的数据优化,SRR 实现了当前最优性能,在 CIFAR-10 和甲状腺数据集上分别将 AUC 提升 6.3 和 F1 分数提升 22.9,即使在异常比例较高的情况下亦表现优异。
Anomaly detection (AD), separating anomalies from normal data, has many applications across domains, from security to healthcare. While most previous works were shown to be effective for cases with fully or partially labeled data, that setting is in practice less common due to labeling being particularly tedious for this task. In this paper, we focus on fully unsupervised AD, in which the entire training dataset, containing both normal and anomalous samples, is unlabeled. To tackle this problem effectively, we propose to improve the robustness of one-class classification trained on self-supervised representations using a data refinement process. Our proposed data refinement approach is based on an ensemble of one-class classifiers (OCCs), each of which is trained on a disjoint subset of training data. Representations learned by self-supervised learning on the refined data are iteratively updated as the data refinement improves. We demonstrate our method on various unsupervised AD tasks with image and tabular data. With a 10% anomaly ratio on CIFAR-10 image data / 2.5% anomaly ratio on Thyroid tabular data, the proposed method outperforms the state-of-the-art one-class classifier by 6.3 AUC and 12.5 average precision / 22.9 F1-score.
研究动机与目标
- 解决完全无监督异常检测中的挑战,即训练数据中包含未标注的正常与异常样本。
- 在无任何标注数据的前提下,提升基于自监督表征训练的一类分类器(OCCs)的鲁棒性。
- 开发一种数据优化机制,通过多个 OCC 之间的共识,迭代排除潜在异常样本。
- 通过集成 Otsu 方法实现自动阈值选择,使框架无需事先知晓真实异常比例即可运行。
- 在真实无监督设置下,于多样化数据集(包括图像与表格数据)上展示当前最优性能。
提出的方法
- 该框架采用一组 OCC,每个 OCC 在未标注训练数据的互不重叠子集上进行训练,以检测潜在异常。
- 仅当集成中所有 OCC 均一致判定为正常时,样本才被标记为正常,从而实现基于共识的数据优化,排除候选异常。
- 从优化后的数据中学习自监督表征,并通过多轮优化循环迭代更新。
- 最终的异常检测模型基于优化后的数据,使用自监督对比学习进行训练,以提升表征质量。
- 对于未知的异常比例,采用 Otsu 方法基于正常性得分分布自动确定超参数 γ 的阈值。
- 该框架具有灵活性,可与任意 OCC 配合使用,并适用于原始数据或学习到的表征。
实验结果
研究问题
- RQ1使用集成 OCC 进行迭代数据优化,能否提升完全无监督异常检测中一类分类器的鲁棒性?
- RQ2当 SOTA OCC 在包含异常样本的未标注数据上进行训练时,其性能如何退化?这种退化是否可被缓解?
- RQ3当与迭代数据优化结合时,自监督表征在多大程度上能增强异常检测性能?
- RQ4Otsu 方法能否在 SRR 框架中有效替代真实异常比例知识,实现自动阈值选择?
- RQ5在不同异常比例下,SRR 在多样化数据集(包括图像与表格数据)上的表现如何?
主要发现
- 在 CIFAR-10 数据集(异常比例 10%)上,SRR 相较于 SOTA OCC 将 AUC 提升 6.3 个百分点,平均精度提升 12.5 个百分点。
- 在甲状腺数据集(异常比例 2.5%)上,SRR 相较于 SOTA OCC 将 F1 分数提升 22.9 个百分点。
- 即使在高异常比例下,SRR 仍保持优异性能,展现出显著优于先前 OCC 的鲁棒性。
- 当使用 Otsu 方法进行自动阈值选择而无需真实异常比例时,SRR 在 CIFAR-10 上仍比 SOTA OCC 高出 5.1 AUC 个百分点,在甲状腺数据集上高出 11.7 F1 分数。
- 与已知异常比例的 SRR 相比,引入 Otsu 方法仅导致轻微性能下降,证实其在真实场景中的有效性。
- 大量消融实验表明,基于集成的优化与迭代自监督机制对性能提升至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。