Skip to main content
QUICK REVIEW

[论文解读] SPADE: Semi-supervised Anomaly Detection under Distribution Mismatch

Jinsung Yoon, Kihyuk Sohn|arXiv (Cornell University)|Nov 30, 2022
Anomaly Detection Techniques and Applications被引用 9
一句话总结

SPADE 提出了一种半监督异常检测框架,通过使用一类分类器的集成进行伪标签生成,并采用部分匹配方法自动设置超参数,无需验证数据,从而在标签数据与未标签数据分布不匹配的情况下仍保持鲁棒性。该方法在表格数据上将 AUC 提升最高达 10.6%,在图像数据上提升最高达 3.6%,性能达到当前最先进水平。

ABSTRACT

Semi-supervised anomaly detection is a common problem, as often the datasets containing anomalies are partially labeled. We propose a canonical framework: Semi-supervised Pseudo-labeler Anomaly Detection with Ensembling (SPADE) that isn't limited by the assumption that labeled and unlabeled data come from the same distribution. Indeed, the assumption is often violated in many applications - for example, the labeled data may contain only anomalies unlike unlabeled data, or unlabeled data may contain different types of anomalies, or labeled data may contain only 'easy-to-label' samples. SPADE utilizes an ensemble of one class classifiers as the pseudo-labeler to improve the robustness of pseudo-labeling with distribution mismatch. Partial matching is proposed to automatically select the critical hyper-parameters for pseudo-labeling without validation data, which is crucial with limited labeled data. SPADE shows state-of-the-art semi-supervised anomaly detection performance across a wide range of scenarios with distribution mismatch in both tabular and image domains. In some common real-world settings such as model facing new types of unlabeled anomalies, SPADE outperforms the state-of-the-art alternatives by 5% AUC in average.

研究动机与目标

  • 解决现实世界中异常检测任务里标签数据与未标签数据来自不同分布的常见挑战,该情况违反了标准半监督学习的假设。
  • 开发一种方法,使模型在标签数据仅包含异常样本、仅包含简单样本,或与未标签数据存在不同异常类型时仍能保持高性能。
  • 通过引入一种数据高效且自动的伪标签阈值设置方法,消除对验证数据在超参数调优中的依赖。
  • 通过基于集成的伪标签生成与自监督学习,提升半监督异常检测在分布偏移下的鲁棒性与泛化能力。

提出的方法

  • 使用一类分类器(OCCs)的集成作为伪标签生成器,以提升在分布不匹配情况下的伪标签生成鲁棒性。
  • 应用部分匹配方法,无需依赖标签验证数据即可自动确定最优伪标签阈值,这在低数据场景中尤为关键。
  • 通过可学习的超参数 α,联合使用监督损失(在标签数据上)与伪标签损失(在未标签数据上)。
  • 结合自监督表示学习(如对比学习),以提升特征质量与模型泛化能力。
  • 通过集成中所有 OCC 的一致投票生成可靠的伪标签,降低单个模型带来的噪声。
  • 使用标签数据与伪标签未标签数据联合训练最终的异常检测器,并通过自适应损失加权来平衡分布偏移的影响。

实验结果

研究问题

  • RQ1当标签数据与未标签数据来自不同分布时,半监督异常检测框架是否仍能保持高性能?
  • RQ2在无法访问验证数据的情况下,如何自动选择伪标签的超参数?
  • RQ3与单模型方法相比,基于集成的伪标签生成在分布偏移下能多大程度提升鲁棒性?
  • RQ4在标签数据较少的场景下,引入自监督表示学习对性能有何影响?
  • RQ5不同的投票策略(如一致投票与多数投票)对伪标签质量与最终异常检测性能有何影响?

主要发现

  • SPADE 在存在分布不匹配的多样化现实场景中均实现了最先进性能,包括新型异常类型、数据分布演化以及标签偏差等情况。
  • 在包含新型异常类型的表格数据集上,SPADE 相比最佳基线方法,AUC 最高提升 10.6%。
  • 在图像数据集上,面对类似分布偏移,SPADE 相比最先进方法实现 3.6% 的 AUC 提升。
  • 部分匹配方法无需验证数据即可准确识别最优伪标签阈值,显著降低对人工超参数调优的依赖。
  • 消融实验证明,每个组件——集成、部分匹配、自监督学习与一致投票——均对性能有显著贡献,其中自监督学习提升 0.018 AUC,一致投票相比多数投票提升 0.024 AUC。
  • 该框架对超参数 α 具有鲁棒性,性能在不同 α 值下保持稳定,且当 α=0(无伪标签)时性能显著下降,证实了未标签数据的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。