Skip to main content
QUICK REVIEW

[论文解读] Normality-Calibrated Autoencoder for Unsupervised Anomaly Detection on Data Contamination

Jongmin Yu, Hyeontaek Oh|arXiv (Cornell University)|Oct 28, 2021
Anomaly Detection Techniques and Applications参考文献 28被引用 14
一句话总结

该论文提出了一种完全无监督的异常检测方法——归一性校准自编码器(NCAE),通过从低熵潜在空间中对抗性地生成高置信度正常样本,并利用这些样本识别污染样本,从而提升对数据污染的鲁棒性。NCAE 在 MNIST 和 Fashion-MNIST 数据集上均优于当前最先进的无监督方法,在高达 20% 污染率的情况下性能可与半监督方法相媲美。

ABSTRACT

In this paper, we propose Normality-Calibrated Autoencoder (NCAE), which can boost anomaly detection performance on the contaminated datasets without any prior information or explicit abnormal samples in the training phase. The NCAE adversarially generates high confident normal samples from a latent space having low entropy and leverages them to predict abnormal samples in a training dataset. NCAE is trained to minimise reconstruction errors in uncontaminated samples and maximise reconstruction errors in contaminated samples. The experimental results demonstrate that our method outperforms shallow, hybrid, and deep methods for unsupervised anomaly detection and achieves comparable performance compared with semi-supervised methods using labelled anomaly samples in the training phase. The source code is publicly available on `https://github.com/andreYoo/NCAE_UAD.git'.

研究动机与目标

  • 解决训练数据中混入未知异常样本时异常检测性能下降的挑战。
  • 开发一种完全无监督的方法,训练过程中无需先验知识或显式异常样本。
  • 通过识别并最大化污染样本的重建误差,提升模型对污染的鲁棒性。
  • 在训练过程中不使用标注异常样本的前提下,实现与半监督方法相当的性能。
  • 通过在潜在空间中校准归一性,克服自编码器在重建未见或污染样本时的过度自信问题。

提出的方法

  • 使用归一性校准重建(NCR)损失,训练自编码器以最小化正常样本的重建误差,同时最大化污染样本的重建误差。
  • 采用生成对抗网络(GAN)框架,将潜在特征分布转换为更富含知识、且以正常数据为中心的低熵分布。
  • 通过从学习到的潜在分布中心(低熵区域)采样噪声,生成高置信度正常样本。
  • 通过对比学习将输入样本与生成的高置信度正常样本进行比较,以估计污染度分数。
  • 基于重建误差迭代识别污染样本,并重新训练自编码器以增加对这些样本的误差。
  • 利用潜在特征的熵来检测污染,因为在高污染率下,污染样本可能形成低熵簇。

实验结果

研究问题

  • RQ1当训练数据混入未知异常样本时,完全无监督的异常检测模型能否保持高性能?
  • RQ2从低熵潜在空间对抗性生成高置信度正常样本,能否提升对数据污染的鲁棒性?
  • RQ3在不同污染率下,所提方法是否优于现有无监督异常检测技术?
  • RQ4该模型能否在不使用训练期间显式异常标注的情况下,实现与半监督方法相当的性能?
  • RQ5在高污染率下,潜在特征的熵行为如何?是否可被用于检测污染样本?

主要发现

  • 在 MNIST 数据集上,NCAE 在 1% 污染率下 AUC 达 97.2%,在 10% 污染率下为 92.6%,优于所有无监督基线方法。
  • 在 Fashion-MNIST 数据集上,NCAE 在 10% 污染率下 AUC 为 91.5%,在 20% 污染率下为 88.97%,超越所有列出的无监督方法。
  • 即使未使用标注异常样本,NCAE 的性能仍可与使用显式异常样本训练的半监督方法(如 SSAD 和 Deep SAD)相媲美。
  • 在无污染数据(ρ=0.0)上性能略有下降,这是由于模型固有的污染假设所致,但在所有污染水平下仍保持强劲表现。
  • 即使污染样本形成低熵簇,该方法仍能有效检测,克服了传统基于熵方法的失效模式。
  • NCAE 框架在多个数据集和污染水平下表现出鲁棒性,验证了其在真实世界场景中的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。