Skip to main content
QUICK REVIEW

[论文解读] What is Wrong with One-Class Anomaly Detection?

Junekyu Park, Jeong-Hyeon Moon|arXiv (Cornell University)|Apr 20, 2021
Anomaly Detection Techniques and Applications参考文献 25被引用 6
一句话总结

本文识别出一类异常检测中的关键缺陷:当正常数据包含多种语义类别时,现有方法会因决策边界过于松散而失效。为解决此问题,作者提出CLAD,一种基于置信度的自标签化框架,通过无监督聚类和伪标签化利用潜在类别信息,显著优于以往的一类异常检测方法,在多类正常场景中表现更优。

ABSTRACT

From a safety perspective, a machine learning method embedded in real-world applications is required to distinguish irregular situations. For this reason, there has been a growing interest in the anomaly detection (AD) task. Since we cannot observe abnormal samples for most of the cases, recent AD methods attempt to formulate it as a task of classifying whether the sample is normal or not. However, they potentially fail when the given normal samples are inherited from diverse semantic labels. To tackle this problem, we introduce a latent class-condition-based AD scenario. In addition, we propose a confidence-based self-labeling AD framework tailored to our proposed scenario. Since our method leverages the hidden class information, it successfully avoids generating the undesirable loose decision region that one-class methods suffer. Our proposed framework outperforms the recent one-class AD methods in the latent multi-class scenarios.

研究动机与目标

  • 识别一类异常检测在正常数据包含多种语义类别时的根本局限性。
  • 提出一种基于潜在类别条件的异常检测场景,其中正常数据包含多个隐藏语义类别。
  • 开发一种自监督框架,利用潜在类别信息而无需真实标签。
  • 通过在无异常标签情况下实现语义感知的决策边界,弥合监督与无监督异常检测之间的差距。
  • 证明学习潜在类别结构可提升异常检测性能,优于标准的一类方法。

提出的方法

  • 该方法使用通过对比学习(SimCLR)训练的自监督特征编码器,提取有意义的潜在表征。
  • 应用深度嵌入聚类(DEC)算法对潜在特征进行聚类,并为正常样本分配伪标签。
  • 在这些伪标签化的正常样本上,以监督方式训练分类器(ResNet-18),以学习类别感知表征。
  • 在推理阶段,模型使用基于置信度的异常检测(ODIN)结合温度缩放和输入扰动来检测异常。
  • 该框架通过潜在语义监督学习紧密的、类别特定的边界,避免了决策边界过松的问题。
  • 整个流程端到端训练,包括对比预训练、基于聚类的自标签化和监督分类。

实验结果

研究问题

  • RQ1为何标准的一类异常检测方法在正常数据包含多个语义类别时会失效?
  • RQ2在无法访问真实标签的情况下,能否有效利用潜在类别信息进行异常检测?
  • RQ3基于聚类的自标签化框架能否提升一类AD中的决策边界紧致性和检测性能?
  • RQ4在多类正常场景下,所提方法与当前最先进的一类异常检测方法相比表现如何?
  • RQ5在所提框架中,基于置信度的推理结合温度缩放和输入扰动是否能提升异常检测性能?

主要发现

  • 所提出的CLAD框架在潜在多类场景中显著优于近期一类异常检测方法,尤其在MNIST-Mixed等挑战性场景中表现突出。
  • 该方法在所有数据集(包括MNIST、GTSRB、CIFAR-10和Tiny-ImageNet)上的AUC得分均高于基线一类方法。
  • 使用自标签化的伪类别使模型能够学习到更紧密、类别特定的决策边界,从而减少因覆盖过松导致的假阴性。
  • 消融实验表明,通过聚类实现的自标签化对性能提升至关重要,若移除该步骤,性能退化至基线水平。
  • 推理阶段的温度缩放和输入扰动进一步提升了检测置信度与AUC,验证了ODIN-based置信度校准的有效性。
  • 该框架在多种数据集上泛化良好,展现出在包含异构正常类别的真实场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。