[论文解读] Contrastive Predictive Coding for Anomaly Detection
该论文提出CPC-AD,一种基于对比学习的方法,直接将对比预测编码(CPC)中的InfoNCE损失用作图像异常检测与分割的异常分数。通过在推理过程中修改负采样策略并移除自回归组件,该方法在MVTec-AD数据集上实现了最先进的检测性能,并且无需预训练模型或人工增强即可生成可解释的分割掩码。
Reliable detection of anomalies is crucial when deploying machine learning models in practice, but remains challenging due to the lack of labeled data. To tackle this challenge, contrastive learning approaches are becoming increasingly popular, given the impressive results they have achieved in self-supervised representation learning settings. However, while most existing contrastive anomaly detection and segmentation approaches have been applied to images, none of them can use the contrastive losses directly for both anomaly detection and segmentation. In this paper, we close this gap by making use of the Contrastive Predictive Coding model (arXiv:1807.03748). We show that its patch-wise contrastive loss can directly be interpreted as an anomaly score, and how this allows for the creation of anomaly segmentation masks. The resulting model achieves promising results for both anomaly detection and segmentation on the challenging MVTec-AD dataset.
研究动机与目标
- 解决在真实应用场景中因异常标注数据稀缺而带来的无监督异常检测挑战。
- 弥合对比学习与图像端到端异常检测及分割之间的差距。
- 实现对比损失的直接使用,既作为异常分数,也作为分割掩码的基础。
- 开发一种在不同类别间具有泛化能力的方法,且不依赖于数据集特定的数据增强或预训练模型。
- 证明CPC的局部特征对比损失可被重新用于异常的检测与定位。
提出的方法
- 该方法采用对比预测编码(CPC)框架,利用单张图像的局部特征图进行对比学习。
- 将正样本对与负样本对之间的InfoNCE损失直接解释为每个局部特征图的异常分数。
- 在推理阶段,重新配置负样本,使得异常特征图只能出现在正样本集中,从而提升检测灵敏度。
- 移除CPC的自回归组件,以简化模型结构并聚焦于异常检测的表征学习。
- 通过在重叠局部特征图上进行平均,将局部特征图级别的InfoNCE分数上采样至像素级分辨率,生成异常分割掩码。
- 模型仅使用正常训练数据从零开始训练,无需人工异常样本或预训练。
实验结果
研究问题
- RQ1CPC的对比损失能否被直接用作图像级异常检测的异常分数?
- RQ2相同的对比损失能否被用于生成准确的像素级异常分割掩码?
- RQ3CPC-AD在MVTec-AD基准上,对异常检测与分割任务的性能是否优于当前最先进方法?
- RQ4移除自回归组件并调整负采样策略是否能提升异常检测性能?
- RQ5从零开始训练的自监督对比模型是否能在无需预训练或数据增强的情况下取得具有竞争力的结果?
主要发现
- CPC-AD在MVTec-AD测试集上实现了0.901的平均AUROC,优于核密度估计和自编码基线方法。
- 在bottle类别上,该方法实现了0.998的AUROC,超过CutPaste模型在该类上的表现。
- 在异常分割任务中,CPC-AD优于基于GAN的方法(如AnoGAN),并在大多数类别上与其它自编码和对比学习基线方法相当或更优。
- 尽管在部分类别上分割得分较低(如carpet类为0.809 AUROC),但该方法生成的掩码视觉上准确,背景噪声极少。
- 该方法在纹理丰富的类别上表现尤为出色,表明其对结构变化具有鲁棒性。
- 该方法具有良好的泛化能力,无需依赖数据集特定的数据增强或预训练模型,因此比CutPaste等方法更具广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。