Skip to main content
QUICK REVIEW

[论文解读] Dual-Image Enhanced CLIP for Zero-Shot Anomaly Detection

Zhaoxiang Zhang, Hanqiu Deng|arXiv (Cornell University)|May 8, 2024
Radiation Detection and Scintillator Technologies被引用 4
一句话总结

本文提出Dual-Image Enhanced CLIP,一种零样本异常检测框架,通过联合利用两张未配对的测试图像互为视觉参考,同时结合测试时自适应(TTA)模块与伪异常合成技术,显著提升了异常分类与定位性能。该方法在MVTecAD和VisA基准上无需额外训练即达到最先进性能,验证了视觉-语言联合评分与视觉参考增强的有效性。

ABSTRACT

Image Anomaly Detection has been a challenging task in Computer Vision field. The advent of Vision-Language models, particularly the rise of CLIP-based frameworks, has opened new avenues for zero-shot anomaly detection. Recent studies have explored the use of CLIP by aligning images with normal and prompt descriptions. However, the exclusive dependence on textual guidance often falls short, highlighting the critical importance of additional visual references. In this work, we introduce a Dual-Image Enhanced CLIP approach, leveraging a joint vision-language scoring system. Our methods process pairs of images, utilizing each as a visual reference for the other, thereby enriching the inference process with visual context. This dual-image strategy markedly enhanced both anomaly classification and localization performances. Furthermore, we have strengthened our model with a test-time adaptation module that incorporates synthesized anomalies to refine localization capabilities. Our approach significantly exploits the potential of vision-language joint anomaly detection and demonstrates comparable performance with current SOTA methods across various datasets.

研究动机与目标

  • 为解决基于CLIP的零样本异常检测中仅依赖文本引导的局限性,该方法通常难以捕捉细微的视觉异常。
  • 通过引入双图像输入策略,在推理过程中使每张图像作为另一张图像的视觉参考,从而提升异常检测性能。
  • 通过测试时自适应(TTA)模块合成伪异常,以优化视觉表征,提升定位精度。
  • 在归纳学习设置下实现强大的零样本性能,避免依赖测试集分布知识。
  • 探索视觉与文本特征在视觉-语言模型中协同作用,以实现细粒度异常检测。

提出的方法

  • 该框架处理成对的未标注测试图像,利用每张图像作为另一张图像的视觉参考,以在异常评分过程中丰富特征空间。
  • 通过联合视觉-语言评分机制检测异常,该机制结合文本提示与跨图像视觉相似性。
  • 引入测试时自适应(TTA)模块,采用伪异常合成技术(受DRAEM启发)在推理过程中优化视觉特征。
  • TTA模块以2个训练步长运行,目标是优化异常分类与定位的AUROC与PRO得分。
  • 该方法无需微调;所有性能提升均源于推理阶段的处理与视觉参考融合。
  • 模型使用CLIP的视觉与文本编码器计算对比嵌入,异常分数由跨模态相似性推导得出。

实验结果

研究问题

  • RQ1使用两张未配对图像互为视觉参考,是否能超越仅依赖文本提示的零样本异常检测性能?
  • RQ2引入另一张图像的视觉参考,如何影响模型检测与定位细微异常的能力?
  • RQ3通过伪异常合成实现的测试时自适应,能在多大程度上提升预训练CLIP模型的定位性能?
  • RQ4视觉与文本信息的联合使用是否比单一模态更具鲁棒性,能实现更优的异常检测?
  • RQ5一种避免微调的框架是否仍能在零样本归纳异常检测中实现SOTA性能?

主要发现

  • 双图像输入策略显著提升了异常分类(AUROC)与定位(PRO)性能,结合TTA后在MVTecAD上的AUROC达到93.2%。
  • TTA模块结合伪异常合成使F1Max提升至42.4,PRO提升至84.0,表明定位性能更加均衡。
  • 最优性能出现在TTA训练步长为2时,更高步长导致性能下降。
  • 该方法在零样本归纳学习设置下于MVTecAD与VisA基准上达到SOTA性能,优于多个SOTA基线方法。
  • 即使参考图像本身包含异常,仍能作为有效参考,表明对参考对中视觉噪声具有鲁棒性。
  • 联合视觉-语言评分机制显著提升了检测精度,尤其在缺失电缆或物体错位等复杂异常上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。