Skip to main content
QUICK REVIEW

[논문 리뷰] Dual-Image Enhanced CLIP for Zero-Shot Anomaly Detection

Zhaoxiang Zhang, Hanqiu Deng|arXiv (Cornell University)|2024. 05. 08.
Radiation Detection and Scintillator Technologies인용 수 4
한 줄 요약

이 논문은 제로샷 이상 탐지 프레임워크인 더블 이미지 강화 CLIP을 제안하며, 각각의 서로 다른 테스트 이미지를 상호 시각적 참조로 활용하고, 가짜 이상 합성과 함께 테스트 시 적응(TTA) 모듈을 통합함으로써 이상 분류 및 국소화 성능을 향상시킨다. 추가 학습 없이 MVTecAD 및 VisA 벤치마크에서 최고 성능을 달성하며, 시각-언어 연합 점수화와 시각적 참조 강화의 효과를 입증한다.

ABSTRACT

Image Anomaly Detection has been a challenging task in Computer Vision field. The advent of Vision-Language models, particularly the rise of CLIP-based frameworks, has opened new avenues for zero-shot anomaly detection. Recent studies have explored the use of CLIP by aligning images with normal and prompt descriptions. However, the exclusive dependence on textual guidance often falls short, highlighting the critical importance of additional visual references. In this work, we introduce a Dual-Image Enhanced CLIP approach, leveraging a joint vision-language scoring system. Our methods process pairs of images, utilizing each as a visual reference for the other, thereby enriching the inference process with visual context. This dual-image strategy markedly enhanced both anomaly classification and localization performances. Furthermore, we have strengthened our model with a test-time adaptation module that incorporates synthesized anomalies to refine localization capabilities. Our approach significantly exploits the potential of vision-language joint anomaly detection and demonstrates comparable performance with current SOTA methods across various datasets.

연구 동기 및 목표

  • CLIP 기반 제로샷 이상 탐지에서 텍스트 중심 가이던스의 한계를 해결하기 위해, 미세한 시각적 이상을 포착하지 못하는 문제를 해결하고자 한다.
  • 추론 중에 각 이미지를 상호 시각적 참조로 사용하는 이중 이미지 입력 전략을 도입함으로써 이상 탐지 성능을 향상시키고자 한다.
  • 테스트 시 적응(TTA) 모듈을 통해 가짜 이상을 합성하여 시각적 표현을 정밀하게 다듬음으로써 국소화 정확도를 향상시키고자 한다.
  • 학습 세트 분포 지식에 의존하지 않고 유도 학습 환경에서 강력한 제로샷 성능을 달성하고자 한다.
  • 시각 및 텍스트 특징 간의 상호보완적 상호작용이 세밀한 이상 탐지에 어떻게 기여하는지 탐색하고자 한다.

제안 방법

  • 프레임워크는 레이블이 없는 테스트 이미지 쌍을 처리하며, 각 이미지를 다른 이미지의 시각적 참조로 활용하여 이상 점수 산정 중 특징 공간을 강화한다.
  • 이상은 텍스트 프롬프트와 상이한 이미지 간의 시각적 유사도를 조합한 연합 시각-언어 점수 산정 메커니즘을 통해 탐지한다.
  • 테스트 시 적응(TTA) 모듈을 도입하였으며, DRAEM에서 영감을 얻은 가짜 이상 합성 기법을 적용하여 추론 중 시각적 특징을 정밀하게 다듬는다.
  • TTA 모듈은 이상 국소화 및 분류 성능을 최적화하기 위해 AUROC 및 PRO 점수를 기반으로 2단계의 학습 스텝을 수행한다.
  • 모델은 미세조정을 필요로 하지 않으며, 모든 성능 향상 요소는 추론 시 처리 및 시각적 참조 융합에서 기인한다.
  • 모델은 CLIP의 시각 및 텍스트 인코더를 사용하여 대비 임베딩을 계산하며, 이상 점수는 다중 모odal 유사도에서 유도된다.

실험 결과

연구 질문

  • RQ1서로 다른 두 장의 이미지를 상호 시각적 참조로 사용할 경우, 텍스트 중심 프롬프트만 사용하는 것보다 제로샷 이상 탐지 성능이 향상되는가?
  • RQ2다른 이미지의 시각적 참조를 통합할 경우, 미세한 이상 탐지 및 국소화 능력에 어떤 영향을 미치는가?
  • RQ3가짜 이상 합성을 통한 테스트 시 적응이 사전 학습된 CLIP 모델의 국소화 성능을 얼마나 향상시킬 수 있는가?
  • RQ4시각적 및 텍스트 정보를 함께 사용할 경우, 단일 모odal보다 더 강력한 이상 탐지 성능을 달성할 수 있는가?
  • RQ5미세조정을 피하는 프레임워크가 제로샷 유도 이상 탐지에서 여전히 SOTA 성능을 달성할 수 있는가?

주요 결과

  • 이중 이미지 입력 전략은 이상 분류(AUROC) 및 국소화(PRO) 성능을 크게 향상시키며, TTA와 결합했을 때 MVTecAD에서 AUROC가 93.2%에 도달한다.
  • 가짜 이상 합성 기반 TTA 모듈은 F1Max를 42.4로, PRO를 84.0으로 향상시켜 국소화 균형을 개선함을 입증한다.
  • TTA 학습 스텝 수가 2일 때 최적의 성능을 달성하며, 이보다 높은 스텝 수는 성능 저하를 초래한다.
  • 이 방법은 제로샷 유도 학습 환경에서 MVTecAD 및 VisA 벤치마크에서 SOTA 성능을 달성하며, 여러 SOTA 기반 모델을 능가한다.
  • 참조 이미지에 이상이 포함되어 있어도 여전히 효과적인 참조로 기능함을 통해, 참조 쌍 내의 시각적 노이즈에 대한 강건성을 입증한다.
  • 연합 시각-언어 점수 산정 메커니즘은 특히 빠진 케이블이나 잘못된 위치에 놓인 물체와 같은 복잡한 이상 탐지 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.