Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot Anomaly Detection with Pre-trained Segmentation Models

Matthew Baugh, James Batten|arXiv (Cornell University)|2023. 06. 15.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 WinCLIP을 개선하기 위해 제로샷 세그멘테이션 모델을 통합하여 국소화 성능을 향상시킨 제로샷 이상 탐지 방법을 제안한다. 복수 수준의 예측 집계와 함께 CLIP 기반 프롬프팅 및 배경이 아닌 인스턴스 세그멘테이션을 조합함으로써, 이 방법은 VisA 데이터셋에서 샘플 수준에서 81.5의 F1-max 점수와 픽셀 수준에서 24.2의 점수를 기록하여 VAND 2023 챌린지에서 3위를 기록하며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

This technical report outlines our submission to the zero-shot track of the Visual Anomaly and Novelty Detection (VAND) 2023 Challenge. Building on the performance of the WINCLIP framework, we aim to enhance the system's localization capabilities by integrating zero-shot segmentation models. In addition, we perform foreground instance segmentation which enables the model to focus on the relevant parts of the image, thus allowing the models to better identify small or subtle deviations. Our pipeline requires no external data or information, allowing for it to be directly applied to new datasets. Our team (Variance Vigilance Vanguard) ranked third in the zero-shot track of the VAND challenge, and achieve an average F1-max score of 81.5/24.2 at a sample/pixel level on the VisA dataset.

연구 동기 및 목표

  • 정상 샘플이 몇 개뿐인 산업 환경에서 데이터 효율성이 떨어지는 이상 탐지 문제를 해결하기 위해.
  • 사전 훈련된 세그멘테이션 모델을 활용해 제로샷 이상 탐지 모델의 국소화 정확도를 향상시키기 위해.
  • 외부 데이터나 미세조정 없이도 새로운 데이터셋에 직접 적용 가능한 파이프라인을 개발하기 위해.
  • VAND 2023 챌린지의 제로샷 트랙에서 VisA 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 배경 제거를 위해 이분할 이미지 세그멘테이션과 Segment Anything Model(SAM)을 조합하며, SAM 출력을 80% 겹침 임계값을 사용해 필터링하여 진짜 전경을 분리한다.
  • 이미지 타일링을 통해 각 전경 인스턴스를 최소 352×352 픽셀 크기의 정사각형 타일로 나누며, 높은 종횡비를 가진 물체의 경우 긴 축을 따라 적응형 타일링을 적용해 물체 구성 요소를 유지한다.
  • 샘플 수준 분류를 위해 복합 프롬프트 앙상블를 사용하며, 픽셀 수준에서 이상을 국소화하기 위한 별도의 일반 명사 프롬프트를 사용한다.
  • 타일 수준 이상 점수는 프롬프트의 CLIP 임베딩과 각 타일의 이미지 임베딩 간 코사인 유사도 평균을 계산하여 산출하며, 이는 이상 프롬프트에 대해 군집 평균 문제를 피하기 위함이다.
  • 픽셀 수준 예측은 CLIPSeg를 사용해 국소화 프롬프트를 적용하고, 프롬프트 세그멘테이션 간 조화 평균을 적용해 일관된 활성화를 강조한다.
  • 예측 집계는 타일 수준 점수를 조합하여 픽셀 수준 예측을 확장하며, 최종 이미지 공간 예측은 겹치는 타일 출력과 상위 25퍼센트 전경 구성 요소 점수의 평균을 사용해 형성된다.

실험 결과

연구 질문

  • RQ1추가 훈련 데이터 없이도 제로샷 세그멘테이션 모델이 제로샷 이상 탐지의 국소화 성능을 향상시킬 수 있는가?
  • RQ2전경 인스턴스 세그멘테이션은 산업 이미지에서 작은 또는 미세한 이상을 탐지하는 데 어떤 영향을 미치는가?
  • RQ3일반적인 이상 기술어를 사용한 CLIP 기반 프롬프팅이 표준 WinCLIP 프롬프트보다 픽셀 수준 이상 국소화에서 얼마나 뛰어난가?
  • RQ4타일 수준 및 픽셀 수준의 복수 수준 예측 집계는 전체 탐지의 강건성과 정확도를 어떻게 향상시키는가?
  • RQ5완전히 제로샷 파이프라인은 어떤 데이터셋 특화 적응 없이도 VisA에서 최신 기술 수준 성능을 달성할 수 있는가?

주요 결과

  • 이 방법은 VisA 데이터셋에서 샘플 수준에서 81.5의 F1-max 점수를 기록하여 WinCLIP 기준점인 79.0을 초월했으며, VAND 2023 제로샷 트랙에서 3위를 기록했다.
  • 픽셀 수준에서는 24.2의 F1-max 점수를 기록하여 WinCLIP 기준점인 14.8과 도전자 APRIL-GAN의 32.3을 뛰어넘었다.
  • 전경 세그멘테이션 통합으로 배경 그림자로 인한 오분류가 감소했으며, 특히 복잡하거나 긴 형태의 물체에 대해 집중도 향상되었다.
  • CLIPSeg 프롬프트 출력 간 조화 평균 적용으로 미세한 이상에 대해 픽셀 수준 세그멘테이션의 일관성이 향상되었다.
  • 일반적인 국소화 프롬프트(예: '결함', '손상') 사용은 전체 이미지 WinCLIP 프롬프트를 재사용하는 것보다 더 정밀한 이상 국소화를 이끌어냈다.
  • 상위 25퍼센트 전경 구성 요소 점수를 사용한 예측 집계는 정상 영역에서 유래한 노이즈를 효과적으로 완화하고 샘플 수준 분류의 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.