Skip to main content
QUICK REVIEW

[논문 리뷰] PaDiM: a Patch Distribution Modeling Framework for Anomaly Detection and Localization

Defard Thomas, Aleksandr Setkov|arXiv (Cornell University)|2020. 11. 17.
Anomaly Detection Techniques and Applications인용 수 15
한 줄 요약

PaDiM은 사전 훈련된 CNN과 다변량 정규분포를 사용하여 정상 이미지 패치의 분포를 모델링하는 새로운 일종 이상 탐지 및 국소화 프레임워크를 제안한다. 이는 MVTec AD 및 STC 데이터셋에서 낮은 추론 시간과 메모리 복잡도로 최신 기술 수준(SOTA) 성능을 달성하며, 특히 비정렬 데이터에서 이전 방법들보다 뛰어난 성능을 보인다.

ABSTRACT

We present a new framework for Patch Distribution Modeling, PaDiM, to concurrently detect and localize anomalies in images in a one-class learning setting. PaDiM makes use of a pretrained convolutional neural network (CNN) for patch embedding, and of multivariate Gaussian distributions to get a probabilistic representation of the normal class. It also exploits correlations between the different semantic levels of CNN to better localize anomalies. PaDiM outperforms current state-of-the-art approaches for both anomaly detection and localization on the MVTec AD and STC datasets. To match real-world visual industrial inspection, we extend the evaluation protocol to assess performance of anomaly localization algorithms on non-aligned dataset. The state-of-the-art performance and low complexity of PaDiM make it a good candidate for many industrial applications.

연구 동기 및 목표

  • 이상이 드물고 레이블이 없는 산업 영상 검사 환경에서 이상 탐지 및 국소화 문제를 해결한다.
  • 추론 시 K-NN나 미세조정된 딥 네트워크에 의존하는 기존 방법의 확장성 문제를 해결한다.
  • 실제 도입에 적합한, 훈련 데이터셋 크기와 무관한 낮은 시간 및 메모리 복잡도를 갖는 방법을 개발한다.
  • 사전 훈련된 CNN의 다중 의미 수준 간 상관관계를 모델링하여 국소화 정확도를 향상시킨다.
  • 실제 산업 검사 조건을 더 잘 반영하기 위해 비정렬 데이터셋으로의 평가를 확장한다.

제안 방법

  • 여러 특징맵 레이어에서 패치 수준의 임bedding을 추출하기 위해 사전 훈련된 컨volutional 신경망(CNN)을 사용한다.
  • 훈련 임베딩에서 학습된 평균 μ와 공분산 Σ를 사용하여 각 공간 패치 위치를 다변량 정규분포로 모델링한다.
  • CNN의 다양한 의미 수준 간의 상관관계를 활용하여 국소화 정밀도를 향상시킨다.
  • 다양한 레이어의 정보를 통합하여 임bedded 공간에서 마할라노비스 거리(Mahalanobis distance)를 사용해 이상 점수를 계산한다.
  • 딥 네트워크를 테스트 시 훈련하지 않는 패치 기반 비모수적 접근법을 채택한다.
  • 정확도와 추론 속도의 균형을 맞추기 위해 유연한 백본 선택(예: ResNet-18, ResNet-50)을 지원한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 CNN을 사용한 패치 분포 모델링 접근법이 이상 탐지 및 국소화에서 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?
  • RQ2비정렬 데이터셋에서 PaDiM의 성능은 어떻게 되는가? 이는 실제 산업 검사 상황을 더 잘 반영한다.
  • RQ3CNN 특징에서 다중 수준 간 상관관계를 모델링하면 단일 수준 접근법에 비해 국소화 정확도가 향상되는가?
  • RQ4PaDiM은 K-NN 기반 또는 오토에코더 기반 방법보다 뛰어난 성능을 유지하면서도 낮은 추론 시간과 메모리 사용량을 유지할 수 있는가?
  • RQ5입력 해상도와 데이터셋 크기가 증가함에 따라 시간 및 메모리 복잡도 측면에서 PaDiM의 확장성은 어떻게 되는가?

주요 결과

  • 비정렬 MVTec AD 벤치마크에서 PaDiM은 모든 텍스처 클래스에서 92.4%의 SOTA AUROC를 기록했고, 모든 클래스에서는 92.2%를 달성했다.
  • STC 데이터셋에서 PaDiM-WR50-Rd550는 물체 클래스에서 92.1%의 AUROC와 70.8%의 PRO 점수를 기록하여 VAE와 SPADE를 모두 초월했다.
  • 비정렬 MVTec AD에서 PaDiM의 성능 저하는 5.3%p에 그쳤지만, VAE와 SPADE는 각각 12.2%p와 8.8%p 저하를 보였다.
  • MVTec AD에서 PaDiM-WR50-Rd550의 추론 시간은 0.95초(_CPU 기준)로, 동일한 백본을 사용한 SPADE의 7.10초보다 훨씬 빠르게 작동했다.
  • PaDiM의 메모리 사용량은 훈련 세트 크기와 무관하며, MVTec AD에선 3.8 GB, STC에선 5.2 GB를 필요로 했고, STC에서 SPADE는 37.0 GB를 사용했다.
  • PaDiM의 훈련 시간은 MVTec AD에서 클래스당 150초(_CPU 기준)로, GPU에서 2시간 40분이 소요되는 VAE의 클래스당 훈련 시간보다 훨씬 빠르며, 어떤 미세조정도 필요로 하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.