Skip to main content
QUICK REVIEW

[논문 리뷰] DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection

Haoyang He, Jiangning Zhang|arXiv (Cornell University)|2023. 12. 11.
Anomaly Detection Techniques and Applications인용 수 7
한 줄 요약

DiAD는 화소 공간 오토인코더, 스타일러닝된 확산 모델에 연결된 의미 지도형(semantic-guided, SG) 노이즈 제거 네트워크, 그리고 공간 인지 특징 융합(Spatial-aware Feature Fusion, SFF) 블록을 결합한 새로운 확산 기반 프레임워크를 제안한다. 이는 의미적 일관성을 유지하고 큰 비정상 영역을 정확하게 재구성함으로써 다중 클래스 이상 탐지에서 최신 기술 수준의 성능을 달성한다. MVTec-AD 데이터셋에서 이상 탐지 및 국소화 작업에서 각각 97.2 AUROC와 96.8 AP를 기록한다.

ABSTRACT

Reconstruction-based approaches have achieved remarkable outcomes in anomaly detection. The exceptional image reconstruction capabilities of recently popular diffusion models have sparked research efforts to utilize them for enhanced reconstruction of anomalous images. Nonetheless, these methods might face challenges related to the preservation of image categories and pixel-wise structural integrity in the more practical multi-class setting. To solve the above problems, we propose a Difusion-based Anomaly Detection (DiAD) framework for multi-class anomaly detection, which consists of a pixel-space autoencoder, a latent-space Semantic-Guided (SG) network with a connection to the stable diffusion's denoising network, and a feature-space pre-trained feature extractor. Firstly, The SG network is proposed for reconstructing anomalous regions while preserving the original image's semantic information. Secondly, we introduce Spatial-aware Feature Fusion (SFF) block to maximize reconstruction accuracy when dealing with extensively reconstructed areas. Thirdly, the input and reconstructed images are processed by a pre-trained feature extractor to generate anomaly maps based on features extracted at different scales. Experiments on MVTec-AD and VisA datasets demonstrate the effectiveness of our approach which surpasses the state-of-the-art methods, e.g., achieving 96.8/52.6 and 97.2/99.0 (AUROC/AP) for localization and detection respectively on multi-class MVTec-AD dataset. Code will be available at https://lewandofskee.github.io/projects/diad.

연구 동기 및 목표

  • 기존 확산 모델이 다중 클래스 이상 탐지에서 재구성 과정에서 발생하는 분류 및 의미 혼동의 한계를 해결한다.
  • 비정상 영역의 재구성 시 원본 이미지의 의미적 일관성과 구조적 세부 정보를 유지한다.
  • 다중 해상도 특징을 효과적으로 통합함으로써 대규모 결함에 대한 재구성 정확도를 향상시킨다.
  • 클래스별 미세조정 없이도 다양한 물체 클래스에 일반화 가능한 강력한 비지도 학습 프레임워크를 개발한다.
  • 기본 벤치마크에서 이상 국소화 및 분류 성능 모두 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 입력 이미지를 화소 공간에서 재구성하는 화소 공간 오토인코더를 사용하여 입력과 출력 간 직접 비교를 가능하게 한다.
  • 스테이블 디퓨전의 노이즈 제거 U-Net에 연결된 의미 지도형(Semantic-Guided, SG) 노이즈 제거 네트워크를 도입하여 재구성 과정에서 의미 일관성을 보장한다.
  • 스페이셜 인지 특징 융합(Spatial-aware Feature Fusion, SFF) 블록을 활용하여 인스턴스 정규화와 SiLU 활성화 함수를 사용해 다중 해상도 특징을 융합함으로써 재구성 정밀도를 향상시킨다.
  • 이미지넷 사전 학습된 백본(예: ResNet50, WideResNet101)을 활용해 입력 및 재구성된 이미지의 다중 해상도 특징을 추출한다.
  • 특징 맵 간 코사인 유사도를 계산하여 이상 점수를 산출하며, 최적의 성능 확보를 위해 f2, f3, f4 레이어에 집중한다.
  • 재구성 향상을 위해 조정 가능한 타임스텝 수를 가진 정방향 확산을 적용하여 입력 이미지를 점진적으로 노이즈 처리한 후 노이즈 제거를 수행한다.

실험 결과

연구 질문

  • RQ1다중 클래스 환경에서, 확산 기반 프레임워크는 원본 이미지의 의미적 분류와 구조적 세부 정보를 유지하면서도 비정상 영역을 효과적으로 재구성할 수 있는가?
  • RQ2스테이블 디퓨전과 통합된 의미 지도형 노이즈 제거 네트워크는 기존 확산 모델 대비 재구성 정밀도를 얼마나 향상시키는가?
  • RQ3공간 인지 특징 융합 메커니즘이 대규모 이상 영역에 대한 재구성 정확도를 얼마나 향상시키는가?
  • RQ4어떤 사전 학습된 특징 추출기와 특징 레이어가 분류 및 세그멘테이션 작업 전반에서 최고의 이상 탐지 성능을 낳는가?
  • RQ5정방향 확산 타임스텝 수가 최종 재구성 품질과 이상 탐지 성능에 미치는 영향은 어떠한가?

주요 결과

  • DiAD는 MVTec-AD 데이터셋에서 이상 탐지에 대해 97.2 AUROC, 국소화에 대해 96.8 AP를 기록하여 이전 최신 기술 수준(SOTA) 방법들을 뛰어넘는 성능을 달성한다.
  • VisA 데이터셋에서 DiAD는 국소화에 96.8 AUROC, 탐지에 99.0 AP를 기록하여 다양한 종류의 이상에 대해 뛰어난 일반화 능력을 입증한다.
  • 제거 분석 결과, 백본으로 ResNet50를 사용할 경우 분류 성능가장 우수(97.2 AUROC)하며, WideResNet101은 세그멘테이션 성능에서 뛰어나(56.4 F1max)는 것으로 확인되었다.
  • SFF 블록에 인스턴스 정규화와 SiLU 활성화 함수를 사용할 경우 배치 정규화와 ReLU보다 우수한 성능을 보이며, SG 네트워크와 조합 시 97.2 AUROC와 96.8 AP를 기록한다.
  • f2, f3, f4 레이어(각각 64×64, 32×32, 16×16)의 특징 맵을 사용할 경우 성능이 최고로 높아져 MVTec-AD에서 97.2 AUROC와 99.0 AP를 기록한다.
  • 정방향 확산 타임스텝 수를 600 이상으로 늘일수록 재구성 품질이 향상되나, 타임스텝 수가 너무 낮을 경우(예: <600) 성능이 급격히 떨어지며, 이는 효과적인 노이즈 제거를 위한 임계값이 존재함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.