Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Anomaly Detection via Dual-Attention Transformer and Discriminative Flow

Haiming Yao, Wei Luo|arXiv (Cornell University)|2023. 03. 31.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 이중주의 트랜스포머 기반의 이중 수준 재구성(자기주의 및 기념주의)과 분류적 정규화 플로를 결합하여 사전 및 재구성된 특징의 동시 가능도를 모델링하는 새로운 시각적 이상 탐지 프레임워크인 DADF를 제안한다. Mvtec AD에서 98.3/98.4의 이미지/픽셀 AUROC, Mvtec LOCO AD에서 83.7의 이미지 AUROC를 기록하며, 상호 보완적인 대응 및 분류 메커니즘을 통해 뛰어난 이상 탐지 및 국소화 성능을 입증한다.

ABSTRACT

In this paper, we introduce the novel state-of-the-art Dual-attention Transformer and Discriminative Flow (DADF) framework for visual anomaly detection. Based on only normal knowledge, visual anomaly detection has wide applications in industrial scenarios and has attracted significant attention. However, most existing methods fail to meet the requirements. In contrast, the proposed DTDF presents a new paradigm: it firstly leverages a pre-trained network to acquire multi-scale prior embeddings, followed by the development of a vision Transformer with dual attention mechanisms, namely self-attention and memorial-attention, to achieve two-level reconstruction for prior embeddings with the sequential and normality association. Additionally, we propose using normalizing flow to establish discriminative likelihood for the joint distribution of prior and reconstructions at each scale. The DADF achieves 98.3/98.4 of image/pixel AUROC on Mvtec AD; 83.7 of image AUROC and 67.4 of pixel sPRO on Mvtec LOCO AD benchmarks, demonstrating the effectiveness of our proposed approach.

연구 동기 및 목표

  • 기존 비지도 시각적 이상 탐지 방법이 재구성 또는 임bedding 기반의 이질성에만 의존하여 과도한 일반화 또는 부족한 분류 능력으로 인해 오류 판단을 겪는 한계를 해결하기 위해.
  • 재구성(대응 메커니즘)과 가능도 모델링(분류 메커니즘)을 상호 보완적인 프레임워크에 통합하여 탐지 신뢰도를 향상시키기 위해.
  • 사전 훈련된 네트워크로부터의 복수 척도 사전 임베딩을 활용하고 이중주의 메커니즘을 적용하여 강력한 이중 수준 재구성의 특징 표현을 향상시키기 위해.
  • 재구성 오차 대신 정규화 플로를 통해 동시 특징 분포에 대해 분류적 가능도를 적용함으로써 정상성 모델링을 더 효과적으로 하기 위해.
  • 복수 척도 특징 융합 및 동시 가능도 추정을 통해 표준 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 프레임워크는 사전 훈련된 백본 네트워크(예: ResNet18)를 사용하여 계층적 문맥 정보를 유지하는 복수 척도 사전 임베딩을 추출한다.
  • 자기주의 및 기념주의 메커니즘을 갖춘 이중 지점 비전 트랜스포머를 도입하여 이중 수준 재구성 수행: 하나는 사전 특징을 사용하고, 다른 하나는 정상 프로토타입의 메모리 백업을 사용한다.
  • 재구성 과정은 순차적이고 정상성과 관련된 대응 메커니즘을 설정하여 과도한 재구성으로 인한 가짜 양성 결과를 감소시킨다.
  • 사전 특징과 두 재구성 특징(자기 및 메모리)의 동시 분포에 분류적 정규화 플로를 적용하여 재구성 오차에 의존하지 않고 정상성 가능도를 모델링한다.
  • 정규화 플로에서 유도된 가능도는 이상 샘플과 정상 샘플 간의 분류 능력을 향상시켜 더 신뢰할 수 있는 이상 점수로 기능한다.
  • 복수 척도 특징는 독립적으로 처리되며, 그 결과가 융합되어 국소화 정밀도와 탐지 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1자기주의 및 기념주의 메커니즘을 갖춘 이중주의 트랜스포머가 시각적 이상 탐지에서 재구성 안정성과 대응 정밀도를 향상시키는가?
  • RQ2정규화 플로를 통해 사전 및 재구성된 특징의 동시 가능도를 모델링하면 재구성 오차 기반 방법보다 더 신뢰할 수 있는 이상 탐지가 가능한가?
  • RQ3복수 척도 특징 융합이 이상 국소화 및 탐지 성능에 어떤 영향을 미치는가?
  • RQ4대응(재구성) 및 분류(가능도 모델링) 메커니즘의 상호 보완적 사용이 가짜 양성 및 가짜 음성 결과를 줄이는가?
  • RQ5자기 재구성과 메모리 기반 재구성의 상대적 기여도는 무엇이며, 그 융합이 탐지 성능 향상에 어떻게 기여하는가?

주요 결과

  • DADF 프레임워크는 Mvtec AD 벤치마크에서 98.3의 이미지 AUROC와 98.4의 픽셀 AUROC를 기록하여 새로운 최고 성능을 달성하였다.
  • Mvtec LOCO AD 벤치마크에서 DADF는 83.7의 이미지 AUROC와 67.4의 픽셀 sPRO를 기록하여 이전 방법들을 크게 앞서며 뛰어난 성능을 보였다.
  • 분류적 정규화 플로의 적용으로 재구성 오차 기반 방법 대비 Mvtec AD에서 +3.2/+1.2/+2.1의 성능 향상을 기록하였으며, Mvtec LOCO AD에서는 더 큰 향상(+7.9 및 +21.2)을 기록하였다.
  • 자기 및 메모리 재구성 특징를 모두 포함하는 동시 분류 플로 모델(ϕ_D)은 Mvtec AD에서 기존의 사전 전용 플로(ϕ_P) 대비 +1.7/+3.5의 이미지/픽셀 AUROC 향상을 기록하였다.
  • 복수 척도 특징 융합은 탐지 성능 향상에 기여하였으며, 스케일 3가 단일 척도에서 가장 우수한 성능을 기록했고, 전체 복수 척도 융합이 총합 최고 성능을 달성하였다.
  • 이중 재구성 전략(자기 및 메모리)은 텍스처 세부 정보를 유지함으로써 가짜 양성 결과를 감소시키고, 메모리 기반 재구성으로 인해 안정성이 향상되어 가짜 음성 결과도 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.