Skip to main content
QUICK REVIEW

[논문 리뷰] DeSTSeg: Segmentation Guided Denoising Student-Teacher for Anomaly Detection

Xuan Zhang, Shiyu Li|arXiv (Cornell University)|2022. 11. 21.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

DeSTSeg는 합성적으로 손상된 입력에서 청소된 특징을 재구성하도록 훈련하는 학생 네트워크를 통해 특징의 구분력을 향상시키고, 다중 수준의 특징 불일치를 적응적으로 융합하기 위해 훈련 가능한 세그멘테이션 네트워크를 사용하는 노이즈 제거 학생-교수 프레임워크를 제안한다. 이 방법은 MVTec AD 벤치마크에서 98.6%의 이미지 수준 AUC, 75.8%의 픽셀 수준 AP, 76.4%의 인스턴스 수준 AP를 기록하여 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Visual anomaly detection, an important problem in computer vision, is usually formulated as a one-class classification and segmentation task. The student-teacher (S-T) framework has proved to be effective in solving this challenge. However, previous works based on S-T only empirically applied constraints on normal data and fused multi-level information. In this study, we propose an improved model called DeSTSeg, which integrates a pre-trained teacher network, a denoising student encoder-decoder, and a segmentation network into one framework. First, to strengthen the constraints on anomalous data, we introduce a denoising procedure that allows the student network to learn more robust representations. From synthetically corrupted normal images, we train the student network to match the teacher network feature of the same images without corruption. Second, to fuse the multi-level S-T features adaptively, we train a segmentation network with rich supervision from synthetic anomaly masks, achieving a substantial performance improvement. Experiments on the industrial inspection benchmark dataset demonstrate that our method achieves state-of-the-art performance, 98.6% on image-level AUC, 75.8% on pixel-level average precision, and 76.4% on instance-level average precision.

연구 동기 및 목표

  • 기존의 학생-교수 프레임워크가 이상 샘플에 대해 구분력 있는 특징을 생성하는 데에 한계를 보이는 이유는 이상에 대한 명시적 제약 조건이 부족하기 때문이다.
  • 다중 수준의 특징 융합을 향상시키기 위해 경험적 집계 방식을 훈련 가능한 세그멘테이션 네트워크로 대체함으로써 이상 탐지 성능을 향상시키는 것.
  • 합성 이상을 사용한 노이즈 제거 훈련 목표를 도입하여 강건성과 표현 학습 능력을 향상시키는 것.
  • 이미지 수준, 픽셀 수준, 인스턴스 수준의 이상 탐지 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • 합성적으로 손상된 정상 이미지를 입력으로 사용하여, 교수가 생성한 청소된 특징을 재구성하도록 노이즈 제거 학생 인코더-디코더 네트워크를 훈련한다.
  • 학생 네트워크는 동일한 이미지에서 출력된 특징의 불일치를 최소화하도록 훈련되어, 효과적으로 특징를 노이즈 제거하는 것을 학습한다.
  • 학생-교수 네트워크에서 유도된 다중 수준의 특징 불일치를 적응적으로 융합하기 위해, 합성 이상 마스크에서 풍부한 지도를 받는 세그멘테이션 네트워크를 훈련한다.
  • 세그멘테이션 네트워크의 입력은 학생 및 교수 네트워크의 정규화된 특징 맵의 원소별 곱셈 결과이며, 이는 특징 정보와 사전 지식을 균형 있게 유지한다.
  • 세그멘테이션 네트워크는 이상 점수 맵 예측을 위해 L1 손실을 사용하여 정밀도를 향상시킨다.
  • 전체 프레임워크는 사전 훈련된 교수, 노이즈 제거 학생, 훈련 가능한 세그멘테이션 헤드를 통합하여 엔드 투 엔드 훈련 파이프라인을 구성한다.

실험 결과

연구 질문

  • RQ1노이즈 제거 훈련 목표는 학생-교수 프레임워크에서 정상 및 이상 샘플 간의 특징 구분력을 향상시키는 데 효과적인가?
  • RQ2경험적 다중 수준 특징 융합 방식을 훈련 가능한 세그멘테이션 네트워크로 대체하면 이상 탐지 정밀도가 향상되는가?
  • RQ3합성 이상 마스크를 사용해 세그멘테이션 네트워크를 지도하는 것이 성능 향상에 얼마나 효과적인가?
  • RQ4각 구성 요소—노이즈 제거, 인코더-디코더 아키텍처, 세그멘테이션 헤드—가 전체 성능에 기여하는 정도는 어떠한가?

주요 결과

  • DeSTSeg는 MVTec AD 벤치마크에서 98.6%의 이미지 수준 AUC를 기록하여 이전 최신 기술 수준의 방법보다 0.1% 높은 성능을 달성했다.
  • 이 방법은 75.8%의 픽셀 수준 평균 정밀도를 기록하여 이전 최신 기술 수준의 방법보다 5.6% 향상된 성능을 보였다.
  • 인스턴스 수준 평균 정밀도는 76.4%에 도달하여 이전 최고 성능 방법보다 4.9% 향상되었다.
  • 절단 실험 결과, 노이즈 제거 훈련, 인코더-디코더 아키텍처, 세그멘테이션 헤드를 조합할 경우 최고의 성능을 기록함을 확인했다.
  • 세그멘테이션 헤드에서 L1 손실을 사용할 경우 성능 향상이 뚜렷했으며, 이 경우 AUC는 98.6%, AP는 75.8%를 기록했다.
  • 정규화된 S-T 특징의 원소별 곱셈은 세그멘테이션 네트워크의 입력으로서 연결 또는 코사인 거리보다 더 효과적인 것으로 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.