Skip to main content
QUICK REVIEW

[논문 리뷰] Reconstruction Error-based Anomaly Detection with Few Outlying Examples

Fabrizio Angiulli, Fabio Fassetti|arXiv (Cornell University)|2023. 05. 17.
Anomaly Detection Techniques and Applications인용 수 6
한 줄 요약

이 논문은 재구성 오차 기반 오토엔코더의 성능을 햖थ기 위해 소수의 레이블된 비정상 예제를 수정된 손실 함수를 통해 통합하는 새로운 준지도 학습 이상 탐지 방법인 AE–SAD를 제안한다. 이 방법은 정상 및 비정상 재구성 오차 간의 대비를 높여, 데이터 오염 또는 분포 이탈 조건 하에서도 알려진 비정상 클래스와 알려지지 않은 비정상 클래스 모두에서 탐지 성능을 크게 향상시킨다.

ABSTRACT

Reconstruction error-based neural architectures constitute a classical deep learning approach to anomaly detection which has shown great performances. It consists in training an Autoencoder to reconstruct a set of examples deemed to represent the normality and then to point out as anomalies those data that show a sufficiently large reconstruction error. Unfortunately, these architectures often become able to well reconstruct also the anomalies in the data. This phenomenon is more evident when there are anomalies in the training set. In particular when these anomalies are labeled, a setting called semi-supervised, the best way to train Autoencoders is to ignore anomalies and minimize the reconstruction error on normal data. The goal of this work is to investigate approaches to allow reconstruction error-based architectures to instruct the model to put known anomalies outside of the domain description of the normal data. Specifically, our strategy exploits a limited number of anomalous examples to increase the contrast between the reconstruction error associated with normal examples and those associated with both known and unknown anomalies, thus enhancing anomaly detection performances. The experiments show that this new procedure achieves better performances than the standard Autoencoder approach and the main deep learning techniques for semi-supervised anomaly detection.

연구 동기 및 목표

  • 혼합된 정상 및 비정상 데이터로 훈련할 경우 표준 오토엔코더가 비정상 예제를 의도치 않게 재구성하는 데 기인한 한계를 해결하기 위해.
  • 소수의 레이블된 비정상 예제를 활용하여 재구성 오차 기반 이상 탐지의 일반화 성능을 향상시키는 방법을 개발하기 위해.
  • 정상 데이터와 알려진 비정상, 알려지지 않은 비정상 예제의 재구성 오차 간 대비를 향상시켜 탐지 정확도를 높이기 위해.
  • 탭류 및 이미지 데이터셋에서 데이터 오염 및 분포 이탈과 같은 도전적인 조건 하에서 방법을 평가하기 위해.
  • 제안된 방법이 최신 비지도 및 준지도 이상 탐지 기법보다 뛰어난 성능을 보임을 입증하기 위해.

제안 방법

  • 기존 비정상 예제에서 낮은 재구성 오차를 유도하는 것을 명시적으로 방지하기 위해 새로운 손실 함수를 도입하여 비정상 예제의 재구성 성능을 낮추도록 유도한다.
  • 표준 오토엔코더 훈련 목표를 정상 및 비정상 샘플의 재구성 오차 간 격차를 증가시키는 대비 항목을 추가함으로써 수정한다.
  • 표준 순방향 또는 합성곱 오토엔코더 아키텍처를 사용하여 AE–SAD 알고리즘을 탭류 및 이미지 데이터에 적용한다.
  • 정상 재구성 오차 최소화와 비정상 재구성 오차 최대화 사이의 트레이드오프를 제어하기 위해 하이퍼파ram터를 사용한다.
  • 훈련 중에 레이블되지 않은 비정상 예제를 사용하지 않아 도메인 분리를 유지한다.
  • 다양한 이상 상황에서의 탐지 성능 평가를 위해 AUC를 주요 평가 지표로 사용한다.

실험 결과

연구 질문

  • RQ1소수의 레이블된 비정상 예제가 재구성 오차 기반 오토엔코더의 준지도 학습 이상 탐지 성능을 크게 향상시킬 수 있는가?
  • RQ2제안된 AE–SAD 방법은 알려진 비정상 및 알려지지 않은 비정상 예제를 탐지하는 데 있어 표준 오토엔코더 및 다른 최신 딥 러닝 방법보다 뛰어나게 성능을 발휘하는가?
  • RQ3AE–SAD는 훈련 세트에 잘못 레이블된 비정상 예제가 포함된 경우와 같은 데이터 오염에 대해 얼마나 강건한가?
  • RQ4테스트 비정상 예제가 훈련 중에 볼 수 없었던 클래스에서 유래할 경우 AE–SAD는 얼마나 잘 일반화되는가?
  • RQ5AE–SAD는 하이퍼파ram터 선택에 얼마나 민감한가? 최적 성능에 도달하기 위해 얼마나 많은 에포크 수가 필요한가?

주요 결과

  • AE–SAD는 탭류 및 이미지 데이터셋 모두에서 최신 기술 수준의 성능을 달성하여 표준 오토엔코더 및 선도적인 딥 러닝 방법보다 준지도 학습 이상 탐지에서 뛰어난 성능을 보였다.
  • MNIST 및 E-MNIST 데이터셋에서 AE–SAD는 one-vs-all 설정에서 .98 ± .00 AUC, one-vs-many 설정에서 .99 ± .00 AUC를 기록했으며, 항상 1위 또는 2위를 유지했다.
  • many-vs-many 상황에서, 테스트 비정상 예제가 훈련 세트에 존재하지 않는 클래스에서 유래할 경우 AE–SAD는 $A^{3}$보다 우수한 성능을 보였으며, AUC .92 ± .01을 기록한 반면 $A^{3}$는 .88 ± .03을 기록했다.
  • AE–SAD는 훈련 세트에 15%의 오염이 포함된 경우에도 강력한 성능 유지를 보이며, 잘못 레이블된 정상 데이터에 대한 강건성을 입증했다.
  • AE–SAD는 알려지지 않은 비정상 클래스로의 일반화가 효과적으로 이루어지며, 훈련 비정상 예제와 다른 분포에서 유래한 테스트 비정상 예제에 대해 뛰어난 탐지 능력을 보였다.
  • 민감도 분석을 통해 AE–SAD가 하이퍼파ram터 선택에 크게 민감하지 않으며, 소수의 에포크 내에 수렴하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.