Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Trained One-class Classification for Unsupervised Anomaly Detection.

Jinsung Yoon, Kihyuk Sohn|arXiv (Cornell University)|2021. 06. 11.
Anomaly Detection Techniques and Applications참고 문헌 49인용 수 9
한 줄 요약

이 논문은 자기학습(one-class classification) 프레임워크인 STOC를 제안하며, 서로 겹치지 않는 데이터 부분집합에 대해 다수의 one-class 분류기들을 사용하여 반복적으로 데이터 및 딥 표현을 개선하는 방식으로 비지도 이상 탐지에 활용한다. 이는 CIFAR-10에서 이상 비율이 10%일 때 기존 방법보다 AUC 6.3점, 평균 정밀도 12.5점 향상시키며 최신 기준 성능(SOTA)을 달성한다.

ABSTRACT

Anomaly detection (AD), separating anomalies from normal data, has various applications across domains, from manufacturing to healthcare. While most previous works have shown to be effective for cases with fully or partially labeled data, they are less practical for AD applications due to tedious data labeling processes. In this work, we focus on unsupervised AD problems whose entire training data are unlabeled and may contain both normal and anomalous samples. To tackle this problem, we build a robust one-class classification framework via data refinement. To refine the data accurately, we propose an ensemble of one-class classifiers, each of which is trained on a disjoint subset of training data. Moreover, we propose a self-training of deep representation one-class classifiers (STOC) that iteratively refines the data and deep representations. In experiments, we show the efficacy of our method for unsupervised anomaly detection on benchmarks from image and tabular data domains. For example, with a 10% anomaly ratio on CIFAR-10 data, the proposed method outperforms state-of-the-art one-class classification method by 6.3 AUC and 12.5 average precision.

연구 동기 및 목표

  • 모든 학습 데이터가 레이블 없이 정상 및 이상 샘플이 혼합된 비지도 이상 탐지의 과제를 해결한다.
  • 레이블이 없는 이상 샘플이 없는 효과적인 이상 탐지 기반의 높은 비용과 번거로움을 줄인다.
  • 반복적인 데이터 및 표현 개선을 통해 일반화 능력을 향상시키는 견고한 one-class 분류 프레임워크를 개발한다.
  • 실제 비지도 환경에서 이미지 및 표준 데이터 영역의 벤치마크 데이터셋에서 성능 햖थ을 향상시킨다.

제안 방법

  • 서로 겹치지 않는 레이블 없는 학습 데이터 부분집합에 대해 각각 one-class 분류기를 구성하여 강건성과 다양성을 향상시킨다.
  • 앙상블 예측 기반으로 고신뢰도 이상 샘플을 걸러내는 자기학습 메커니즘을 구현하여 반복적으로 학습 데이터를 개선한다.
  • 정상 및 이상 패턴 간의 특징 구분 능력을 향상시키기 위해 대조 학습(contrastive learning) 목적함수를 통해 딥 표현을 업데이트한다.
  • 레이블이 필요 없이 데이터 개선 및 표현 학습 단계를 번갈아 수행하여 분류기 성능을 점진적으로 향상시킨다.
  • 각 자기학습 반복 단계에서 신뢰도 기반 임계값 전략을 사용하여 잠재적인 이상 샘플을 학습 세트에서 제거한다.
  • 앙상블 내 예측 일관성을 활용하여 데이터 개선 및 표현 학습의 신뢰도를 향상시킨다.

실험 결과

연구 질문

  • RQ1서로 다른 데이터 부분집합에 대해 훈련된 one-class 분류기의 앙상블이 비지도 이상 탐지에서 강건성을 향상시키는가?
  • RQ2반복적인 자기학습이 one-class 분류의 데이터 및 딥 표현을 얼마나 효과적으로 개선하는가?
  • RQ3제안된 STOC 프레임워크가 이미지 및 표준 데이터 벤치마크에서 최신 기준(one-class 분류 방법)을 얼마나 뛰어넘는가?
  • RQ4CIFAR-10에서 이상 비율이 10%일 경우 이 방법은 어떻게 성능을 내는가?

주요 결과

  • 제안된 STOC 방법은 CIFAR-10에서 이상 비율이 10%일 때 최신 기준 one-class 분류 방법보다 AUC 6.3점 향상시켰다.
  • 동일한 CIFAR-10 벤치마크에서 평균 정밀도가 12.5점 향상되어 정밀도 민감한 상황에서 뛰어난 성능을 보였다.
  • 앙상블 기반의 데이터 개선 전략이 레이블이 없는 데이터에서 노이즈를 효과적으로 줄여 모델 일반화 능력을 향상시켰다.
  • 반복적인 자기학습 과정은 표현 품질 및 이상 탐지 성능 양면에서 일관된 향상을 이끌어냈다.
  • 이 방법은 도메인 간 일반화 능력이 뛰어나 이미지 및 표준 데이터 벤치마크에서 강력한 성능을 보였다.
  • 학습 데이터에 상당한 비율의 이상 샘플이 포함되어 있어도 높은 성능를 유지하여 오염에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.