Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervise, Refine, Repeat: Improving Unsupervised Anomaly Detection

Jinsung Yoon, Kihyuk Sohn|arXiv (Cornell University)|2021. 06. 11.
Anomaly Detection Techniques and Applications인용 수 9
한 줄 요약

이 논문은 자기지도 학습, 개선, 반복을 반복하는 SRR(Self-supervise, Refine, Repeat)를 제안한다. 이는 정규 및 이상 샘플이 레이블 없이 혼합된 훈련 데이터를 기반으로 하여, 일련의 일방적 분류기(OCCs)의 앙상블을 이용해 훈련 데이터를 개선함으로써 모델의 강건성을 점진적으로 향상시키는 데이터 중심의 프레임워크이다. 자기지도 표현과 공감 기반 데이터 개선을 활용하여 SRR는 최신 기술 수준(SOTA)의 성능을 달성하였으며, CIFAR-10 및 갑상선 데이터셋에서 각각 AUC를 6.3점, F1 점수를 22.9점 향상시켰다. 이는 높은 이상 비율 조건에서도 성능을 유지를 하였다.

ABSTRACT

Anomaly detection (AD), separating anomalies from normal data, has many applications across domains, from security to healthcare. While most previous works were shown to be effective for cases with fully or partially labeled data, that setting is in practice less common due to labeling being particularly tedious for this task. In this paper, we focus on fully unsupervised AD, in which the entire training dataset, containing both normal and anomalous samples, is unlabeled. To tackle this problem effectively, we propose to improve the robustness of one-class classification trained on self-supervised representations using a data refinement process. Our proposed data refinement approach is based on an ensemble of one-class classifiers (OCCs), each of which is trained on a disjoint subset of training data. Representations learned by self-supervised learning on the refined data are iteratively updated as the data refinement improves. We demonstrate our method on various unsupervised AD tasks with image and tabular data. With a 10% anomaly ratio on CIFAR-10 image data / 2.5% anomaly ratio on Thyroid tabular data, the proposed method outperforms the state-of-the-art one-class classifier by 6.3 AUC and 12.5 average precision / 22.9 F1-score.

연구 동기 및 목표

  • 레이블 없이 정규 및 이상 샘플이 혼합된 훈련 데이터에서 완전히 비지도 이상 탐지 문제를 해결하기 위해.
  • 레이블이 전혀 없는 조건에서 자기지도 표현에 기반한 일방적 분류기(OCCs)의 강건성을 향상시키기 위해.
  • 여러 개의 OCCs 간의 공감 기반으로 잠재적인 이상 샘플을 반복적으로 제거하는 데이터 개선 기법을 개발하기 위해.
  • 진짜 이상 비율을 사전에 알지 못하는 상황에서도 Otsu의 방법을 통합하여 자동으로 임계값을 선택함으로써 프레임워크가 작동하도록 하기 위해.
  • 실제 비지도 환경에서 다양한 데이터셋(이미지 및 표본 데이터 포함)에 대해 최신 기술 수준의 성능을 입증하기 위해.

제안 방법

  • 프레임워크는 레이블이 없는 훈련 데이터의 서로 다른 부분에 대해 훈련된 일련의 OCCs 앙상블을 활용한다.
  • 모든 OCCs가 동일한 결과를 내야만 샘플을 정상으로 분류함으로써, 공감 기반의 데이터 개선을 통해 후보 이상 샘플을 제거한다.
  • 개선된 데이터로부터 자기지도 표현을 학습하고, 다중 반복 개선 루프를 통해 반복적으로 업데이트한다.
  • 최종 이상 탐지 모델은 자기지도 대비 학습 기반의 표현 품질 향상을 위해 개선된 데이터를 기반으로 학습된다.
  • 이상 비율을 알 수 없는 경우, 정상성 점수 분포를 기반으로 Otsu의 방법을 사용해 하이퍼파라미터 γ에 대한 임계값을 자동으로 결정한다.
  • 프레임워크는 탄력적이며, 어떤 OCC와도 조합 가능하고, 원시 데이터 또는 학습된 표현에 적용 가능하다.

실험 결과

연구 질문

  • RQ1앙상블 OCCs를 활용한 반복적 데이터 개선이 완전히 비지도 이상 탐지 환경에서 일방적 분류기의 강건성을 향상시킬 수 있는가?
  • RQ2레이블이 없는 데이터에 이상 샘플이 포함된 경우 최신 기술 수준의 OCCs 성능가 어떻게 저하되며, 이를 완화할 수 있는가?
  • RQ3반복적 데이터 개선과 결합된 자기지도 표현이 이상 탐지 성능에 얼마나 기여하는가?
  • RQ4Otsu의 방법이 진짜 이상 비율 지식 없이 SRR 프레임워크에서 자동 임계값 선택에 효과적으로 작용할 수 있는가?
  • RQ5SRR는 다양한 데이터셋, 특히 이미지 및 표본 데이터에서 이상 비율이 다양할 경우 어떻게 성능을 발휘하는가?

주요 결과

  • 10% 이상 비율을 가진 CIFAR-10에서 SRR는 최신 기술 수준의 OCC 대비 AUC 6.3점 향상 및 평균 정밀도 12.5점 향상되었다.
  • 2.5% 이상 비율을 가진 갑상선 데이터셋에서 SRR는 최신 기술 수준의 OCC 대비 F1 점수 22.9점 향상되었다.
  • 높은 이상 비율 조건에서도 SRR는 강건성을 유지하였으며, 이는 이전 OCCs가 심각하게 성능 저하되는 상황과 대비된다.
  • 진짜 이상 비율을 알지 못하는 상황에서 Otsu의 방법을 사용한 자동 임계값 선택 조건에서도 SRR는 CIFAR-10에서 SOTA OCC 대비 AUC 5.1점, 갑상선 데이터셋에서 F1 점수 11.7점 향상되었다.
  • 진짜 이상 비율을 알고 있는 경우와 비교했을 때 Otsu의 방법 통합으로 인한 성능 저하가 미미하여, 실제 환경에서의 효과성을 확인하였다.
  • 광범위한 추상화 연구를 통해 앙상블 기반 개선과 반복적 자기지도 학습이 성능 향상에 핵심적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.