Skip to main content
QUICK REVIEW

[논문 리뷰] Outlier Detection by Consistent Data Selection Method

Utkarsh Porwal, Smruthi Mukund|arXiv (Cornell University)|2017. 12. 12.
Anomaly Detection Techniques and Applications참고 문헌 24인용 수 3
한 줄 요약

이 논문은 먼저 여러 k값을 사용한 k-means 군집화 앙상블를 통해 일관된(비이상치) 데이터 포인트를 식별한 후, 나머지 데이터에 대해 일종의 분류기를 적용하여 이상치를 탐지하는 이단계 이상치 탐지 방법을 제안한다. 이 방법은 정상 또는 이상 패턴에 대한 사전 지식이 없이도 UCI 데이터셋에서 경쟁적인 성능을 달성하며, 정상 및 이상 클래스 모두에 대해 고품질의 훈련 샘플을 신속하게 구축할 수 있다.

ABSTRACT

Often the challenge associated with tasks like fraud and spam detection[1] is the lack of all likely patterns needed to train suitable supervised learning models. In order to overcome this limitation, such tasks are attempted as outlier or anomaly detection tasks. We also hypothesize that out- liers have behavioral patterns that change over time. Limited data and continuously changing patterns makes learning significantly difficult. In this work we are proposing an approach that detects outliers in large data sets by relying on data points that are consistent. The primary contribution of this work is that it will quickly help retrieve samples for both consistent and non-outlier data sets and is also mindful of new outlier patterns. No prior knowledge of each set is required to extract the samples. The method consists of two phases, in the first phase, consistent data points (non- outliers) are retrieved by an ensemble method of unsupervised clustering techniques and in the second phase a one class classifier trained on the consistent data point set is ap- plied on the remaining sample set to identify the outliers. The approach is tested on three publicly available data sets and the performance scores are competitive.

연구 동기 및 목표

  • 정상 또는 이상 패턴에 대한 레이블이 제한적이거나 전혀 없는 상황에서 이상치 탐지 문제를 해결하기 위해.
  • 대규모 고차원 데이터셋에서 일관된(정상적인) 행동의 대표 샘플을 효율적으로 추출할 수 있는 확장 가능한 방법을 개발하기 위해.
  • 특히 새로운 유형의 사기 패턴을 탐지하는 데 유용한, 일관된 샘플과 이상 샘플을 신속하게 구축하기 위해.
  • 이상치를 직접 모델링하는 대신 안정적이고 변동성이 낮은 데이터 포인트를 식별하는 데 초점을 맞춰 진정한 데이터에 대한 의존도를 줄이기 위해.
  • 대규모 데이터 처리를 위한 분산 시스템에서 쉽게 구현할 수 있도록 설계하기 위해.

제안 방법

  • 방법은 데이터셋에 대해 다양한 k값(예: 10에서 1500까지)을 사용해 k-means 군집화를 적용하여 다수의 군집화 결과를 생성함으로써 시작된다.
  • 각 데이터 포인트에 대해, 각 군집화에서 중심점까지의 거리를 기반으로 평균 유사도 점수가 계산되며, 이는 부분공간 간의 일관성 정도를 측정하는 척도로 기능한다.
  • 높은 평균 유사도 점수(임계값 이상)를 가진 데이터 포인트는 일관된 데이터 풀로 선택되며, 이는 안정적이고 정상적인 행동을 나타낸다.
  • 일종의 분류기(예: 다항식 커널을 사용한 일종의 SVM)가 일관된 데이터 포인트에만 전용으로 훈련되어 정상 행동의 경계를 학습한다.
  • 훈련된 일종의 분류기가 나머지 데이터(일관되지 않은 풀)에 적용되어 이상치를 식별한다.
  • 이 방법은 확장성과 분산 처리를 고려하여 설계되었으며, 고차원적이고 상관관계가 있는 데이터에서 강건성을 확보하기 위해 앙상블 군집화와 유사도 점수를 활용한다.

실험 결과

연구 질문

  • RQ1정상 또는 이상 패턴에 대한 사전 지식이 없이도 고차원적이고 대규모 데이터셋에서 일관된 데이터 포인트를 신뢰성 있게 식별할 수 있는가?
  • RQ2다양한 k값을 사용한 k-means 군집화의 앙상블가 안정적이고 변동성이 낮은 데이터 포인트(정상 행동을 나타냄)를 탐지하는 데 얼마나 효과적인가?
  • RQ3추출된 일관된 데이터셋에 기반한 일종의 분류기가 높은 정밀도와 재현율로 이상치를 탐지할 수 있는 정도는 어느 정도인가?
  • RQ4다양한 실제 데이터셋(이상치 비율과 데이터 구조가 상이함)에서 이 방법의 성능은 어떻게 되는가?
  • RQ5일관된 데이터 선택 과정을 활용하여 비지도 학습 방식으로 정상 및 이상 클래스 모두에 대해 고품질의 훈련 샘플을 구축할 수 있는가?

주요 결과

  • 이온오로스피어 데이터셋에서 일관된 데이터 풀은 275개의 양성과 오직 20개의 음성으로 구성되어 있어 정상 행동와 이상 행동 간의 강력한 분리가 이루어졌음을 나타낸다.
  • 심부전 데이터셋에서는 일관된 풀이 275개의 양성과 20개의 음성을 포함했으며, 나머지 111개의 양성과 45개의 음성이 일관되지 않은 풀에 포함되어 있어, 이 방법이 대부분의 이상치를 효과적으로 분리함을 보여준다.
  • 머스크 데이터셋의 경우 일관된 풀에는 5,538개의 양성과 음성이 전혀 없었고, 일관되지 않은 풀에는 42개의 양성과 1,017개의 음성이 있었으며, 이는 일관된 집합의 높은 순도를 보여준다.
  • 머스크 데이터셋에서 일관된 데이터에 기반한 일종의 분류기가 음성 샘플 1,017개를 모두 정확히 탐지했으며, 양성 샘플 중에서 오직 15개의 오진 양성만 발생시켰다.
  • 이 방법은 군집화에 사용된 k값의 선택에 매우 민감하게 반응했으며, 낮은 k값을 사용할 경우 이상치가 잘못 군집화되는 등 성능이 열 劣하다.
  • 평균 유사도 점수는 일관되지 않은 샘플을 우선순위에 따라 정렬하는 데 효과적인 메트릭으로 기능하여, 후속 수동 또는 자동 검토를 위한 효율적인 이상치 탐지가 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.