Skip to main content
QUICK REVIEW

[논문 리뷰] Improved histogram-based anomaly detector with the extended principal component features

Sunil Aryal, Arbind Agrahari Baniya|arXiv (Cornell University)|2019. 09. 27.
Anomaly Detection Techniques and Applications참고 문헌 14인용 수 7
한 줄 요약

이 논문은 원본 특징과 주성분(PC)을 조합하여 상관관계가 있는 다차원 패턴을 포착함으로써 검출 정확도를 향상시키는 향상된 히스토그램 기반 이상 탐지기인 SPAD+를 제안한다. 주성분을 통해 특징 공간을 확장함으로써 SPAD+는 유일한 특징에서 이질적인 타입 I(단일 특징 이상치)와 다차원적 이상치인 타입 II를 효과적으로 탐지하며, 런타임 오버헤드를 최소화하면서 기준 SPAD 및 최신 기술보다 뛰어난 성능을 달성한다.

ABSTRACT

In this era of big data, databases are growing rapidly in terms of the number of records. Fast automatic detection of anomalous records in these massive databases is a challenging task. Traditional distance based anomaly detectors are not applicable in these massive datasets. Recently, a simple but extremely fast anomaly detector using one-dimensional histograms has been introduced. The anomaly score of a data instance is computed as the product of the probability mass of histograms in each dimensions where it falls into. It is shown to produce competitive results compared to many state-of-the-art methods in many datasets. Because it assumes data features are independent of each other, it results in poor detection accuracy when there is correlation between features. To address this issue, we propose to increase the feature size by adding more features based on principal components. Our results show that using the original input features together with principal components improves the detection accuracy of histogram-based anomaly detector significantly without compromising much in terms of run-time.

연구 동기 및 목표

  • 단일 특징에서 이질적이지 않지만 다차원 부분공간에서 이상적인 이상치를 탐지하는 데에 한계를 가진 히스토그램 기반 이상 탐지기의 문제를 해결하기 위해.
  • 런타임을 크게 증가시키지 않으면서 SPAD 방법의 탐지 정확도를 향상시키기 위해.
  • 주성분이 단변량 히스토그램이 놓치는 특징 간 상관관계를 포착함으로써 이상 탐지 성능을 향상시킬 수 있는지 탐색하기 위해.
  • 빅데이터에서 이상 탐지에 대한 새로운 빠르고 효과적이며 효율적인 기준을 수립하기 위해.

제안 방법

  • 데이터의 공분산 행렬에서 유도된 주성분(PC)을 추가하여 입력 특징 공간을 확장한다.
  • 원본 특징과 PC의 조합된 특징 공간에 대해 SPAD 알고리즘을 적용하여 이상도를 계산한다.
  • 모든 차원(원본 특징과 PC 포함)의 단변량 히스토그램 확률의 곱으로 이상도 점수를 계산한다.
  • PCA를 사용하여 상관관계가 있는 입력 특징을 상호 독립적이고 직교적인 성분으로 변환하여 선형 관계를 포착한다.
  • 히스토그램 기반 점수 계산 방식을 유지함으로써 계산 효율성을 확보한다. 이 방식은 본질적으로 빠르고 확장 가능하다.
  • 원본 특징은 타입 I 이상치를 탐지하고, PC는 상관관계가 있는 부분공간에서의 타입 II 이상치를 탐지하는 데 상호보완적인 강점을 활용한다.

실험 결과

연구 질문

  • RQ1특징 공간에 주성분을 추가하면, 단일 히스토그램으로는 탐지할 수 없는 이상치의 탐지 성능을 향상시킬 수 있는가?
  • RQ2PC를 포함시켜도 SPAD 알고리즘의 성능 향상이 뚜렷하지만, 상당한 계산 비용이 발생하는가?
  • RQ3정확도와 런타임 측면에서 SPAD+는 기존의 k-NN 및 기타 빠른 이상 탐지 방법과 비교해 어떻게 성과를 내는가?
  • RQ4LOF나 iForest와 같은 방법들은 PC를 추가해도 성능 향상이 없지만, SPAD+는 왜 성능 향상이 이루어지는가?

주요 결과

  • SPAD+는 15개의 벤치마크 데이터셋에서 SPAD보다 탐지 정확도를 크게 향상시켰으며, AUC 평균이 0.8432에서 0.8662로 상승했다.
  • SPAD+는 AUC 측면에서 k-NN 및 iForest를 모두 능가하여 모든 데이터셋에서 평균 AUC 0.8662를 기록하며 최고의 성능를 달성했다.
  • 높은 속도를 유지하여 대부분의 기존 빠른 이상 탐지 알고리즘보다 빠르게 동작하여 빅데이터 환경에 적합하다.
  • LOF와 iForest에 PC를 추가해도 성능 향상이 없었는데, 이는 이들의 이상도 점수가 이미 다차원적 거리나 무작위 분할 기반으로 계산되기 때문에 PC가 중복되거나 오해의 소지가 있는 요소가 되기 때문이다.
  • SPAD+는 상관관계가 있는 PC를 활용함으로써 개별 특징에서는 정상이지만 공동 부분공간에서 이상적인 타입 II 이상치를 효과적으로 탐지한다.
  • SPAD+에서 PC를 사용함으로써 iForest에서 흔히 발생하는 가짜 이상치를 방지할 수 있었는데, 이는 PC가 직교적이기 때문에 인위적인 상관관계를 유도하지 않기 때문이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.