Skip to main content
QUICK REVIEW

[논문 리뷰] Statistical Analysis of Nearest Neighbor Methods for Anomaly Detection

Xiaoyi Gu, Leman Akoglu|arXiv (Cornell University)|2019. 07. 08.
Anomaly Detection Techniques and Applications참고 문헌 26인용 수 50
한 줄 요약

본 논문은 신경망 기반 이상 탐지기를 실증적으로 비교하고, 거리-대-측정(DTM)을 이용한 이론적 프레임워크를 제시하며, 허버 contamination 모델 하에서 유한 샘플 보장을 제공합니다.

ABSTRACT

Nearest-neighbor (NN) procedures are well studied and widely used in both supervised and unsupervised learning problems. In this paper we are concerned with investigating the performance of NN-based methods for anomaly detection. We first show through extensive simulations that NN methods compare favorably to some of the other state-of-the-art algorithms for anomaly detection based on a set of benchmark synthetic datasets. We further consider the performance of NN methods on real datasets, and relate it to the dimensionality of the problem. Next, we analyze the theoretical properties of NN-methods for anomaly detection by studying a more general quantity called distance-to-measure (DTM), originally developed in the literature on robust geometric and topological inference. We provide finite-sample uniform guarantees for the empirical DTM and use them to derive misclassification rates for anomalous observations under various settings. In our analysis we rely on Huber's contamination model and formulate mild geometric regularity assumptions on the underlying distribution of the data.

연구 동기 및 목표

  • 비지도 설정에서 합성 및 실데이터에서 NN 기반 이상 탐지 방법을 평가한다.
  • NN 방법을 Isolation Forest, LOF, LODA 등과 같은 최첨단 탐지기와 비교한다.
  • NN 방법을 이론적으로 이해하기 위한 거리-대-측정(DTM)을 기반으로 한 통계적 프레임워크를 개발한다.
  • 경험적 NN 반경 및 DTM 수렴에 대한 유한 샘플 경계를 제공한다.
  • DTM 기반 방법이 정상 점과 이상 점을 신뢰성 있게 구분할 수 있는 조건을 특성화한다.

제안 방법

  • 두 가지 NN 이상 탐지기(k-NN(이웃의 평균 거리) 및 k-th NN(케이-번째 이웃까지의 거리))를 분석한다.
  • NN 방법의 일반화인 거리-대-측정(DTM) 함수als를 도입 및 활용한다(DTM_q, q≥1; DTM_2는 q=2인 표준 DTM에 해당).
  • P와 P_n에 기반한 p-NN 반경 r_p(x)와 경험적 반경 ̂r_p(x)를 대Population 및 경험적 정의를 확립한다.
  • 가정 A0-A2 및 A1 하에서 ̂r_p(x) 및 ̂ d̂(x)(경험적 DTM)에 대해 유한 샘플 균일 한계를 증명한다.
  • Huber contamination 모델 하에서 DTM 기반 이상 탐지의 오류 분류/분리 보장을 도출한다.
  • 보조 보정 증명과 차원 d에 대한 고차원 특성 및 안전 영역(safety zones)에서의 정상 점 분류 적합성을 논의한다.

실험 결과

연구 질문

  • RQ1NN 기반 이상 탐지기(k-NN, k-th NN, 및 DTM_2)가 합성 및 실데이터에서 확립된 방법(I isolation Forest, LOF, LODA 등)과 비교하여 어떻게 성능을 보이는가?
  • RQ2Huber 오염하에서 정상과 이상 관찰을 구분하기 위한 경험적 DTM에 대한 이론적 보장은 무엇인가?
  • RQ3샘플 크기가 커질 때 경험적 NN 반경 및 경험적 DTM이 모집단의 대응값으로 수렴하는가?
  • RQ4데이터 차원이 NN 기반 이상 탐지 방법의 성능과 신뢰성에 어떤 영향을 미치는가?
  • RQ5정확한 분류를 보장하는 유한 샘플 경계의 구체적 수치를 무엇이며, 이는 정상 지원 영역의 깊은 영역(안전 영역)과 경계 근처에서의 차이로 어떻게 나타나는가?

주요 결과

  • NN 기반 탐지기(k-NN, k-th NN, 및 DTM_2)가 벤치마크 합성 데이터셋 및 실데이터 ODDS/UCI에서 최첨단 방법과 경쟁력 있는 성능을 보인다.
  • Isolation Forest는 벤치마크 지표(AUC, AP)에서 종종 가장 낮은 실패율을 달성하며, NN 방법이 그 뒤를 잇는다; 고차원 데이터에서 NN 방법 및 LOF/DTM 변형이 특정 경우 더 강한 성능을 보인다.
  • 고차원 실험에서 NN 방법이 일부 설정에서 Isolation Forest를 능가할 수 있으며, LOF와 DTM 기반 변형이 다른 경우에 더 유리해지는 경향을 보인다.
  • 경험적 NN 반경과 DTM에 대한 균일한 유한 샘플 경계를 도입하여 적절한 조건(A1, 차원 d에 의존)에서 수렴을 보장한다.
  • 일정 깊이의 정상 지원 내부에 안전 영역 A_eta가 존재하며 모집단 DTM이 이상 지원으로부터 분리되므로, 샘플 크기가 충분하고 분리가 적절하면 A_eta 내에서 고확률로 올바르게 분류될 수 있음을 보이는 결정적 분리 결과가 제시된다.
  • 보조 정리들은 경험적 DTM 경계가 실질적인 분류 보장과 연결됨을 보여주며, 충분한 샘플 크기와 규칙성 하에서 A_eta의 모든 점에 대해 고확률 정확성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.