Skip to main content
QUICK REVIEW

[논문 리뷰] Comparison of Outlier Detection Techniques for Structured Data

Amulya Agarwal, Nitin Gupta|arXiv (Cornell University)|2021. 06. 16.
Anomaly Detection Techniques and Applications참고 문헌 35인용 수 6
한 줄 요약

이 논문은 구조적 표본 데이터에서 거리, 선형 모델, 앙상블, 확률적 카테고리에 속하는 15가지 이상치 탐지 기법을 비교한다. 14개의 데이터셋을 통해 정밀도, 재현도, 분류 정확도를 사용하여 기계 학습 모델 성능에 미치는 영향을 평가하였으며, 보편적으로 최적의 방법이 존재하지는 않지만, 이상치 제거 후 모델 성능 향상에 가장 일관되게 기여한 ABOD와 OCSVM을 규명하였다.

ABSTRACT

An outlier is an observation or a data point that is far from rest of the data points in a given dataset or we can be said that an outlier is away from the center of mass of observations. Presence of outliers can skew statistical measures and data distributions which can lead to misleading representation of the underlying data and relationships. It is seen that the removal of outliers from the training dataset before modeling can give better predictions. With the advancement of machine learning, the outlier detection models are also advancing at a good pace. The goal of this work is to highlight and compare some of the existing outlier detection techniques for the data scientists to use that information for outlier algorithm selection while building a machine learning model.

연구 동기 및 목표

  • 구조적 표본 데이터셋에 대한 15가지 이상치 탐지 기법의 종합적 비교를 제공하는 것.
  • 각 기법으로 탐지된 이상치를 제거함으로써 후속 기계 학습 모델 성능에 미치는 영향을 평가하는 것.
  • 다양한 데이터셋에서의 경험적 성능에 기반해 데이터 과학자들이 적절한 이상치 탐지 알고리즘을 선택하는 데 도움을 주는 것.
  • 여러 분류기와 데이터셋에서 일관되게 모델 정확도와 강건성을 향상시키는 이상치 탐지 기법을 규명하는 것.

제안 방법

  • 15가지 이상치 탐지 알고리즘 평가: LOF, KNN, CBLOF, ABOD, HBOS, MCD, OCSVM, COF, PCA, F.Bagging, Isolation Forest, SOD, LODA, LSCP, CPOD.
  • 각 이상치 탐지 기법을 14개의 벤치마크 데이터셋에 적용한 후, 훈련 데이터에서 탐지된 이상치를 제거하고 모델을 재학습시켰다.
  • 각 데이터셋에서 이상치 탐지 성능 평가에 주로 정밀도와 재현도를 사용하였다.
  • 원본 데이터셋과 이상치 제거된 데이터셋을 사용하여 다양한 분류기(예: 로지스틱 회귀, 랜덤 포레스트, 결정 트리)를 훈련하고 평가하여 성능 변화를 측정하였다.
  • 모든 데이터셋에 걸쳐 평균 정밀도와 재현도를 계산하여 전체 이상치 탐지 성능 순위를 매겼다.
  • 제거된 이상치에 의해 모델 정확도가 평균적으로 얼마나 향상되었는지 분석하기 위해 분석적 분석(A/B testing)을 수행하였다.

실험 결과

연구 질문

  • RQ1다양한 구조적 데이터셋에서 평균 정밀도와 재현도가 가장 높은 이상치 탐지 기법은 무엇인가?
  • RQ2각 기법으로 탐지된 이상치를 제거함으로써 후속 기계 학습 모델의 성능에 어떤 영향을 미치는가?
  • RQ3여러 분류기와 데이터셋에서 일관되게 모델 정확도를 향상시키는 특정 이상치 탐지 기법이 존재하는가?
  • RQ4다양한 데이터 분포와 특징 공간에서 가장 강건한 성능을 보이는 이상치 탐지 기법은 무엇인가?
  • RQ5보편적으로 최적의 이상치 탐지 접근 방식이 존재하는가, 아니면 성능이 데이터셋과 모델 유형에 따라 크게 달라지는가?

주요 결과

  • ABOD와 OCSVM은 후속 모델 성능 향상에 가장 효과적인 이상치 탐지 기법이었으며, ABOD는 다양한 분류기에서 평균적으로 가장 높은 향상을 보였다.
  • CBLOF는 평균적으로 가장 높은 평균 정밀도(0.46)와 재현도(0.34)를 기록하여, 다른 방법들보다 이상치 탐지 능력에서 뛰어났다.
  • 14개의 데이터셋 중에서, 15가지 이상치 탐지 기법 모두 최소 두 개 이상의 데이터셋에서 모델 성능을 향상시켰으며, 이는 광범위한 유용성을 시사한다.
  • 랜덤 포레스트의 경우, ABOD, HBOS, OCSVM, PCA, LODA가 모델 정확도 향상에서 가장 일관된 성과를 보였다.
  • 결정 트리의 경우, ABOD, CBLOF, HBOS, OCSVM, LSCP, LODA가 다른 기법들보다 성능 향상에서 뛰어났다.
  • 로지스틱 회귀의 경우, ABOD, OCSVM, KNN, Avg KNN, SOD가 이상치 제거 후 가장 우수한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.