Skip to main content
QUICK REVIEW

[논문 리뷰] MSD-Kmeans: A Novel Algorithm for Efficient Detection of Global and Local Outliers

Yuanyuan Wei, Julian Jang‐Jaccard|arXiv (Cornell University)|2019. 10. 15.
Anomaly Detection Techniques and Applications참고 문헌 30인용 수 8
한 줄 요약

이 논문은 먼저 평균과 표준편차(MSD)를 사용해 노이즈 데이터를 걸러내고, 이후 K-means 군집화를 통해 전역 및 국소 이상치를 탐지하는 하이브리드 이상치 탐지 알고리즘인 MSD-Kmeans를 제안한다. 뉴욕 시티 택시 요금 데이터를 대상으로 평가한 결과, MSD-Kmeans는 정밀도(98.6%), 정확도(97.4%), F-measure(98.6%)가 가장 높았으며, 단독으로 사용된 MSD, K-means, Z-score, MIQR, LOF보다도 이상치 탐지 성능이 뛰어나면서도 더 낮은 거짓 양성 비율을 기록했다.

ABSTRACT

Outlier detection is a technique in data mining that aims to detect unusual or unexpected records in the dataset. Existing outlier detection algorithms have different pros and cons and exhibit different sensitivity to noisy data such as extreme values. In this paper, we propose a novel cluster-based outlier detection algorithm named MSD-Kmeans that combines the statistical method of Mean and Standard Deviation (MSD) and the machine learning clustering algorithm K-means to detect outliers more accurately with the better control of extreme values. There are two phases in this combination method of MSD-Kmeans: (1) applying MSD algorithm to eliminate as many noisy data to minimize the interference on clusters, and (2) applying K-means algorithm to obtain local optimal clusters. We evaluate our algorithm and demonstrate its effectiveness in the context of detecting possible overcharging of taxi fares, as greedy dishonest drivers may attempt to charge high fares by detouring. We compare the performance indicators of MSD-Kmeans with those of other outlier detection algorithms, such as MSD, K-means, Z-score, MIQR and LOF, and prove that the proposed MSD-Kmeans algorithm achieves the highest measure of precision, accuracy, and F-measure. We conclude that MSD-Kmeans can be used for effective and efficient outlier detection on data of varying quality on IoT devices.

연구 동기 및 목표

  • 대규모이고 노이즈가 많은 IoT 데이터셋에서 택시 요금 이상치를 탐지하는 데 도전 과제를 해결하기 위해.
  • 극단치가 군집화 알고리즘에 미치는 간섭을 줄여 이상치 탐지 정확도를 향상시키기 위해.
  • 통계적 필터링(MSD)과 기계학습 군집화(K-means)를 융합한 하이브리드 방법을 개발하여 강력한 이상치 탐지 능력을 확보하기 위해.
  • 실제 택시 요금 데이터를 대상으로 제안된 방법을 평가하고 기존의 이상치 탐지 알고리즘과 성능을 비교하기 위해.
  • 복잡하고 대용량의 데이터셋에서 MSD-Kmeans 알고리즘이 확장성과 효율성을 얼마나 잘 갖추고 있는지 입증하기 위해.

제안 방법

  • 알고리즘은 군집화 이전에 극단치를 식별하고 제거하기 위해 사전 처리 단계에서 평균과 표준편차(MSD) 방법을 적용한다.
  • 이중 단계 접근 방식을 사용한다: 첫째, MSD는 노이즈 데이터를 걸러내어 군집 형성 시 왜곡을 최소화한다; 둘째, 정제된 데이터셋에서 K-means가 군집화를 수행한다.
  • K-means 군집화 단계는 정규화된 요금 값 기반으로 국소 최적의 군집을 식별하여 전역 및 국소 이상치를 탐지할 수 있도록 한다.
  • 성능 평가는 표준 지표인 진짜 양성 비율(TPR), 거짓 양성 비율(FPR), 정밀도, 정확도, 재현율, F-measure를 사용하여 평가한다.
  • 특히 다중 코어 또는 GPU 기반 IoT 장치에서의 계산 효율성을 향상시키기 위해 K-means 단계를 병렬 처리하여 알고리즘을 추가 최적화한다.
  • 알고리즘은 뉴욕 옐로우 택시 데이터셋(1.71GB, 2016년 1월)을 대상으로 테스트되었으며, 이상치 탐지 기준 특성으로 요금 금액을 집중적으로 분석하였다.

실험 결과

연구 질문

  • RQ1MSD와 K-means를 융합함으로써 노이즈 데이터에 대한 민감도를 줄이고 이상치 탐지 정확도를 향상시킬 수 있는가?
  • RQ2MSD-Kmeans는 단독으로 사용된 MSD, K-means, Z-score, MIQR, LOF와 비교해 택시 요금 사기 탐지에서 어떻게 성능을 내는가?
  • RQ3이중 단계 사전 처리 및 군집화 접근 방식은 이상치 탐지에서 거짓 양성 비율을 얼마나 줄이는가?
  • RQ4K-means 단계의 병렬 처리가 대규모 IoT 데이터셋에서 MSD-Kmeans의 런타임 효율성을 뚜렷이 향상시킬 수 있는가?
  • RQ5MSD-Kmeans는 단변량 요금 데이터에서 전역 및 국소 이상치를 효과적으로 탐지할 수 있으며, 다변량 특성 탐지에 대해서도 확장 가능한가?

주요 결과

  • MSD-Kmeans는 평가된 모든 알고리즘 중에서 가장 높은 F-measure(98.6%)를 기록하여 정밀도와 재현율 사이의 최적 균형을 확보했다.
  • 알고리즘은 가장 높은 정밀도(98.6%)와 정확도(97.4%)를 기록하여 진짜 이상치를 탐지하는 데서 뛰어난 정확성을 입증했다.
  • MSD-Kmeans는 가장 낮은 거짓 양성 비율(11.6%)을 기록하여 모든 다른 알고리즘보다 잘못된 이상치 탐지 비율을 크게 낮췄다.
  • MSD, Z-score, 또는 단독 K-means보다 진짜 양성 비율이 낮음에도 불구하고, 노이즈 간섭이 감소함에 따라 전체 성능이 뛰어나지 못한 것은 아님을 입증했다.
  • 병렬 처리된 버전의 MSD-Kmeans는 런타임을 842ms로 단축시켜 K-means(1,132ms)와 LOF(31,483ms)보다 훨씬 빠르게 계산 효율성을 향상시켰다.
  • 하이브리드 접근 방식은 MSD와 K-means 양쪽 모두 극단치에 대한 민감도를 효과적으로 완화시켜 노이즈가 많은 택시 요금 데이터에서 개별 방법보다 더 강력한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.