Skip to main content
QUICK REVIEW

[논문 리뷰] Clustering with Outlier Removal

Hongfu Liu, Jun Li|arXiv (Cornell University)|2018. 01. 05.
Anomaly Detection Techniques and Applications참고 문헌 49인용 수 6
한 줄 요약

이 논문은 클러스터링과 이상치 탐지의 통합 프레임워크인 이상치 제거를 통한 클러스터링(COR)을 제안한다. 이는 데이터를 이진 분할 공간으로 변환하고, 새로운 허로엔트로피 기반 목적 함수를 사용하여 클러스터링과 이상치 탐지를 동시에 최적화한다. COR는 보조 이진 행렬을 활용하여 완전한 K-means 최적화를 가능하게 하며, 클러스터링의 타당성과 이상치 탐지 정확도에서 최신 기법들을 능가한다. kddcup 데이터셋에서 iForest 대비 170배 빠른 속도를 기록한다.

ABSTRACT

Cluster analysis and outlier detection are strongly coupled tasks in data mining area. Cluster structure can be easily destroyed by few outliers; on the contrary, outliers are defined by the concept of cluster, which are recognized as the points belonging to none of the clusters. Unfortunately, most existing studies do not notice the coupled relationship between these two task and handle them separately. In light of this, we consider the joint cluster analysis and outlier detection problem, and propose the Clustering with Outlier Removal (COR) algorithm. Generally speaking, the original space is transformed into the binary space via generating basic partitions in order to define clusters. Then an objective function based Holoentropy is designed to enhance the compactness of each cluster with a few outliers removed. With further analyses on the objective function, only partial of the problem can be handled by K-means optimization. To provide an integrated solution, an auxiliary binary matrix is nontrivally introduced so that COR completely and efficiently solves the challenging problem via a unified K-means-- with theoretical supports. Extensive experimental results on numerous data sets in various domains demonstrate the effectiveness and efficiency of COR significantly over state-of-the-art methods in terms of cluster validity and outlier detection. Some key factors in COR are further analyzed for practical use. Finally, an application on flight trajectory is provided to demonstrate the effectiveness of COR in the real-world scenario.

연구 동기 및 목표

  • 기존 방법에서 별도로 다루는 클러스터링과 이상치 탐지의 상호의존적 성격을 해결하기 위해.
  • 클러스터의 응집도를 향상시키고 이상치를 동시에 식별하는 공동 최적화 프레임워크를 개발하기 위해.
  • 이상치가 포함된 클러스터링에서 이산 최적화의 한계를 극복하여, 완전한 K-means 기반 해법을 가능하게 하기 위해.
  • 노이즈가 많은 특성에 대한 강건성을 향상시키고, 비행 항로와 같은 실세계 데이터에서의 성능을 향상시키기 위해.

제안 방법

  • 랜덤 매개변수 또는 특성을 사용한 K-means를 통해 생성된 기본 분할을 활용해 원래의 특성 공간을 이진 분할 공간으로 변환한다.
  • 클러스터의 응집도를 향상시키면서 소수의 이상치를 제거하기 위해 허로엔트로피 기반 목적 함수를 제안한다.
  • 이산 최적화 문제를 연속 최적화 문제로 재구성하기 위해 보조 이진 행렬을 도입하여 완전한 K-means 최적화를 가능하게 한다.
  • 합성된 이진 행렬을 사용해 통합 최적화를 수행하며, 수렴성과 효과성에 대한 이론적 근거를 제공한다.
  • 다양한 기본 분할을 생성하기 위해 랜덤 매개변수 선택(RPS)과 랜덤 특성 선택(RFS)을 활용한다.
  • 균일한 샘플링과 클러스터/이상치 설정을 적용해 실세계 비행 항로 데이터에 COR 알고리즘을 적용한다.

실험 결과

연구 질문

  • RQ1분리된 접근 방식에 비해 통합 프레임워크가 클러스터링과 이상치 탐지의 동시에 최적화를 더 효과적으로 수행할 수 있는가?
  • RQ2허로엔트로피 기반 목적 함수는 클러스터의 응집도 향상과 이상치 제거에 어떻게 기여하는가?
  • RQ3보조 이진 행렬이 이산 최적화 문제 환경에서 완전한 K-means 최적화를 얼마나 잘 가능하게 하는가?
  • RQ4다른 기본 분할 생성 전략(RPS 대비 RFS)이 COR의 성능에 어떤 영향을 미치는가?
  • RQ5비행 항로 이상치 탐지와 같은 실세계 응용에서 COR은 높은 정확도와 효율성을 달성할 수 있는가?

주요 결과

  • kddcup 데이터셋에서 RFS를 사용할 경우, COR은 클러스터링 타당성과 이상치 탐지에서 각각 21.18과 34.95의 F-measure 및 Jaccard 스코어를 기록하며, iForest를 5% 이상 초월한다.
  • kddcup 데이터셋에서 iForest 대비 COR(RFS)는 170배 이상 빠른 속도를 기록하면서도 경쟁 가능한 성능을 유지한다.
  • 30개의 기본 분할에서 COR의 성능이 안정화됨을 확인하여, 고품질 결과를 얻기 위해 30개의 분할 수준이 충분함을 시사한다.
  • 노이즈 특성의 영향을 완화하고 더 나은 기본 분할을 생성함으로써, RFS는 shuttle 및 kddcup 데이터셋에서 RPS를 능가한다.
  • COR은 전송 오류로 인한 여분의 범위를 가진 비행 항로 이상치와 센서 장애로 인한 부분 데이터를 가진 이상치 두 가지 유형을 성공적으로 탐지한다.
  • 실세계 비행 항로 데이터에 대한 적용을 통해, COR이 시스템 신뢰성과 데이터 무결성과 관련된 의미 있는 이상치를 효과적으로 식별함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.