Skip to main content
QUICK REVIEW

[논문 리뷰] Hybridization of Expectation-Maximization and K-Means Algorithms for Better Clustering Performance

D. Raja Kishor, N. Venkateswarlu|arXiv (Cornell University)|2016. 03. 25.
Bayesian Methods and Mixture Models참고 문헌 8인용 수 3
한 줄 요약

이 논문은 수렴 속도를 높이면서도 높은 클러스터링 품질을 유지하기 위해 K-평균과 기대값 최대화(EM) 알고리즘을 융합한 하이브리드 클러스터링 알고리즘을 제안한다. K-평균을 활용해 빠르게 초기 중심점을 추정하고, EM을 통해 정밀한 파라미터 최적화를 수행함으로써, 하이브리드 접근 방식은 실행 시간을 크게 단축시켰다. 이는 일관되게 표준 EM보다 빠른 속도를 보이며, 여섯 개인 데이터셋(합성 데이터 포함)에서 유사하거나 더 낮은 Sum of Squared Errors(SSE)와 비교적 높은 클러스터링 적합도를 유지한다.

ABSTRACT

The present work proposes hybridization of Expectation-Maximization (EM) and K-Means techniques as an attempt to speed-up the clustering process. Though both K-Means and EM techniques look into different areas, K-means can be viewed as an approximate way to obtain maximum likelihood estimates for the means. Along with the proposed algorithm for hybridization, the present work also experiments with the Standard EM algorithm. Six different datasets are used for the experiments of which three are synthetic datasets. Clustering fitness and Sum of Squared Errors (SSE) are computed for measuring the clustering performance. In all the experiments it is observed that the proposed algorithm for hybridization of EM and K-Means techniques is consistently taking less execution time with acceptable Clustering Fitness value and less SSE than the standard EM algorithm. It is also observed that the proposed algorithm is producing better clustering results than the Cluster package of Purdue University.

연구 동기 및 목표

  • 표준 EM 알고리즘의 느린 수렴 문제를 해결하기 위해 더 빠른 K-평균 초기화를 통합함으로써 클러스터링 성능을 향상시키기 위해.
  • 클러스터링 품질을 희생시키지 않은 채 계산 효율성을 향상시키기 위해.
  • K-평균과 EM의 장점을 살린 하이브리드 프레임워크를 개발하여 전체 성능을 향상시키기 위해.
  • 제안된 방법을 표준 EM 및 펜실베이니아 대학교의 클러스터링 패키지(Purdue University's Cluster package)와 비교하기 위해.

제안 방법

  • 하이브리드 알고리즘은 초기 클러스터 중심점과 할당을 계산하기 위해 K-평균을 먼저 수행한다.
  • 이러한 초기 추정치는 이후 EM 알고리즘의 시작점으로 사용되어 최대우도추정을 통해 클러스터 파라미터를 정밀화한다.
  • EM 단계는 E단계(책임도 계산)와 M단계(파라미터 재추정)를 반복적으로 수행하며, 클러스터 평균, 공분산, 혼합 가중치를 업데이트한다.
  • 알고리즘은 수렴이 이루어질 때까지 K-평균 초기화와 EM 정밀화를 번갈아 수행한다.
  • 클러스터링 성능 평가에는 클러스터링 적합도와 제곱합(SSE)을 사용한다.
  • 알고리즘은 데이터 유형에 관계없이 안정성을 확보하기 위해 여섯 개의 데이터셋(세 개의 합성 데이터 포함)에서 테스트된다.

실험 결과

연구 질문

  • RQ1K-평균과 EM을 융합함으로써 실행 시간을 단축시키면서도 클러스터링 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ2하이브리드 접근 방식은 수렴 속도와 클러스터링 품질 측면에서 표준 EM과 비교해 어떻게 다른가?
  • RQ3이러한 하이브리드 방법은 펜실베이니아 대학교의 클러스터링 패키지와 같은 기존 패키지보다 뛰어나게 성능을 발휘하는가?
  • RQ4K-평균 초기화가 클러스터링 작업에서 EM의 수렴 행동을 얼마나 향상시키는가?

주요 결과

  • 하이브리드 알고리즘은 여섯 개의 모든 데이터셋에서 표준 EM 알고리즘보다 일관되게 낮은 실행 시간을 기록했다.
  • 제안된 방법은 표준 EM보다 더 낮은 제곱합(SSE)을 산출하여 더 우수한 클러스터링 밀도를 나타냈다.
  • 클러스터링 적합도 값은 수용 가능하고 경쟁력 있었으며, 하이브리드 접근 방식이 높은 품질의 클러스터링을 유지하고 있음을 보여주었다.
  • 하이브리드 알고리즘은 실행 시간과 클러스터링 품질 지표 모두에서 펜실베이니아 대학교의 클러스터 패키지보다 뛰어났다.
  • K-평균 초기화와 EM 정밀화의 조합은 더 빠른 수렴과 개선된 안정성 있는 클러스터링 결과를 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.