Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Performance of Unsupervised Method by Renovated K-Means

P. Ashok, G. M. Kadhar Nawaz|arXiv (Cornell University)|2013. 03. 11.
Advanced Clustering Algorithms Research참고 문헌 4인용 수 4
한 줄 요약

이 논문은 Iris 및 Wine 데이터셋에서 유클리드, 맨하탄, 민코프스키 거리 함수 세 가지를 평가함으로써 비지도 군집 성능을 향상시키는 개선된 K-평균 알고리즘을 제안한다. 기존의 표준 K-평균, 정적 가중치 K-평균, 동적 가중치 K-평균과 비교해 더 낮은 Davies-Bouldin 지수, 단축된 실행 시간, 적은 반복 횟수를 기록하며 우수한 성능을 보이며, 특히 민코프스키 거리에서 최적의 성능을 보였다.

ABSTRACT

Clustering is a separation of data into groups of similar objects. Every group called cluster consists of objects that are similar to one another and dissimilar to objects of other groups. In this paper, the K-Means algorithm is implemented by three distance functions and to identify the optimal distance function for clustering methods. The proposed K-Means algorithm is compared with K-Means, Static Weighted K-Means (SWK-Means) and Dynamic Weighted K-Means (DWK-Means) algorithm by using Davis Bouldin index, Execution Time and Iteration count methods. Experimental results show that the proposed K-Means algorithm performed better on Iris and Wine dataset when compared with other three clustering methods.

연구 동기 및 목표

  • K-평균 알고리즘을 개선하여 비지도 군집 방법의 성능을 향상시키는 것.
  • 군집 효율성과 정확도를 고려해 유클리드, 맨하탄, 민코프스키 중 최적의 거리 함수를 평가하고 규명하는 것.
  • 기존 방법인 표준 K-평균, 정적 가중치 K-평균(SWK-Means), 동적 가중치 K-평균(DWK-Means)과의 비교를 수행하는 것.
  • Davies-Bouldin 지수, 실행 시간, 반복 횟수와 같은 표준 지표를 사용해 성능을 평가하는 것.
  • 기본 데이터셋인 Iris 및 Wine에서 제안된 방법을 검증하는 것.

제안 방법

  • K-평균 알고리즘은 유클리드, 맨하탄, 민코프스키 거리 함수 세 가지를 사용해 구현되었다.
  • 거리 함수의 선택이 군집 품질과 계산 효율성에 미치는 영향을 체계적으로 평가하기 위해 거리 함수를 분석하였다.
  • 군집의 밀도와 분리도를 평가하기 위해 Davies-Bouldin 지수를 사용하여 성능을 측정하였다.
  • 계산 오버헤드와 수렴 속도를 평가하기 위해 실행 시간과 반복 횟수를 기록하였다.
  • 동일한 실험 조건에서 표준 K-평균, SWK-Means, DWK-Means와의 비교를 위해 벤치마크를 수행하였다.
  • 알고리즘은 군집 특성을 지닌 표준 기준 데이터셋인 Iris 및 Wine에서 테스트되었다.

실험 결과

연구 질문

  • RQ1K-평균 프레임워크에서 유클리드, 맨하탄, 민코프스키 중 어떤 거리 함수가 가장 뛰어난 군집 성능을 낼 수 있는가?
  • RQ2제안된 개선된 K-평균 알고리즘이 표준 K-평균과 비교해 실행 시간과 수렴 속도 측면에서 어떻게 다른가?
  • RQ3여러 거리 함수의 통합이 Davies-Bouldin 지수로 측정된 군집 품질 향상에 기여하는가?
  • RQ4SWK-Means 및 DWK-Means와 비교해 제안된 방법은 군집 타당성과 계산 효율성 측면에서 어떻게 성능을 내는가?
  • RQ5최적화된 거리 함수의 사용이 실세계 데이터셋인 Iris 및 Wine에서 더 안정적이고 정확한 군집을 이끌 수 있는가?

주요 결과

  • 제안된 K-평균 알고리즘은 Iris 및 Wine 데이터셋에서 표준 K-평균, SWK-Means, DWK-Means보다 낮은 Davies-Bouldin 지수를 기록하여 더 우수한 군집 품질을 보였다.
  • 민코프스키 거리 함수는 정확도와 안정성 측면에서 유클리드 및 맨하탄 거리 함수를 모두 초월했다.
  • 기본 K-평균 및 가중치 변형보다 수렴에 더 적은 반복 횟수가 필요로 했다.
  • 특히 Wine 데이터셋에서 실행 시간이 단축되어 계산 효율성이 향상됨을 입증했다.
  • 최적화된 거리 함수와 K-평균 개선의 조합이 모든 평가 지표에서 군집 성능 향상에 명백한 기여를 하였다.
  • 결과는 거리 함수 선택이 군집 결과에 상당한 영향을 미치며, 민코프스키 거리 함수가 정확도와 효율성 사이의 최적의 균형을 제공함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.