Skip to main content
QUICK REVIEW

[논문 리뷰] Estimating the Number of Clusters via Normalized Cluster Instability

Jonas M B Haslbeck, Dirk U. Wulff|arXiv (Cornell University)|2016. 08. 26.
Data Analysis with R참고 문헌 14인용 수 3
한 줄 요약

이 논문은 군집 크기 분포의 영향을 보정하는 정규화된 군집 불안정도 측도를 제안하며, 특히 큰 k에 대해 k-평균 군집 수 추정의 정확도를 크게 향상시킨다. 이 방법은 정규화되지 않은 불안정도 측도를 능가하며, 가우시안 혼합 모델과 같은 거리 기반 방법과 견줄 만큼의 성능을 보이며, 모델 기반 및 모델 자유형 불안정도 접근 방식은 유사한 성능을 보인다.

ABSTRACT

We improve current instability-based methods for the selection of the number of clusters $k$ in cluster analysis by developing a normalized cluster instability measure that corrects for the distribution of cluster sizes, a previously unaccounted driver of cluster instability. We show that our normalized instability measure outperforms current instability-based measures across the whole sequence of possible $k$ and especially overcomes limitations in the context of large $k$. We also compare, for the first time, model-based and model-free approaches to determine cluster-instability and find their performance to be comparable. We make our method available in the R-package \verb+cstab+.

연구 동기 및 목표

  • 기존의 불안정도 기반 방법이 k가 크거나 군집 크기가 균형 잡히지 않은 경우에 한계를 보이는 데 대비하여 이를 해결하는 것.
  • 기존 방법이 편향을 받는 군집 크기 분포 M이 불안정도에 미치는 혼동 효과를 보정하는 것.
  • 모델 기반 및 모델 자유형 접근 방식을 체계적으로 처음으로 비교하는 것.
  • 다양한 군집 환경에서 안정성 기반 k-선택을 향상시키는 새로운 정규화된 불안정도 측도를 개발하고 검증하는 것.

제안 방법

  • 군집 크기 분포 M에 의한 기대 우연 일치를 고려하여 원시 군집 거리 d^r(ψ_a, ψ_b)를 보정하는 정규화된 불안정도 측도 d^n(ψ_a, ψ_b)를 제안한다.
  • 데이터의 다수의 변형(부트스트랩)을 통해 불안정도를 추정하고, 객체 쌍 간 평균 불일치를 추정하기 위해 평균화를 수행한다.
  • 랜드 지수의 기대값을 기반으로 한 보정 인자를 유도하며, 이는 군집 크기 분포 M에 따라 달라진다.
  • 다양한 k 값에 대해 정규화된 불안정도 측도를 적용하고, 불안정도가 최소가 되는 k를 군집 수로 추정한다.
  • 불안정도 계산을 위해 모델 기반(파라미터 부트스트랩) 및 모델 자유형(비모수 부트스트랩) 전략을 모두 활용한다.
  • 다양한 k* 및 군집 형태(원형 대 비장형)를 가진 네 가지 합성 군집 시나리오에서 광범위한 시뮬레이션을 통해 방법을 검증한다.

실험 결과

연구 질문

  • RQ1군집 크기 분포 M이 불안정도 측도의 k-선택 성능에 어떤 영향을 미치는가?
  • RQ2M를 보정하는 정규화된 불안정도 측도가 전체 k 범위에서, 특히 큰 k에 대해 k-추정 정확도를 향상시킬 수 있는가?
  • RQ3모델 기반 및 모델 자유형 불안정도 계산 접근 방식의 성능 및 수렴 특성은 어떻게 비교되는가?
  • RQ4제안된 정규화가 안정성 기반 방법이 기존의 거리 기반 k-선택 방법(예: Gap 통계량 또는 가우시안 혼합 모델)을 능가하도록 할 수 있는가?
  • RQ5부트스트랩 샘플 수 B가 증가함에 따라 모델 기반 및 모델 자유형 불안정도 추정치의 수렴 행동은 어떠한가?

주요 결과

  • 정규화된 불안정도 측도는 모든 테스트된 k 값에서 정규화되지 않은 불안정도 방법보다 유의미하게 뛰어나며, 특히 큰 k 또는 불균형한 군집 크기를 가진 경우에 뛰어난 성능을 보인다.
  • k*=7이고 군집이 비장형일 경우, 정규화되지 않은 방법은 완전히 실패했으며 성능이 0으로 떨어졌지만, 정규화된 방법은 상당한 비율로 k*를 정확히 식별했다.
  • 가우시안 혼합 모델은 여전히 거리 기반 방법 중 최고의 성능을 보였지만, 정규화된 불안정도 방법은 Gap 통계량 및 점프 통계량을 포함한 모든 다른 거리 기반 방법을 능가했다.
  • 모델 기반 및 모델 자유형 불안정도 접근 방식은 거의 동일한 성능를 보였으며, 둘 간의 불안정도 경로 간 상관계수는 0.98에서 1.0 사이였다.
  • 5,000개의 부트스트랩 샘플에서도 두 방법 모두 완전히 수렴하지 않았으며, 이는 수렴이 느리거나 발산 가능성을 시사하지만, 둘 다 약 0.038 부근의 좁은 영역에서 안정화되었다.
  • 제안된 정규화는 군집 크기 분포에 의한 우연 일치를 효과적으로 제어하여 군집 크기가 극도로 불균형한 경우에도 신뢰할 수 있는 k-추정이 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.