Skip to main content
QUICK REVIEW

[논문 리뷰] The Impact of Random Models on Clustering Similarity

Alexander J. Gates, Yong‐Yeol Ahn|arXiv (Cornell University)|2017. 01. 23.
Advanced Clustering Algorithms Research참고 문헌 25인용 수 10
한 줄 요약

이 논문은 클러스터 수와 크기가 변할 수 있는 두 가지 랜덤 클러스터링 모델에 기반해 랜덤 인덱스와 정규화된 상호정보량(NMI)의 기대값을 유도함으로써 클러스터링 유사도 평가를 보정하는 방법을 제안한다. 표준 순열 모델이 아닌, 클러스터 수와 크기가 변하는 모델을 사용함으로써, 평가 순위와 기준 평가 결과에 큰 영향을 미치며, 연구자들이 클러스터링 맥락에 맞게 모델 선택을 정당화할 것을 당부한다.

ABSTRACT

Clustering is a central approach for unsupervised learning. After clustering is applied, the most fundamental analysis is to quantitatively compare clusterings. Such comparisons are crucial for the evaluation of clustering methods as well as other tasks such as consensus clustering. It is often argued that, in order to establish a baseline, clustering similarity should be assessed in the context of a random ensemble of clusterings. The prevailing assumption for the random clustering ensemble is the permutation model in which the number and sizes of clusters are fixed. However, this assumption does not necessarily hold in practice; for example, multiple runs of K-means clustering returns clusterings with a fixed number of clusters, while the cluster size distribution varies greatly. Here, we derive corrected variants of two clustering similarity measures (the Rand index and Mutual Information) in the context of two random clustering ensembles in which the number and sizes of clusters vary. In addition, we study the impact of one-sided comparisons in the scenario with a reference clustering. The consequences of different random models are illustrated using synthetic examples, handwriting recognition, and gene expression data. We demonstrate that the choice of random model can have a drastic impact on the ranking of similar clustering pairs, and the evaluation of a clustering method with respect to a random baseline; thus, the choice of random clustering model should be carefully justified.

연구 동기 및 목표

  • 클러스터링 유사도 평가에서 기준 비교를 위한 랜덤 클러스터링 모델 선택에 대한 정당성이 부족한 문제를 해결하기 위해.
  • 고정된 클러스터 수와 크기를 가진 순열 모델을 일반적으로 기준으로 사용하는 것에 도전하며, 이는 종종 실제 클러스터링 상황을 반영하지 못한다.
  • 클러스터 수와 크기가 변할 수 있는 두 가지 대체 랜덤 모델 하에서 랜덤 인덱스와 NMI의 보정된 버전을 유도하기 위해.
  • 다양한 랜덤 모델이 유의미하게 다른 기대 유사도 값을 유도함으로써, 클러스터링 성능의 해석에 영향을 미친다는 것을 보여주기 위해.
  • 특히 클러스터 수는 고정되지만 크기가 변하는 K-means와 같은 방법에서, 맥락에 맞는 랜덤 모델 선택을 권장하기 위해.

제안 방법

  • 클러스터 수와 크기가 랜덤인 경우와 클러스터 수는 고정되지만 크기가 변하는 경우의 두 가지 랜덤 클러스터링 앙상블에서 랜덤 인덱스의 기대값을 유도한다.
  • 동일한 두 모델 하에서 정규화된 상호정보량(NMI)의 기대값을 유도하며, 클러스터 수와 크기 분포에 의해 유도되는 편향을 고려한다.
  • 스털링 수의 제2종과 벨 수를 사용해 각 모델 하에서 가능한 클러스터링의 수를 계산함으로써 정확한 기대값 계산을 가능하게 한다.
  • 대규모 데이터셋에서 벨 수와 스탈링 수를 효율적으로 계산하기 위해 점근적 근사(예: 도비니의 공식)를 적용한다.
  • 합성 데이터, 수기 숫자 인식(digits dataset), 유전자 발현 데이터를 사용해 다양한 모델 간 보정된 유사도 점수를 비교한다.
  • 한 클러스터링은 고정되어 있고(예: 기준), 다른 클러스터링은 랜덤화되는 한쪽 방향 비교 프레임워크를 도입하여 실제 클러스터링 평가에서 유의미성을 평가한다.

실험 결과

연구 질문

  • RQ1랜덤 클러스터링 모델의 선택이 랜덤 인덱스와 NMI의 기대 유사도 값에 어떤 영향을 미치는가?
  • RQ2고정된 클러스터 수와 크기를 가진 순열 모델과 클러스터 수와 크기가 변할 수 있는 더 유연한 랜덤 모델 간의 기준 기대값은 어느 정도 다를까?
  • RQ3보정된 유사도 측정치는 수기 숫자나 유전자 발현 데이터와 같은 실제 클러스터링 시나리오에서 어떻게 작동하는가?
  • RQ4NMI의 정규화 항은 클러스터 수가 변할 경우에 어떤 영향을 미치며, 편향이 어떻게 발생하는가?
  • RQ5고정된 기준 클러스터링이 있는 한쪽 방향 비교에서, 사용된 랜덤 모델에 따라 다른 결론이 도출될 수 있는가?

주요 결과

  • 표준 순열 모델 하에서의 기대 랜덤 인덱스와 NMI는 클러스터 수와 크기가 변할 수 있는 모델과 유의미하게 다름을 보이며, 특히 데이터셋 크기가 커질수록 더욱 두드러진다.
  • 새로운 모델 하에서 랜덤 클러스터링의 기대 유사도는 데이터셋 크기가 증가함에 따라 증가하며, 직관에 어긋나지만 기대 클러스터 수와 크기 분포의 수렴으로 설명된다.
  • digits 데이터셋에서 K-means 클러스터링은 순열 모델 하에서는 기준 클러스터링과 높은 유사도를 보였지만, 더 현실적인 클러스터 크기 변동 모델로 보정하면 이 유사도가 크게 감소한다.
  • 유전자 발현 데이터에서는 랜덤 모델 선택이 클러스터링 방법의 순위를 바꾸며, 일부 방법은 기준에 따라 더 좋거나 더 나쁘게 보일 수 있다.
  • NMI의 정규화 항은 클러스터 수에 따라 편향을 유도하며, 이 편향은 순열 모델 하에서는 충분히 보정되지 않아 잘못된 해석을 초래할 수 있다.
  • 이 논문의 프레임워크는 순열 모델이 종종 '너무 랜덤하지 않다'는 것을 드러내며, 실제 클러스터링의 구조적 특성을 유지하므로 평가 기준으로서 부적절하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.