Skip to main content
QUICK REVIEW

[논문 리뷰] A Centroid Auto-Fused Hierarchical Fuzzy c-Means Clustering

Yunxia Lin, Songcan Chen|arXiv (Cornell University)|2020. 04. 27.
Advanced Clustering Algorithms Research참고 문헌 33인용 수 4
한 줄 요약

이 논문은 최적의 클러스터 수를 외부 타당성 지표 없이 최적화 과정에서 적응적인 융합 과정을 통해 자동으로 결정하는 새로운 군집화 방법인 중심점 자동 융합 계층적 퍼지 c-의미(CAF-HFCM)를 제안한다. ℓ₂-노름 페널티를 초기 중심점에 적용하고 ADMM를 사용한 교대 최적화로 문제를 해결함으로써 빠른 수렴, 초기화에 대한 민감도 감소, 노이즈에 대한 강건성 확보를 달성하여 FCM 및 최신 기법들보다 합성 및 실재 데이터셋에서 뛰어난 성능을 보였다.

ABSTRACT

Like k-means and Gaussian Mixture Model (GMM), fuzzy c-means (FCM) with soft partition has also become a popular clustering algorithm and still is extensively studied. However, these algorithms and their variants still suffer from some difficulties such as determination of the optimal number of clusters which is a key factor for clustering quality. A common approach for overcoming this difficulty is to use the trial-and-validation strategy, i.e., traversing every integer from large number like $\sqrt{n}$ to 2 until finding the optimal number corresponding to the peak value of some cluster validity index. But it is scarcely possible to naturally construct an adaptively agglomerative hierarchical cluster structure as using the trial-and-validation strategy. Even possible, existing different validity indices also lead to different number of clusters. To effectively mitigate the problems while motivated by convex clustering, in this paper we present a Centroid Auto-Fused Hierarchical Fuzzy c-means method (CAF-HFCM) whose optimization procedure can automatically agglomerate to form a cluster hierarchy, more importantly, yielding an optimal number of clusters without resorting to any validity index. Although a recently-proposed robust-learning fuzzy c-means (RL-FCM) can also automatically obtain the best number of clusters without the help of any validity index, so-involved 3 hyper-parameters need to adjust expensively, conversely, our CAF-HFCM involves just 1 hyper-parameter which makes the corresponding adjustment is relatively easier and more operational. Further, as an additional benefit from our optimization objective, the CAF-HFCM effectively reduces the sensitivity to the initialization of clustering performance. Moreover, our proposed CAF-HFCM method is able to be straightforwardly extended to various variants of FCM.

연구 동기 및 목표

  • 시험적 타당성 지표에 의존하지 않고 퍼지 c-의미 군집화에서 최적의 클러스터 수를 결정하는 데 지속적으로 발생하는 과제를 해결하기 위해.
  • 수동적이거나 히우리스틱적인 융합 단계 없이 최적화 과정에서 자연스럽게 유도되는 계층적 군집화 방법을 개발하기 위해.
  • FCM 기반 알고리즘에서 알려진 약점인 초기화에 대한 민감도를 줄이기 위해.
  • 기본 FCM에서 성능 저하를 초래하는 경향이 있는 노이즈 데이터 포인트에 대한 강건성을 향상시키기 위해.
  • 최소한의 하이퍼파rameter 튜닝으로 실용성 향상을 도모하는 방법을 설계하기 위해.

제안 방법

  • 계층적 구조 형성을 위해 초기에 중심점으로서 데이터 포인트를 일반적으로 √n으로 설정하여 초기화한다.
  • 최적화 과정에서 유사한 클러스터를 자동으로 융합하도록, 목적 함수에 초기 중심점 간의 거리에 대해 ℓ₂-노름 페널티를 적용한다.
  • 최적화는 교대 전략을 통해 해결되며, 소속도 행렬은 해석적으로 업데이트되고 중심점 행렬은 ADMM 방법을 사용해 업데이트된다.
  • 페널티 파라미터 γ가 증가함에 따라 중심점은 점차적으로 융합되어 자연스러운 클러스터 계층을 형성한다.
  • 외부 타당성 지표가 필요 없이 최적의 클러스터 수에 자동으로 안정화된다.
  • 이 프레임워크는 커널 기반 FCM(KFCM)를 포함한 FCM의 다양한 변형에 확장 가능하다.

실험 결과

연구 질문

  • RQ1외부 타당성 지표에 의존하지 않고도 퍼지 c-의미 군집화 방법이 최적의 클러스터 수를 자동으로 결정할 수 있는가?
  • RQ2FCM의 최적화 과정이 중심점 융합을 통해 자연스럽게 계층적 군집 구조를 생성할 수 있는가?
  • RQ3제안된 방법이 표준 FCM에 비해 초기화에 대한 민감도를 감소시키는가?
  • RQ4기본 FCM에 최적의 클러스터 수를 적용했을 때와 비교해, 이 방법은 노이즈가 있는 데이터셋에서 어떻게 성능을 발휘하는가?
  • RQ5이 방법은 커널 기반 FCM와 같은 다른 FCM 변형으로 효율적으로 확장될 수 있는가?

주요 결과

  • CAF-HFCM는 노이즈가 있는 균일한 데이터에서 Rand Index(RI)가 0.9963 ± 0을 기록하여, 동일한 클러스터 수에서 FCM의 0.9887 ± .0091보다 유의미하게 뛰어난 성능을 보였다.
  • CAF-HFCM의 조정된 Rand Index(ARI)는 0.9736 ± 0이었고, FCM의 0.9217 ± 0.0630과 비교해 더 높은 군집 안정성과 정확도를 나타냈다.
  • 정규화된 상호정보량(NMI) 값은 CAF-HFCM가 0.9804 ± 0, FCM가 0.9608 ± 0.0306로, 더 나은 분할 일致성(일致성)을 확인했다.
  • CAF-HFCM는 여러 시행에 걸쳐 일관된 최적의 군집 결과를 보였으며, RI, ARI, NMI에서 변동성이 없어 초기화에 대한 민감도가 극히 낮음을 시사했다.
  • 고정밀도 혼합 분포 데이터셋에서조차도 c=19개의 초기 중심점으로도 단 5회 반복 내에 수렴함으로써 빠른 수렴 성능을 입증했다.
  • 시각적 비교(그림 15 및 16)는 CAF-HFCM가 노이즈가 있는 데이터에서도 항상 최적의 분할을 달성하는 반면, 최적의 c=13을 가진 FCM는 여전히 부분적으로 최적의 결과를 내는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.