Skip to main content
QUICK REVIEW

[논문 리뷰] Variable feature weighted fuzzy k-means algorithm for high dimensional data

Vikas Singh, Nishchal K. Verma|arXiv (Cornell University)|2019. 12. 24.
Advanced Clustering Algorithms Research참고 문헌 27인용 수 6
한 줄 요약

이 논문은 높은 차원의 데이터 클러스터링을 향상시키기 위해 각 클러스터별로 특성 가중치를 동적으로 할당하는 엔트로피 기반의 가변 특성 가중 퍼지 k-평균 알고리즘을 제안한다. 이는 퍼지 소속도와 특성 가중치 분포에 대한 두 가지 엔트로피 항을 사용한다. 알고리즘은 내부 클러스터 산란을 최소화하고 클러스터 간 분離를 최대화함으로써 클러스터링 정확도와 강건성을 향상시키며, 초기화 설정에 관계없이 일관된 성능을 보이며 여러 데이터셋에서 최신 기술보다 뛰어난 성능을 발휘한다.

ABSTRACT

This paper presents a new fuzzy k-means algorithm for the clustering of high-dimensional data in various subspaces. Since high-dimensional data, some features might be irrelevant and relevant but may have different significance in the clustering process. For better clustering, it is crucial to incorporate the contribution of these features in the clustering process. To combine these features, in this paper, we have proposed a novel fuzzy k-means clustering algorithm by modifying the objective function of the fuzzy k-means using two different entropy terms. The first entropy term helps to minimize the within-cluster dispersion and maximize the negative entropy to determine clusters to contribute to the association of data points. The second entropy term helps control the weight of the features because different features have different contributing weights during the clustering to obtain a better partition. The proposed approach performance is presented in various clustering measures (AR, RI and NMI) on multiple datasets and compared with six other state-of-the-art methods. Impact Statement- In real-world applications, cluster-dependent feature weights help in partitioning the data set into more meaningful clusters. These features may be relevant, irrelevant, or redundant, but they each have different contributions during the clustering process. In this paper, a cluster-dependent feature weights approach is presented using fuzzy k-means to assign higher weights to relevant features and lower weights to irrelevant features during clustering. The method is validated using both supervised and unsupervised performance measures on real-world and synthetic datasets to demonstrate its effectiveness compared to state-of-the-art methods.

연구 동기 및 목표

  • 모든 특성을 동일하게 취급하는 전통적인 퍼지 k-평균 알고리즘의 한계를 해결하기 위해 고차원, 희소성 및 노이즈가 많은 데이터에서의 성능 저하 문제를 해결한다.
  • 각 클러스터별로 특성 가중치를 동적으로 조정함으로써 초기 클러스터 중심 선택에 대한 민감도를 줄여 클러스터링의 강건성을 향상시킨다.
  • 목적 함수에서 퍼지 소속도 엔트로피와 특성 가중치 엔트로피를 동시에 최적화하여 클러스터링 품질을 향상시킨다.
  • 반복 과정 중에 가중치 및 소속도 제어 파라미터를 자동으로 업데이트함으로써 데이터의 일관되고 최적의 분할을 제공한다.

제안 방법

  • 퍼지 k-평균의 목적 함수에 두 가지 엔트로피 항을 통합하여, 내부 클러스터 산란을 최소화하고 부정적 소속도 엔트로피를 최대화함으로써 클러스터 간 분리도를 향상시킨다.
  • 특성 가중치를 제어하기 위해 두 번째 엔트로피 항을 도입하여, 각 클러스터 내에서 특성의 관련성에 따라 각 특성이 클러스터 형성에 다르게 기여하도록 한다.
  • 기울기 기반 최적화를 사용하여 반복적으로 특성 가중치를 업데이트함으로써 각 특성이 클러스터 소속도를 결정하는 데 기여하는 정도를 반영한다.
  • 퍼지 분할 계수와 특성 가중치 엔트로피를 동시에 최적화함으로써 안정적이고 일관된 클러스터링 결과를 확보한다.
  • 데이터 산란, 소속도 확실성, 특성 가중치 분포를 균형 있게 조절하는 하이브리드 목적 함수를 사용하여 클러스터링 구조 탐지 능력을 향상시킨다.
  • 엔트로피 기반 특성 가중치와 적응형 파라미터 업데이트를 활용함으로써 초기 클러스터 중심에 민감하지 않은 알고리즘 설계를 한다.

실험 결과

연구 질문

  • RQ1고차원 데이터에서 클러스터 성능을 향상시키기 위해 특성 가중치를 클러스터별로 어떻게 적응적으로 조정할 수 있는가?
  • RQ2기존의 퍼지 k-평균 변형 대비 소속도 엔트로피와 가중치 엔트로피를 동시에 통합함으로써 클러스터링의 강건성과 정확도가 얼마나 향상되는가?
  • RQ3제안된 알고리즘이 다양한 초기 클러스터 중심 설정에 대해 일관된 클러스터링 결과를 도출할 수 있는가?
  • RQ4고차원 및 희소 데이터셋에서 EWKM, AFKM, FCM, SCAD와 같은 최신 기술과 비교해 성능가 어떻게 비교되는가?
  • RQ5엔트로피 기반 최적화는 클러스터링 알고리즘의 계산 복잡도와 수렴 행동에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 모든 벤치마크 데이터셋에서 뛰어난 클러스터링 성능을 달성하였으며, KM, EWKM, AFKM, FCM, SCAD와 비교해 평균 Adjusted Rand Index (ARI), Rand Index (RI), Normalized Mutual Information (NMI) 값이 항상 높았다.
  • Lung 및 GLIOMA 데이터셋에서 제안된 알고리즘이 평균 ARI 0.89와 0.85를 기록하여 다음으로 우수한 방법(SCAD)보다 ARI에서 5-7% 높게 나타났다.
  • 클러스터 유효성 지표(PC, CE, XB, DI)는 제안된 방법이 더 밀도가 높고 잘 분리된 클러스터를 생성했음을 확인하였으며, PC 값은 최적의 클러스터 분할을 나타내었다.
  • 10번의 독립적인 시험에서 일관된 성능을 보이며 초기 클러스터 중심 선택에 대한 민감도가 낮아 강건성을 입증하였다.
  • IRIS 및 GLIOMA 데이터셋의 특성 가중치 시각화 결과는 각 클러스터에서 서로 다른 특성이 다르게 기여하고 있음을 확인하였으며, 가변 가중치 메커니즘의 타당성을 검증하였다.
  • 계산 복잡도가 O(nk²m + nkm²)로 높아졌지만, 클러스터링 정확도와 안정성 향상의 성과가 비용 증가를 상쇄한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.