Skip to main content
QUICK REVIEW

[论文解读] Similarity-Driven Cluster Merging Method for Unsupervised Fuzzy Clustering

Xuejian Xiong, K.W. Chan|arXiv (Cornell University)|Jul 11, 2012
Advanced Clustering Algorithms Research参考文献 11被引用 5
一句话总结

本文提出了一种基于相似性的聚类合并方法,用于无监督模糊聚类。该方法从过多的聚类数开始,通过模糊聚类相似性矩阵和自适应阈值法,迭代地合并相似聚类。该方法将改进的广义目标函数与p-范数距离及自动确定的主成分相结合,提升了聚类验证效果,并降低了对预设聚类数量的依赖。

ABSTRACT

In this paper, a similarity-driven cluster merging method is proposed for unsuper-vised fuzzy clustering. The cluster merging method is used to resolve the problem of cluster validation. Starting with an overspecified number of clusters in the data, pairs of similar clusters are merged based on the proposed similarity-driven cluster merging criterion. The similarity between clusters is calculated by a fuzzy cluster similarity matrix, while an adaptive threshold is used for merging. In addition, a modified generalized ob- jective function is used for prototype-based fuzzy clustering. The function includes the p-norm distance measure as well as principal components of the clusters. The number of the principal components is determined automatically from the data being clustered. The properties of this unsupervised fuzzy clustering algorithm are illustrated by several experiments.

研究动机与目标

  • 为解决无监督模糊聚类中聚类验证的挑战,通过动态确定最优聚类数。
  • 通过从过多的聚类数开始并合并相似聚类,减少对预设聚类数量的依赖。
  • 通过将p-范数距离和主成分分析整合到目标函数中,提升聚类准确性。
  • 开发一种自适应阈值机制,以确定聚类是否足够相似从而进行合并。
  • 从数据中自动确定每个聚类的主成分数量,以提升模型适应性。

提出的方法

  • 该方法从数据中初始设定过多的聚类数开始。
  • 基于聚类原型和数据分布,使用模糊聚类相似性矩阵计算聚类相似性。
  • 动态调整自适应阈值,以根据相似性评分控制合并决策。
  • 采用改进的广义目标函数,将每个聚类的p-范数距离和主成分信息相结合。
  • 通过维度分析,从数据结构中自动确定每个聚类的主成分数量。
  • 基于相似性评分超过自适应阈值,迭代地进行聚类合并,直至无法进一步合并。

实验结果

研究问题

  • RQ1在缺乏真实聚类数先验知识的情况下,如何改进无监督模糊聚类中的聚类验证?
  • RQ2在模糊聚类框架中,哪些标准可有效识别并合并相似聚类?
  • RQ3如何从数据中自动确定每个聚类的主成分数量?
  • RQ4将p-范数距离和主成分整合到聚类性能中会产生何种影响?
  • RQ5自适应阈值机制是否能优于固定阈值在聚类合并决策中的表现?

主要发现

  • 所提出的方法成功地将初始过多的聚类数通过基于相似性的合并减少到更准确的表示。
  • 将主成分整合到目标函数中,通过捕捉数据的潜在结构,提升了聚类质量。
  • 自适应阈值机制有效平衡了合并的激进程度与聚类分离性,避免了过度合并。
  • 与基线方法相比,该方法在具有复杂、重叠结构的数据集上实现了更好的聚类验证结果。
  • 自动确定每个聚类的主成分数量增强了模型鲁棒性,并减少了人工调参。
  • 实验的实证结果表明,该方法在多个基准数据集上均实现了改进的聚类性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。