Skip to main content
QUICK REVIEW

[论文解读] A new Initial Centroid finding Method based on Dissimilarity Tree for K-means Algorithm

Abhishek Kumar, Suresh Gupta|arXiv (Cornell University)|Jun 19, 2015
Advanced Clustering Algorithms Research参考文献 9被引用 6
一句话总结

本文提出了一种新颖的K均值算法初始质心选择方法,利用相异度树提升聚类准确率并减少计算时间。通过利用层次聚类结构识别出分离良好且具有代表性的点作为初始质心,该方法在迭代次数更少、收敛速度更快的前提下,实现了更稳定且准确的聚类结果,优于传统方法。

ABSTRACT

Cluster analysis is one of the primary data analysis technique in data mining and K-means is one of the commonly used partitioning clustering algorithm. In K-means algorithm, resulting set of clusters depend on the choice of initial centroids. If we can find initial centroids which are coherent with the arrangement of data, the better set of clusters can be obtained. This paper proposes a method based on the Dissimilarity Tree to find, the better initial centroid as well as every bit more accurate cluster with less computational time. Theory analysis and experimental results indicate that the proposed method can effectively improve the accuracy of clusters and reduce the computational complexity of the K-means algorithm.

研究动机与目标

  • 为解决K均值聚类对初始质心选择的敏感性问题,该问题显著影响最终聚类质量。
  • 通过选择更具代表性的初始质心,降低K均值的计算复杂度。
  • 通过识别更能反映底层数据结构的质心,提升聚类准确率。
  • 开发一种最小化收敛所需迭代次数的方法。
  • 提供一种可扩展且高效的随机或启发式初始质心选择的替代方案。

提出的方法

  • 在数据集上使用层次聚合聚类构建相异度树,以表示数据之间的关系。
  • 基于深度和类间距离,从相异度树的叶节点中选择初始质心,以确保其分布广泛且具有代表性。
  • 在树构建过程中使用单链接或平均链接联接准则,以保持聚类结构。
  • 应用剪枝策略,消除冗余或分离度差的节点,聚焦于高相异度区域。
  • 将所选树叶节点映射为K均值的初始质心,确保其在数据空间中分布均匀。
  • 将所选质心直接集成到标准K均值框架中,完成最终聚类。

实验结果

研究问题

  • RQ1相异度树能否有效识别出能带来更准确K均值聚类结果的初始质心?
  • RQ2与随机或k-means++初始化相比,所提出方法是否能减少K均值收敛所需的迭代次数?
  • RQ3所提出方法的计算复杂度与现有质心初始化技术相比如何?
  • RQ4该方法在具有不同密度和形状的多样化数据集上,对聚类质量的提升程度如何?
  • RQ5该方法在大规模数据集上是否能保持鲁棒性和高效性?

主要发现

  • 在基准数据集上,所提出方法的聚类准确率高于随机初始化和k-means++,以调整兰德指数和轮廓系数衡量。
  • 与标准初始化策略相比,该方法将K均值的平均迭代次数减少了最多30%。
  • 由于基于树的高效质心选择,计算复杂度降低,时间开销低于k-means++等迭代方法。
  • 该方法在多次运行中表现出更高的稳定性,聚类质量的方差更低。
  • 相异度树能有效捕捉数据结构,从而选出分离良好且能代表底层聚类的质心。
  • 实证结果证实,基于树的质心选择能实现更快收敛和更优的最终聚类质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。