Skip to main content
QUICK REVIEW

[论文解读] Improved Performance of Unsupervised Method by Renovated K-Means

P. Ashok, G. M. Kadhar Nawaz|arXiv (Cornell University)|Mar 11, 2013
Advanced Clustering Algorithms Research参考文献 4被引用 4
一句话总结

本文提出了一种改进的 K-Means 算法,通过在 Iris 和 Wine 数据集上评估三种距离函数——欧几里得距离、曼哈顿距离和闵可夫斯基距离——来提升无监督聚类性能。与标准 K-Means、静态加权 K-Means 和动态加权 K-Means 相比,该方法在 Davies-Bouldin 指数更低、执行时间更短、迭代次数更少方面表现出更优性能,其中闵可夫斯基距离在测试数据集上表现最佳。

ABSTRACT

Clustering is a separation of data into groups of similar objects. Every group called cluster consists of objects that are similar to one another and dissimilar to objects of other groups. In this paper, the K-Means algorithm is implemented by three distance functions and to identify the optimal distance function for clustering methods. The proposed K-Means algorithm is compared with K-Means, Static Weighted K-Means (SWK-Means) and Dynamic Weighted K-Means (DWK-Means) algorithm by using Davis Bouldin index, Execution Time and Iteration count methods. Experimental results show that the proposed K-Means algorithm performed better on Iris and Wine dataset when compared with other three clustering methods.

研究动机与目标

  • 通过改进 K-Means 算法来提升无监督聚类方法的性能。
  • 评估并识别在聚类效率和准确性方面表现最优的距离函数(欧几里得、曼哈顿和闵可夫斯基)。
  • 将所提出的 K-Means 变体与现有方法(标准 K-Means、静态加权 K-Means (SWK-Means) 和动态加权 K-Means (DWK-Means))进行比较。
  • 使用标准指标(Davies-Bouldin 指数、执行时间和迭代次数)评估性能。
  • 在基准数据集(Iris 和 Wine)上验证所提出方法。

提出的方法

  • 使用三种距离函数(欧几里得、曼哈顿和闵可夫斯基)实现 K-Means 算法。
  • 系统性地评估距离函数的选择,以确定其对聚类质量和计算效率的影响。
  • 使用 Davies-Bouldin 指数衡量聚类质量,以评估聚类的紧密度和分离度。
  • 记录执行时间和迭代次数,以评估计算开销和收敛速度。
  • 在相同实验条件下,将所提出方法与标准 K-Means、SWK-Means 和 DWK-Means 进行基准测试。
  • 在两个标准基准数据集(Iris 和 Wine)上测试该算法,这两个数据集因其聚类特性而广为人知。

实验结果

研究问题

  • RQ1在 K-Means 框架中,欧几里得、曼哈顿或闵可夫斯基距离中哪一种能实现最佳聚类性能?
  • RQ2所提出的改进 K-Means 算法在执行时间和收敛速度方面与标准 K-Means 相比如何?
  • RQ3集成多种距离函数是否能通过 Davies-Bouldin 指数提升聚类质量?
  • RQ4在聚类有效性与计算效率方面,所提出方法与 SWK-Means 和 DWK-Means 相比表现如何?
  • RQ5在真实世界数据集(如 Iris 和 Wine)上,使用优化的距离函数是否能带来更稳定和准确的聚类结果?

主要发现

  • 所提出的 K-Means 算法在 Iris 和 Wine 数据集上均获得了比标准 K-Means、SWK-Means 和 DWK-Means 更低的 Davies-Bouldin 指数,表明聚类质量更优。
  • 闵可夫斯基距离在聚类准确性和稳定性方面优于欧几里得距离和曼哈顿距离。
  • 与基线 K-Means 及加权变体相比,所提出方法收敛所需的迭代次数更少。
  • 所提出方法的执行时间更短,尤其在 Wine 数据集上表现更明显,证明了其计算效率的提升。
  • 优化距离函数与 K-Means 算法的改进相结合,显著提升了所有评估指标下的聚类性能。
  • 结果证实,距离函数的选择对聚类结果有显著影响,而闵可夫斯基距离在准确性和效率之间提供了最佳平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。