Skip to main content
QUICK REVIEW

[论文解读] Hybridization of Expectation-Maximization and K-Means Algorithms for Better Clustering Performance

D. Raja Kishor, N. Venkateswarlu|arXiv (Cornell University)|Mar 25, 2016
Bayesian Methods and Mixture Models参考文献 8被引用 3
一句话总结

本文提出了一种结合K均值与期望最大化(EM)的混合聚类算法,以在保持高聚类质量的同时加速收敛。通过利用K均值快速估计初始聚类中心,再使用EM进行参数优化,该混合方法显著减少了执行时间——在六组数据集(包括合成数据集)上,其执行速度持续优于标准EM算法,聚类适应度相当或更优,且均方误差(SSE)更低。

ABSTRACT

The present work proposes hybridization of Expectation-Maximization (EM) and K-Means techniques as an attempt to speed-up the clustering process. Though both K-Means and EM techniques look into different areas, K-means can be viewed as an approximate way to obtain maximum likelihood estimates for the means. Along with the proposed algorithm for hybridization, the present work also experiments with the Standard EM algorithm. Six different datasets are used for the experiments of which three are synthetic datasets. Clustering fitness and Sum of Squared Errors (SSE) are computed for measuring the clustering performance. In all the experiments it is observed that the proposed algorithm for hybridization of EM and K-Means techniques is consistently taking less execution time with acceptable Clustering Fitness value and less SSE than the standard EM algorithm. It is also observed that the proposed algorithm is producing better clustering results than the Cluster package of Purdue University.

研究动机与目标

  • 为解决EM算法在聚类中收敛缓慢的问题,通过结合更快的K均值初始化方法。
  • 在不牺牲聚类质量的前提下提升计算效率。
  • 开发一种混合框架,充分发挥K均值与EM的优势,以实现更优的整体性能。
  • 将所提方法与标准EM算法及知名聚类软件包(普渡大学的Cluster软件包)进行对比评估。

提出的方法

  • 该混合算法首先使用K均值计算初始聚类中心与聚类分配。
  • 将这些初始估计值作为EM算法的起点,通过最大似然估计进一步优化聚类参数。
  • EM步骤通过E步(责任计算)与M步(参数重估计)迭代更新聚类均值、协方差矩阵与混合权重。
  • 算法在K均值初始化与EM优化之间交替进行,直至收敛。
  • 聚类性能通过聚类适应度与均方误差(SSE)进行评估。
  • 该方法在六组数据集(包括三组合成数据)上进行测试,以确保在不同类型数据上的鲁棒性。

实验结果

研究问题

  • RQ1结合K均值与EM是否能减少执行时间,同时保持或提升聚类准确性?
  • RQ2与标准EM算法相比,该混合方法在收敛速度与聚类质量方面表现如何?
  • RQ3该混合方法是否优于现有聚类软件包(如普渡大学的Cluster软件包)?
  • RQ4K均值初始化在多大程度上改善了EM算法在聚类任务中的收敛行为?

主要发现

  • 在所有六组数据集上,该混合算法的执行时间均显著低于标准EM算法。
  • 所提方法的均方误差(SSE)低于标准EM,表明聚类结果更具紧凑性。
  • 聚类适应度值可接受且具有竞争力,表明该混合方法保持了高质量的聚类效果。
  • 在执行时间与聚类质量指标上,该混合算法均优于普渡大学的Cluster软件包。
  • K均值初始化与EM优化的结合,显著加快了收敛速度,并提升了聚类结果的稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。