Skip to main content
QUICK REVIEW

[论文解读] Further heuristics for $k$-means: The merge-and-split heuristic and the $(k,l)$-means

Frank Nielsen, Richard Nock|arXiv (Cornell University)|Jun 23, 2014
Advanced Clustering Algorithms Research参考文献 21被引用 4
一句话总结

本文提出了合并与分裂 $k$-means 启发式算法和 $(k,l)$-means 目标函数,通过逃离局部最小值来改进 $k$-means 聚类。该方法扩展了 Lloyd 和 Hartigan 的算法,通过部分重初始化来处理空簇和单点簇,并表明当 $l>1$ 时,$(k,l)$-means 可以松弛为标准 $k$-means,从而获得更优解——尤其在重启次数有限时表现更佳,实验显示在 Iris 数据集上相比标准 $k$-means 最高提升达 80.55%。

ABSTRACT

Finding the optimal $k$-means clustering is NP-hard in general and many heuristics have been designed for minimizing monotonically the $k$-means objective. We first show how to extend Lloyd's batched relocation heuristic and Hartigan's single-point relocation heuristic to take into account empty-cluster and single-point cluster events, respectively. Those events tend to increasingly occur when $k$ or $d$ increases, or when performing several restarts. First, we show that those special events are a blessing because they allow to partially re-seed some cluster centers while further minimizing the $k$-means objective function. Second, we describe a novel heuristic, merge-and-split $k$-means, that consists in merging two clusters and splitting this merged cluster again with two new centers provided it improves the $k$-means objective. This novel heuristic can improve Hartigan's $k$-means when it has converged to a local minimum. We show empirically that this merge-and-split $k$-means improves over the Hartigan's heuristic which is the {\em de facto} method of choice. Finally, we propose the $(k,l)$-means objective that generalizes the $k$-means objective by associating the data points to their $l$ closest cluster centers, and show how to either directly convert or iteratively relax the $(k,l)$-means into a $k$-means in order to reach better local minima.

研究动机与目标

  • 解决 $k$-means 启发式算法因初始化不佳或 $k/d$ 较高而陷入次优局部最小值的局限。
  • 扩展经典 $k$-means 启发式算法(Lloyd 和 Hartigan 方法),通过支持部分重初始化,使其能够处理空簇和单点簇。
  • 提出一种新颖的合并与分裂 $k$-means 启发式算法,通过在目标函数可改进时重新配置簇,从而优于 Hartigan 方法。
  • 将 $k$-means 目标函数泛化为 $(k,l)$-means,允许每个点被分配给其 $l$ 个最近的中心,并展示如何将其松弛为标准 $k$-means 以实现更好收敛。
  • 通过实证验证,$(k,l)$-means 及其级联松弛优于标准 $k$-means,尤其在重启次数有限时表现更优。

提出的方法

  • 扩展 Lloyd 算法以处理空簇:在重新定位过程中重新分配簇中心,将此类事件视为部分重初始化的机会。
  • 扩展 Hartigan 的单点重定位启发式算法以处理单点簇:允许重新分配和重新中心化,利用这些事件作为重初始化的触发条件。
  • 提出合并与分裂 $k$-means 启发式算法:将两个簇合并,若 $k$-means 目标函数可改进,则将其分裂为两个新簇并更新中心。
  • 引入 $(k,l)$-means 目标函数,其中每个点被分配给其 $l$ 个最近的簇中心,从而泛化标准 $k$-means 目标。
  • 提出两种转换策略:直接分配(仅保留最近的中心)或通过迭代降低 $l$ 值,从 $(k,l)$-means 逐步松弛至 $(k,l-1)$-means,直至达到标准 $k$-means。
  • 将 $(k,l)$-means 作为预处理步骤,用于在最终 $k$-means 精炼前逃离局部最小值,通过转换或松弛实现。

实验结果

研究问题

  • RQ1能否将 $k$-means 启发式算法中的空簇和单点簇事件作为部分重初始化的机会,以改善收敛性?
  • RQ2所提出的合并与分裂 $k$-means 启发式算法是否在逃离局部最小值方面优于 Hartigan 方法?
  • RQ3当 $l>1$ 时,$(k,l)$-means 目标函数是否能平滑优化景观,并产生优于标准 $k$-means 的局部最小值?
  • RQ4将 $(k,l)$-means 松弛为标准 $k$-means 在解质量与初始化鲁棒性方面有多有效?
  • RQ5在重启次数有限的情况下,$(k,l)$-means 通过转换或松弛是否能始终优于标准 $k$-means?

主要发现

  • 合并与分裂 $k$-means 启发式算法优于 Hartigan 方法(后者为事实上的标准),通过在目标函数可改进时重新配置簇,实现性能提升。
  • 对于 $k=6$,在 Iris 数据集上进行 10,000 次重启实验中,转换后的 $(k,2)$-means 在 80.55% 的试验中优于标准 $k$-means。
  • 当重启次数有限时,$(k,l)$-means 目标函数在 $l=2$ 时在 Iris 数据集上 80% 的情况下优于标准 $k$-means。
  • 通过逐次丢弃最远中心的级联松弛方式,从 $(k,l)$-means 到 $k$-means 的转换,相比直接 $k$-means 能获得更优解,尤其在 $k$ 较高时表现更佳。
  • 对于 $k=10$,$(k,3)$-means 的松弛在 82.5% 的试验中优于标准 $k$-means,平均得分 27.76 对比 $k$-means 的 28.02。
  • $(k,l)$-means 方法平滑了优化景观,减少了次优局部最小值的数量,同时保持或提升了最优局部最小值的质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。