Skip to main content
QUICK REVIEW

[论文解读] Stop using the elbow criterion for k-means and how to choose the number of clusters instead

Erich Schubert|arXiv (Cornell University)|Dec 23, 2022
Advanced Clustering Algorithms Research被引用 9
一句话总结

本文反对在k均值聚类中使用肘部法则选择聚类数,因其缺乏理论基础且在不同类型数据上表现不佳。相反,本文提倡使用更优的替代方法,如Calinski-Harabasz VRC、贝叶斯信息准则(BIC)和Gap统计量,这些方法在各种数据结构中能提供更可靠、一致的聚类选择。

ABSTRACT

A major challenge when using k-means clustering often is how to choose the parameter k, the number of clusters. In this letter, we want to point out that it is very easy to draw poor conclusions from a common heuristic, the "elbow method". Better alternatives have been known in literature for a long time, and we want to draw attention to some of these easy to use options, that often perform better. This letter is a call to stop using the elbow method altogether, because it severely lacks theoretic support, and we want to encourage educators to discuss the problems of the method -- if introducing it in class at all -- and teach alternatives instead, while researchers and reviewers should reject conclusions drawn from the elbow method.

研究动机与目标

  • 挑战k均值聚类中广泛使用的肘部法则,因其缺乏理论严谨性且表现不一致。
  • 强调肘部方法在非球形、重叠或非高斯分布的数据中常失效,导致聚类数判断误导。
  • 推广经过验证的、更稳健的替代方法,如Calinski-Harabasz VRC、贝叶斯信息准则(BIC)和Gap统计量,用于k值选择。
  • 敦促教育者、从业者和审稿人停止支持或接受基于肘部法则的结论,转而采用更可靠的评估技术。
  • 将聚类分析重新定义为一种探索性过程,其中可能存在多个有效解,而‘最优’k值本质上是主观的。

提出的方法

  • 建议用Calinski和Harabasz提出的方差比率准则(VRC)替代肘部法则,该准则通过评估聚类间分离度与组内方差的相对关系来衡量聚类质量。
  • 推荐使用贝叶斯信息准则(BIC),通过权衡模型拟合度与复杂度来惩罚过拟合,其计算中纳入了聚类数和数据点数量。
  • 支持Gap统计量,该方法将实际数据的总组内离散度与均匀分布下的参考零分布进行比较,识别使差距最大化的k值。
  • 强调这些替代方法具有坚实的统计理论基础,并在以往文献中得到验证,而肘部法则仅是一种启发式方法。
  • 建议这些方法易于实现和解释,适用于教育和研究场景。
  • 强调k均值本身假设聚类为球形、大小相等且方差各向同性,因此任何k值选择方法都必须考虑这一基本假设。

实验结果

研究问题

  • RQ1为何肘部法被认为在确定k均值聚类最优聚类数时不可靠?
  • RQ2既有的替代方法如VRC、BIC和Gap统计量在一致性与理论严谨性方面如何优于肘部法?
  • RQ3在哪些数据场景下肘部法会失效?这些失效为何削弱其在真实世界聚类应用中的可信度?
  • RQ4在学术研究和数据科学实践中,依赖肘部法对聚类结果有何影响?
  • RQ5教育者和审稿人如何通过用更稳健的评估技术替代肘部法来提升聚类分析的质量?

主要发现

  • 肘部法在非球形、重叠或非高斯分布的数据(如均匀噪声或多元正态分布)上常产生误导性结果。
  • 即使在无自然聚类结构的数据上,肘部图也常呈现出相似的‘肘部’形状,表明其缺乏区分能力。
  • Calinski-Harabasz VRC、BIC和Gap统计量在包括分离良好、重叠及复杂形状聚类在内的多种数据类型中,始终优于肘部法。
  • VRC和BIC具有数学理论基础,能惩罚模型复杂度,降低对虚假聚类结构的过拟合风险。
  • Gap统计量提供基于参考的系统性比较,能识别出最能将真实聚类结构与随机噪声区分开来的k值。
  • 本文结论认为,聚类分析中并不存在单一的‘最优’k值,可能存在多个有效解,因此采用稳健的评估方法对可靠解释至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。