Skip to main content
QUICK REVIEW

[论文解读] Estimating the number of clusters using cross-validation

Wei Fu, Patrick O. Perry|arXiv (Cornell University)|Feb 9, 2017
Advanced Clustering Algorithms Research参考文献 23被引用 12
一句话总结

本文提出了一种新颖的交叉验证方法,用于估计k均值聚类中的最优聚类数,将聚类问题视为具有缺失数据的预测问题。该方法采用Wold风格的交叉验证并结合斑点式留出法,在高维、异质性或重尾数据中表现优于现有方法,且在酿酒酵母细胞周期数据集中识别出一种简洁且可解释的聚类。

ABSTRACT

Many clustering methods, including k-means, require the user to specify the number of clusters as an input parameter. A variety of methods have been devised to choose the number of clusters automatically, but they often rely on strong modeling assumptions. This paper proposes a data-driven approach to estimate the number of clusters based on a novel form of cross-validation. The proposed method differs from ordinary cross-validation, because clustering is fundamentally an unsupervised learning problem. Simulation and real data analysis results show that the proposed method outperforms existing methods, especially in high-dimensional settings with heterogeneous or heavy-tailed noise. In a yeast cell cycle dataset, the proposed method finds a parsimonious clustering with interpretable gene groupings.

研究动机与目标

  • 为解决无监督学习中选择聚类数k的挑战,传统方法依赖于强建模假设。
  • 开发一种适用于k均值聚类的模型选择框架,利用一种适应无监督场景的新形式交叉验证。
  • 在具有异质性或重尾噪声的高维数据中提升性能,此类数据中现有方法常失效。
  • 提供一种自洽且数据自适应的方法,通过交叉验证最小化内部预测误差。
  • 在真实世界数据(如酿酒酵母细胞周期数据集)上展示该方法的有效性,获得简洁且可解释的聚类结果。

提出的方法

  • 提出Wold风格的交叉验证并结合斑点式留出法,即随机留出数据矩阵中的部分条目用于测试。
  • 对于每个k值和折数,使用迭代插补方法在含缺失值的训练数据上拟合k均值聚类。
  • 将交叉验证误差计算为观测测试值与预测聚类均值之间平方差的总和。
  • 对所有折的交叉验证误差取平均,以估计每个k值的性能。
  • 选择平均交叉验证误差最小的k值作为最优聚类数。
  • 引入对相关噪声的校正,以提升在误差结构具有依赖性的场景下的鲁棒性。

实验结果

研究问题

  • RQ1能否将交叉验证框架适配到无监督聚类问题中,其中不存在显式的响应变量?
  • RQ2与现有k选择方法相比,该提出的交叉验证方法在高维或非高斯数据中的表现如何?
  • RQ3该方法在不同噪声结构(包括相关或重尾误差)下是否仍保持自洽性和稳定性?
  • RQ4该方法能否在真实世界组学数据(如酿酒酵母中的基因表达数据)中识别出简洁且具有生物学可解释性的聚类?
  • RQ5对相关噪声的校正如何提升该方法在现实数据场景下的性能?

主要发现

  • 所提方法在高维设置下,尤其在复杂噪声结构中,优于传统方法(如肘部法和gap统计量)。
  • 在模拟实验中,即使在异质性或重尾噪声下,该方法仍保持高准确性,而现有方法常失效。
  • 在酿酒酵母细胞周期数据集中,该方法成功识别出5个聚类的解,该解既简洁又具有生物学可解释性。
  • 理论分析表明,在相关噪声下性能会下降,但所提出的校正方法可恢复鲁棒性。
  • 该方法表现出自洽性,在模拟和真实数据实验中与最先进模型选择技术具有竞争力。
  • 交叉验证误差度量有效捕捉了模型拟合度与复杂度之间的权衡,从而实现最优k值的选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。