Skip to main content
QUICK REVIEW

[论文解读] Estimating the Number of Clusters via Normalized Cluster Instability

Jonas M B Haslbeck, Dirk U. Wulff|arXiv (Cornell University)|Aug 26, 2016
Data Analysis with R参考文献 14被引用 3
一句话总结

本文提出了一种归一化的聚类不稳定性度量方法,通过校正聚类大小分布的影响,显著提升了k-means聚类数量估计的准确性,尤其在k值较大时表现更优。该方法优于未经归一化的不稳定性度量方法,且与基于距离的方法(如高斯混合模型)相比表现相当或更优;基于模型与非基于模型的不稳定性方法在性能上表现相近。

ABSTRACT

We improve current instability-based methods for the selection of the number of clusters $k$ in cluster analysis by developing a normalized cluster instability measure that corrects for the distribution of cluster sizes, a previously unaccounted driver of cluster instability. We show that our normalized instability measure outperforms current instability-based measures across the whole sequence of possible $k$ and especially overcomes limitations in the context of large $k$. We also compare, for the first time, model-based and model-free approaches to determine cluster-instability and find their performance to be comparable. We make our method available in the R-package \verb+cstab+.

研究动机与目标

  • 为解决现有基于不稳定性的方法在k值较大或聚类大小不均时选择聚类数k的局限性。
  • 校正聚类大小分布对不稳定性造成的混淆影响,该影响会偏差现有方法的性能。
  • 首次以系统化方式比较基于模型与非基于模型的聚类不稳定性方法。
  • 开发并验证一种新的归一化不稳定性度量方法,以在各种聚类场景下增强基于稳定性的k值选择性能。

提出的方法

  • 提出一种归一化的不稳定性度量 d^n(ψ_a, ψ_b),通过考虑聚类大小分布M带来的预期偶然一致性,对原始聚类距离 d^r(ψ_a, ψ_b) 进行校正。
  • 通过重采样(自助法)计算数据在多次扰动下的不稳定性,通过对对象对的平均不一致程度来估计预期不一致。
  • 基于随机聚类下的期望Rand指数推导出校正因子,该因子依赖于聚类大小分布M,用于归一化不稳定性。
  • 在一系列k值范围内应用归一化不稳定性度量,并选择不稳定性最小的k值作为估计的聚类数。
  • 采用基于模型的(参数自助法)和非基于模型的(非参数自助法)两种重采样策略来计算不稳定性。
  • 通过在四种具有不同k*值和聚类形状(圆形与拉长形)的合成聚类场景中进行广泛模拟,验证了该方法的有效性。

实验结果

研究问题

  • RQ1聚类大小分布M如何影响未经归一化的聚类不稳定性度量在k值选择中的表现?
  • RQ2能否通过一种校正M的归一化不稳定性度量,提升所有k值范围内的k估计准确性,特别是在k值较大时?
  • RQ3基于模型与非基于模型的不稳定性计算方法在性能与收敛性方面如何比较?
  • RQ4所提出的归一化方法是否能使基于不稳定性的方法超越已建立的基于距离的k值选择方法(如Gap统计量或高斯混合模型)?
  • RQ5随着自助样本数B的增加,基于模型与非基于模型的不稳定性估计的收敛行为如何?

主要发现

  • 归一化不稳定性度量在所有测试的k值下均显著优于未经归一化的不稳定性方法,尤其在k值较大或聚类大小不均的场景中表现更优。
  • 在k*=7且聚类为拉长形的场景中,未经归一化的不稳定性方法完全失效(性能降至零),而归一化方法仍能在相当大比例的案例中正确识别出k*。
  • 高斯混合模型仍是表现最佳的基于距离的方法,但归一化不稳定性方法优于所有其他基于距离的方法,包括Gap统计量与Jump统计量。
  • 基于模型与非基于模型的不稳定性方法表现出几乎相同的性能,其不稳定性路径之间的相关系数在0.98至1.0之间。
  • 即使在5,000次自助样本时,两种不稳定性方法仍未完全收敛,表明可能存在发散或收敛缓慢的问题,但两者均在约0.038的狭窄区域内趋于稳定。
  • 所提出的归一化方法有效控制了由聚类大小带来的偶然一致性,使得在聚类大小高度不平衡的情况下也能实现可靠的k值估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。