Skip to main content
QUICK REVIEW

[论文解读] Strong Consistency of Reduced K-means Clustering

Yoshikazu Terada|arXiv (Cornell University)|Dec 20, 2012
Face and Expression Recognition参考文献 13被引用 4
一句话总结

该论文通过扩展Pollard的k-means一致性框架,在i.i.d.抽样下建立了Reduced K-means(RKM)聚类的强一致性。证明了随着样本量增加,RKM估计量几乎必然收敛到总体最小化器,并提出了在给定聚类数下选择最优子空间维数的一致性准则。

ABSTRACT

Reduced k-means clustering is a method for clustering objects in a low-dimensional subspace. The advantage of this method is that both clustering of objects and low-dimensional subspace reflecting the cluster structure are simultaneously obtained. In this paper, the relationship between conventional k-means clustering and reduced k-means clustering is discussed. Conditions ensuring almost sure convergence of the estimator of reduced k-means clustering as unboundedly increasing sample size have been presented. The results for a more general model considering conventional k-means clustering and reduced k-means clustering are provided in this paper. Moreover, a new criterion and its consistent estimator are proposed to determine the optimal dimension number of a subspace, given the number of clusters.

研究动机与目标

  • 通过证明在i.i.d.抽样下RKM聚类的理论基础,建立其强一致性。
  • 解决RKM聚类在统计性质方面的缺失,因为其原本仅是一种描述性方法。
  • 通过推导总体全局最小化器存在的条件,解决RKM中的旋转不确定性问题。
  • 提出一种新的一致准则及其估计器,用于确定低维子空间中的最优维度数。
  • 通过数值实验表明,所提出的准则能有效识别最优子空间维数。

提出的方法

  • 使用大数定律(SLLN)和一致大数定律分析RKM目标函数的收敛性。
  • 应用Blum-DeHardt一致大数定律,仅需平稳性和遍历性条件,以确保经验估计量的几乎必然收敛。
  • 将RKM目标函数定义为在低维子空间中最小化组内平方和的平均值:$ RKM_n = \frac{1}{n}\sum_{i=1}^n \min_{1\leq j\leq k} \|\mathbf{x}_i - A\mathbf{f}_j\|^2 $,其中 $ A $ 为正交矩阵,且 $ \mathbf{f}_j \in \mathbb{R}^q $。
  • 提出新准则 $ \widehat{VR}(q) $ 及其一致估计器,以在给定聚类数 $ k $ 的前提下选择最优子空间维数 $ q $。
  • 采用交替最小二乘法求解RKM优化问题,迭代更新聚类分配、中心点和子空间投影矩阵。
  • 在具有已知聚类结构的模拟数据中,通过调整兰德指数(ARI)比较不同 $ q $ 值下的表现,验证所提准则的有效性。

实验结果

研究问题

  • RQ1在何种条件下,随着样本量增加,Reduced K-means聚类估计量会几乎必然收敛到总体最小化器?
  • RQ2在理论一致性分析中,如何解决RKM的旋转不确定性问题?
  • RQ3何种条件可确保总体层面RKM目标函数存在全局最小化器?
  • RQ4能否开发出一种一致估计器,用于在给定聚类数 $ k $ 的前提下选择子空间中的最优维度数 $ q $?
  • RQ5与串联聚类等替代方法相比,所提准则在识别真实子空间维数方面的有效性如何?

主要发现

  • 在i.i.d.抽样下,RKM聚类估计量具有强一致性,即当 $ n \to \infty $ 时,其几乎必然收敛到总体最小化器,扩展了Pollard的k-means一致性框架。
  • 论文推导出确保总体全局最小化器存在的充分条件,克服了RKM中旋转不确定性的挑战。
  • 所提出的准则 $ \widehat{VR}(q) $ 及其一致估计器能成功识别最优子空间维数,在1000组模拟数据中的一致率达84%至95%。
  • 数值实验表明,当使用最优 $ q $ 时,RKM的调整兰德指数(ARI)达到0.99,显著优于串联聚类(ARI = 0.26),尤其在前两个主成分无法反映聚类结构时表现更优。
  • 在总体分布具有有界支撑的假设下,RKM估计量的收敛速率受到限制,且已从Linder等人(1994)的工作中导出明确的集中不等式边界。
  • 该方法适用于平稳遍历过程,不限于i.i.d.抽样,从而拓宽了其理论适用范围。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。