Skip to main content
QUICK REVIEW

[论文解读] Reducing over-clustering via the powered Chinese restaurant process

Jun Lu, Meng Li|arXiv (Cornell University)|Feb 15, 2018
Bayesian Methods and Mixture Models参考文献 22被引用 10
一句话总结

本文提出幂化中国餐馆过程(pCRP),对狄利克雷过程混合模型进行改进,通过惩罚创建小型、无意义聚类的行为来减少过聚类。通过引入幂参数重新加权新数据点分配至现有或新桌子的概率,pCRP 实现了更稀疏、更具可解释性的聚类结果,尤其在 MNIST 和老忠实间歇泉等大规模数据集上,与标准 CRP 相比,聚类数量显著减少。

ABSTRACT

Dirichlet process mixture (DPM) models tend to produce many small clusters regardless of whether they are needed to accurately characterize the data - this is particularly true for large data sets. However, interpretability, parsimony, data storage and communication costs all are hampered by having overly many clusters. We propose a powered Chinese restaurant process to limit this kind of problem and penalize over clustering. The method is illustrated using some simulation examples and data with large and small sample size including MNIST and the Old Faithful Geyser data.

研究动机与目标

  • 为解决狄利克雷过程混合模型中随样本量增加而持续存在的过聚类问题。
  • 通过限制小型冗余聚类的数量,提升模型可解释性,降低计算开销,并减少数据存储与通信成本。
  • 开发一种简单有效的替代方法,替代复杂的吉布斯型过程,在保持计算可行性的同时,更倾向于删除不显著的聚类。
  • 提供一种实用的非交换聚类方法,在真实数据场景中表现优于标准 CRP 和基于 Oracle 的 CRP。

提出的方法

  • 提出幂化中国餐馆过程(pCRP),通过幂参数 r 修改 CRP 中新顾客分配至现有桌子或新桌子的概率。
  • 加入现有桌子 k 的概率与 N_{k,-i}^r 成比例,而生成新桌子的概率与 α × N^{1-r} 成比例,其中 r < 1 可降低创建新聚类的倾向。
  • 通过在保留数据子集上进行交叉验证来估计幂参数 r,以平衡模型拟合度与聚类稀疏性。
  • 使用吉布斯采样器进行推断,基于幂化转移概率更新聚类分配。
  • 该方法应用于合成数据及真实数据集,包括 MNIST 数字(1–4 类)和老忠实间歇泉数据。
  • 通过标准化互信息(NMI)、变信息(VI)以及平均和最大聚类数等指标,将 pCRP 与标准 CRP 和 CRP-Oracle(CRP 的调优版本)进行比较。

实验结果

研究问题

  • RQ1对中国餐馆过程进行简单修改,是否可在不损失灵活性的前提下减少狄利克雷过程混合模型中的过聚类?
  • RQ2在具有已知聚类结构的数据集上,pCRP 与标准 CRP 和 CRP-Oracle 相比表现如何?
  • RQ3通过交叉验证估计的幂参数 r,是否能在大规模和中等规模样本上实现更简洁、更具可解释性的聚类结果?
  • RQ4在真实数据(如 MNIST 和老忠实间歇泉)中,pCRP 在多大程度上抑制了小型虚假聚类的形成?

主要发现

  • 在 N=3000 的 MNIST 数据上,pCRP 将平均聚类数从 CRP 的 5.44 降低至 4.57,更接近真实的四类结构,最大聚类数也从 9 降至 7。
  • 在 N=272 的老忠实间歇泉数据集中,CRP 生成了四个分量,而 pCRP 和 CRP-Oracle 均恢复了真实的两分量结构,表明 pCRP 有效抑制了过聚类。
  • 在 N=2000 的模拟实验中,pCRP 的标准化互信息(NMI)为 0.977,变信息(VI)为 0.072,优于 CRP(NMI=0.940,VI=0.205),并接近 Oracle 性能。
  • pCRP 在不同样本规模下保持了稳定的聚类性能,平均聚类数(K)仅从 N=1000 时的 4.08 缓慢增加至 N=3000 时的 4.57,而 CRP 的聚类数则从 4.58 增至 5.44。
  • MNIST 的幂参数 r 估计为 1.05,老忠实间歇泉数据为 1.11,表明轻微的幂变换即可显著提升聚类简洁性。
  • 即使 NMI 相近,pCRP 的 VI 更低且聚类数更稳定,表明其聚类质量更优,过拟合程度更低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。