Skip to main content
QUICK REVIEW

[论文解读] Microclustering: When the Cluster Sizes Grow Sublinearly with the Size of the Data Set

Jeffrey W. Miller, Brenda Betancourt|arXiv (Cornell University)|Dec 2, 2015
Bayesian Methods and Mixture Models参考文献 14被引用 17
一句话总结

本文引入了微观聚类特性,定义了聚类模型中簇大小随数据集规模亚线性增长的性质——这对实体解析等任务至关重要。作者提出了NBNB模型,该模型具备此特性,并在拟合具有稀疏、小型簇的真实和模拟数据方面优于标准混合模型。

ABSTRACT

Most generative models for clustering implicitly assume that the number of data points in each cluster grows linearly with the total number of data points. Finite mixture models, Dirichlet process mixture models, and Pitman--Yor process mixture models make this assumption, as do all other infinitely exchangeable clustering models. However, for some tasks, this assumption is undesirable. For example, when performing entity resolution, the size of each cluster is often unrelated to the size of the data set. Consequently, each cluster contains a negligible fraction of the total number of data points. Such tasks therefore require models that yield clusters whose sizes grow sublinearly with the size of the data set. We address this requirement by defining the \emph{microclustering property} and introducing a new model that exhibits this property. We compare this model to several commonly used clustering models by checking model fit using real and simulated data sets.

研究动机与目标

  • 解决标准聚类模型假设簇大小随数据规模线性增长的局限性。
  • 指出实体解析等任务需要簇大小亚线性增长的模型,因为即使在大规模数据集中簇仍保持较小。
  • 将微观聚类特性正式定义为:最大簇大小随N增长为亚线性,即M_N / N → 0(依概率)。
  • 提出一种新的贝叶斯非参数模型——NBNB模型,其满足微观聚类特性,适用于此类任务。
  • 在具有稀疏簇结构的真实和模拟数据上,将NBNB模型与标准无限可交换模型(如DP、PYP、MFM)进行对比评估。

提出的方法

  • 将微观聚类特性定义为M_N = o_p(N),其中M_N为N个数据点划分中最大簇的大小。
  • 引入NBNB(归一化Beta-负二项分布)模型作为新分区上的先验,该模型不假设所有数据点之间可交换,从而打破线性增长的约束。
  • 使用归一化Beta-二项分布过程构建NBNB模型以生成簇大小,允许簇大小呈现重尾分布并实现亚线性增长。
  • 采用类似中国餐馆过程的构造方式,但通过使浓度参数依赖于N,使截断过程更倾向于小簇,从而确保亚线性增长。
  • 使用最大似然估计(MLE)选择使观测分区概率最大的模型参数,以支持模型比较。
  • 通过后验预测检查评估模型拟合度,使用四个关键统计量:单例簇数量、最大簇大小、平均簇大小以及簇大小的第90百分位数。

实验结果

研究问题

  • RQ1能否构建一种聚类模型,使得簇大小随数据点数量亚线性增长?
  • RQ2如何形式化定义并区分微观聚类特性与标准可交换聚类模型?
  • RQ3NBNB模型在理论和实证评估中是否表现出微观聚类特性?
  • RQ4NBNB模型在拟合具有稀疏、小型簇的数据方面,与标准无限可交换模型(如DP、PYP、MFM)相比表现如何?
  • RQ5NBNB模型能否更好地捕捉实体解析数据的关键特征,如高比例单例簇和低最大簇大小?

主要发现

  • NBNB模型成功表现出微观聚类特性,最大簇大小随N亚线性增长,满足M_N / N → 0(依概率)。
  • 实证评估表明,NBNB模型在拟合模拟和真实世界数据(如SHIW调查数据)方面优于MFM、DP和PYP混合模型,尤其在捕捉单例簇数量和最大簇大小方面表现更优。
  • 在模拟数据(5,000个点,4,500个簇)中,NBNB模型与真实单例簇数量(4,100)和最大簇大小(3)高度吻合,优于PYP和PERPS模型。
  • 在SHIW数据(789条记录,约74%为单例簇)中,NBNB和PERPS模型最接近真实单例簇数量和最大簇大小,尽管无模型能完全捕捉这些特征。
  • 在两个数据集中,NBNB模型略微低估平均簇大小,但整体仍具竞争力。
  • 结果表明,NBNB模型是实体解析及其他簇大小随数据集规模亚线性增长任务的有力候选模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。