Skip to main content
QUICK REVIEW

[论文解读] Bayesian Hierarchical Clustering with Exponential Family: Small-Variance Asymptotics and Reducibility

Juho Lee, Seungjin Choi|arXiv (Cornell University)|Jan 29, 2015
Bayesian Methods and Mixture Models参考文献 14被引用 5
一句话总结

本文提出了松弛贝叶斯层次聚类(RBHC),这是一种贝叶斯层次聚类(BHC)的非概率替代方法,通过在共轭指数族模型中使用小方差渐近分析,消除了超参数调优的需求。RBHC在保持BHC在聚类数量推断方面的灵活性的同时,实现了与基于距离的方法相当的可扩展性,其相异度度量在实践中可约化,从而可通过最近邻链算法(RBHC-nnca)实现高效的树构建。

ABSTRACT

Bayesian hierarchical clustering (BHC) is an agglomerative clustering method, where a probabilistic model is defined and its marginal likelihoods are evaluated to decide which clusters to merge. While BHC provides a few advantages over traditional distance-based agglomerative clustering algorithms, successive evaluation of marginal likelihoods and careful hyperparameter tuning are cumbersome and limit the scalability. In this paper we relax BHC into a non-probabilistic formulation, exploring small-variance asymptotics in conjugate-exponential models. We develop a novel clustering algorithm, referred to as relaxed BHC (RBHC), from the asymptotic limit of the BHC model that exhibits the scalability of distance-based agglomerative clustering algorithms as well as the flexibility of Bayesian nonparametric models. We also investigate the reducibility of the dissimilarity measure emerged from the asymptotic limit of the BHC model, allowing us to use scalable algorithms such as the nearest neighbor chain algorithm. Numerical experiments on both synthetic and real-world datasets demonstrate the validity and high performance of our method.

研究动机与目标

  • 为解决贝叶斯层次聚类(BHC)在实际应用中的可扩展性和超参数敏感性问题。
  • 通过利用共轭指数族模型中的小方差渐近分析,开发一种非概率、可扩展的BHC替代方法。
  • 研究所得相异度度量的可约化性,以实现通过最近邻链算法高效构建树结构。
  • 证明RBHC在无需仔细调优超参数的情况下,仍能在合成数据集和真实世界数据集上保持高聚类性能。

提出的方法

  • 在共轭指数族似然下对BHC模型应用小方差渐近分析,得到一种确定性的、非概率的相异度度量。
  • 推导BHC边际似然的渐近极限,得到仅依赖充分统计量和聚类大小的简化相异度函数。
  • 证明RBHC中所得的相异度度量在高概率下具有可约化性,从而可使用最近邻链算法实现高效树构建。
  • 实现两种变体:RBHC-greedy(使用标准贪心合并)和RBHC-nnca(使用最近邻链算法以改善时间和空间复杂度)。
  • 以Bregman散度为基础的成本最小化作为理论基础,将RBHC与现有聚类框架联系起来。
  • 在高斯、泊松和多项式假设下,于合成和真实世界数据集上验证该方法,并与BHC、Ward方法和层次聚类进行比较。

实验结果

研究问题

  • RQ1能否通过小方差渐近分析将贝叶斯层次聚类模型松弛为非概率形式,同时保持其在聚类数量推断方面的灵活性?
  • RQ2在松弛模型(RBHC)中,所得相异度度量是否可避免超参数调优,同时保持高聚类准确率?
  • RQ3RBHC中的相异度度量在实践中是否可约化,从而可使用最近邻链算法以降低时间和空间复杂度?
  • RQ4RBHC在性能和效率方面与传统凝聚聚类和原始BHC相比如何,尤其是在多样化数据分布和真实世界数据集上?

主要发现

  • RBHC-greedy和RBHC-nnca在大多数合成数据集上达到了最高的聚类准确率,优于传统凝聚方法,并在性能上匹配或超过BHC。
  • 在多项式情形下,BHC表现最佳,因其超参数调优更简单,但RBHC-nnca仍具竞争力且无需调优。
  • 在MNIST数据集(高斯假设)上,BHC因难以调优49×49精度矩阵而未能收敛,而RBHC-greedy和RBHC-nnca分别取得了63.7%的调整兰德指数(ARI),优于Ward方法(48.5%)。
  • 在Caltech101数据集(多项式假设)上,BHC取得了最高的ARI(64.6%),但RBHC-greedy和RBHC-nnca分别取得了56.0%的ARI,优于所有其他传统方法。
  • 最近邻链算法(RBHC-nnca)将空间复杂度降低至O(n),时间复杂度降低至O(n²),显著优于贪心方法的O(n² log n)时间复杂度和O(n²)空间复杂度。
  • 在实践中,RBHC中的相异度度量被证明具有可约化性,从而即使在理论上并非所有情况下都保证可约化,也能实现高效的树构建。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。