Skip to main content
QUICK REVIEW

[论文解读] Amortized Bayesian inference for clustering models

Ari Pakman, Liam Paninski|arXiv (Cornell University)|Nov 24, 2018
Bayesian Methods and Mixture Models参考文献 18被引用 3
一句话总结

本文提出了神经聚类过程(NCP),一种用于聚类模型的近端贝叶斯推断方法,通过神经网络将聚类排列的对称性不变表示映射为条件聚类分配概率。该方法实现了快速、可并行化、独立的后验抽样,计算效率与单次Gibbs扫面相当,适用于共轭与非共轭模型。

ABSTRACT

We develop methods for efficient amortized approximate Bayesian inference over posterior distributions of probabilistic clustering models, such as Dirichlet process mixture models. The approach is based on mapping distributed, symmetry-invariant representations of cluster arrangements into conditional probabilities. The method parallelizes easily, yields iid samples from the approximate posterior of cluster assignments with the same computational cost of a single Gibbs sampler sweep, and can easily be applied to both conjugate and non-conjugate models, as training only requires samples from the generative model.

研究动机与目标

  • 解决概率聚类模型中MCMC方法的计算低效问题,特别是针对高维参数空间的非共轭模型。
  • 通过结合MCMC与深度学习的优势,克服变分推断中缺乏精度保证的问题。
  • 通过在生成模型样本上训练神经网络以实现推断的近端化,实现对聚类分配的快速、可扩展且可并行化的后验抽样。
  • 通过不变表示,保持聚类分配中的排列对称性——包括聚类内部、聚类之间以及未分配点之间的对称性。
  • 构建一个可泛化至多种模型类型的框架,包括狄利克雷过程混合模型,仅依赖于生成模型的样本进行训练。

提出的方法

  • 使用分布式、对称性不变的特征表示聚类配置:对每个聚类 $k$,计算聚类内汇总 $H_k = \text{sum}(h(x_i))$,并计算全局聚类汇总 $G = \text{sum}(g(H_k))$。
  • 使用神经网络 $f(G_k, Q, h_n)$ 建模条件概率 $p(c_n | c_{1:n-1}, \textbf{x})$,其中 $Q$ 为未分配点的嵌入总和,$h_n = h(x_n)$,且 $G_k$ 针对每种可能的聚类分配进行计算。
  • 通过随机梯度下降训练神经网络参数 $\theta$,以最小化真实后验下条件概率的期望负对数似然。
  • 通过采样数据点的排列 $\pi$,在训练中利用排列不变性,确保模型学习到在聚类重标记下的等变行为。
  • 应用Rao-Blackwell化以减少训练目标的方差,通过为固定 $c_{1:n-1}$ 计算 $c_{n:N}$ 的精确条件概率,提升样本效率。
  • 使用训练好的网络为新数据生成独立、可GPU并行化的后验样本,从而绕过顺序的MCMC抽样。

实验结果

研究问题

  • RQ1我们能否开发一种聚类模型的近端推断方法,实现与MCMC相当的计算效率与精度,而无需昂贵的马尔可夫链更新?
  • RQ2如何设计一种基于神经网络的推断框架,以尊重聚类分配中的固有排列对称性——包括聚类内部、聚类之间以及未分配点之间的对称性?
  • RQ3我们能在多大程度上仅使用生成模型的样本进行训练,就将该方法泛化至共轭与非共轭模型?
  • RQ4通过实现后验样本的完全并行化,我们能否在保持可比方差的前提下,实现相对于标准Gibbs抽样的显著加速?
  • RQ5使用对称性不变表示与Rao-Blackwell化训练是否能提升神经网络策略在聚类分配预测中的收敛性与稳定性?

主要发现

  • 神经聚类过程(NCP)在方差方面实现了与Gibbs抽样相当的后验抽样性能,同时显著减少了实际运行时间。
  • NCP实现了GPU上的大规模并行化,将平均运行时间从Gibbs抽样的1969秒(20,000个样本,1000次预 burn-in)降低至184秒。
  • 该方法在聚类标签与数据点的排列下保持了对称性不变性,该特性在训练过程中被监控,并在模型预测中得以保留。
  • Rao-Blackwell化通过为固定 $c_{1:n-1}$ 计算 $c_{n:N}$ 的精确条件概率,降低了训练目标的方差,提升了样本效率。
  • 该方法适用于共轭与非共轭模型,因为训练仅需生成模型的样本,无需显式计算后验。
  • 训练完成后,NCP以与单次Gibbs扫面相同的计算成本,生成独立同分布(i.i.d.)的聚类分配后验样本,从而实现可扩展的推断。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。