Skip to main content
QUICK REVIEW

[论文解读] Streaming Variational Inference for Bayesian Nonparametric Mixture Models

Alex Tank, Nicholas J. Foti|arXiv (Cornell University)|Dec 1, 2014
Bayesian Methods and Mixture Models参考文献 17被引用 7
一句话总结

本文提出了一种基于归一化随机测度(NRMs)的流式变分推断算法,采用假设密度滤波(ADF)实现大规模流式数据的高效、单次遍历推断。该方法在性能上与批量MCMC和EP算法相当,尤其在使用如归一化通用伽马过程(NGGP)等灵活先验时表现优异,能捕捉比狄拉克过程更精细的聚类结构。

ABSTRACT

In theory, Bayesian nonparametric (BNP) models are well suited to streaming data scenarios due to their ability to adapt model complexity with the observed data. Unfortunately, such benefits have not been fully realized in practice; existing inference algorithms are either not applicable to streaming applications or not extensible to BNP models. For the special case of Dirichlet processes, streaming inference has been considered. However, there is growing interest in more flexible BNP models building on the class of normalized random measures (NRMs). We work within this general framework and present a streaming variational inference algorithm for NRM mixture models. Our algorithm is based on assumed density filtering (ADF), leading straightforwardly to expectation propagation (EP) for large-scale batch inference as well. We demonstrate the efficacy of the algorithm on clustering documents in large, streaming text corpora.

研究动机与目标

  • 解决在狄拉克过程之外缺乏通用流式推断方法的问题,用于贝叶斯非参数(BNP)混合模型。
  • 将流式推断扩展到更灵活的 BNP 先验,特别是归一化随机测度(NRMs),如归一化通用伽马过程(NGGP)。
  • 开发一种变分推断框架,保持 BNP 模型的无限维特性,同时支持顺序、内存高效的更新。
  • 在大规模真实世界流式文本数据上展示该方法的有效性,其中批量方法不可行。
  • 证明使用如 NGGP 这类灵活的 NRM 先验可通过捕捉更精细的聚类结构来提升预测性能。

提出的方法

  • 该方法使用假设密度滤波(ADF)以递归方式在流式环境中更新后验分布的变分近似,仅依赖于过去数据的摘要统计量。
  • 利用辅助变量表示法处理通用 NRM 的预测分布,实现可 tractable 推断,无需依赖特定模型的近似。
  • 该算法近似了聚类分配的局部瓮预测分布,这是基于 NRM 的混合模型的核心。
  • ADF 框架可自然扩展为多轮期望传播(EP)变体,用于批量推断,当数据可循环处理时可获得更高精度结果。
  • 该方法具有通用性,当特化到狄拉克过程时,退化为先前的流式算法。
  • 该方法支持灵活的 NRM 先验,如归一化通用伽马过程(NGGP),其相比 DP 可对聚类大小分布提供更大控制力。

实验结果

研究问题

  • RQ1能否为狄拉克过程之外的贝叶斯非参数混合模型开发一种通用的流式变分推断算法?
  • RQ2在流式推断设置中,如何保持归一化随机测度(NRM)先验的无限维结构?
  • RQ3与狄拉克过程相比,使用更灵活的 NRM 先验(如归一化通用伽马过程 NGGP)是否能提升大规模流式数据上的预测性能?
  • RQ4单次遍历的流式算法能否实现与计算密集型批量方法(如吉布斯采样或 EP)相当的性能?
  • RQ5聚类大小的灵活性对建模大规模文本语料中细微的潜在结构有何影响?

主要发现

  • ADF-NRM 算法在仅单次遍历的情况下,其预测对数似然性能几乎与迭代 215 次的批量吉布斯采样器相当。
  • 在包含 10,000 篇文档的 KOS 语料上,ADF-NRM 配合 NGGP 先验的预测对数似然达到 -1.48,优于基于 DP 的 ADF-NRM,并接近多轮 EP-NRM 的性能。
  • 在包含 300,000 篇文档的《纽约时报》语料上,ADF-NRM 配合 NGGP 先验相比 DP 多引入了约 10 个小型聚类,提升了预测对数似然,并捕捉到更精细的主题结构。
  • 多轮 EP-NRM 变体的性能与吉布斯采样相当,且大部分性能增益出现在第一轮,表明其具有良好的收敛特性。
  • 从 ADF-NRM 配合 NGGP 先验中恢复出的前几位主题具有可解释性,对应于如“政治”和“体育”等有意义的主题,验证了模型提取语义一致结构的能力。
  • EP-NRM 变体表明 ADF 框架可扩展至多轮推断,当数据可访问时可实现高精度结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。