Skip to main content
QUICK REVIEW

[论文解读] Fast Learning of Clusters and Topics via Sparse Posteriors

Michael C. Hughes, Erik B. Sudderth|arXiv (Cornell University)|Sep 23, 2016
Bayesian Methods and Mixture Models参考文献 27被引用 7
一句话总结

本文提出了一种稀疏变分推断方法,通过将每个观测的局部后验分布限制为最多 L 个聚类分配非零概率,显著加速了混合模型和主题模型的训练,同时不损失预测性能。与密集或硬分配基线相比,该方法在大规模数据集(K > 200 个聚类)上实现了更快的收敛速度和更高的保留数据似然度。

ABSTRACT

Mixture models and topic models generate each observation from a single cluster, but standard variational posteriors for each observation assign positive probability to all possible clusters. This requires dense storage and runtime costs that scale with the total number of clusters, even though typically only a few clusters have significant posterior mass for any data point. We propose a constrained family of sparse variational distributions that allow at most $L$ non-zero entries, where the tunable threshold $L$ trades off speed for accuracy. Previous sparse approximations have used hard assignments ($L=1$), but we find that moderate values of $L>1$ provide superior performance. Our approach easily integrates with stochastic or incremental optimization algorithms to scale to millions of examples. Experiments training mixture models of image patches and topic models for news articles show that our approach produces better-quality models in far less time than baseline methods.

研究动机与目标

  • 为解决标准变分推断在混合模型和主题模型中因全后验分布对所有 K 个聚类均赋予正概率而导致的高计算与存储成本问题。
  • 开发一种稀疏变分后验,限制每个观测最多仅有 L 个非零聚类分配,从而实现更快的推断与更低的内存占用。
  • 证明适度稀疏性(L > 1)在速度与预测准确性方面优于密集推断(L = K)和硬分配(L = 1)。
  • 通过随机或增量优化方法,实现对数百万样本的高效扩展,同时保持与现有变分推断框架的兼容性。

提出的方法

  • 引入一种受限的变分族,其中局部后验 q(z_n) 的非零条目数不超过 L,通过责任分数的 top-L 选择确定。
  • 通过添加稀疏性约束修改标准变分目标,将每个观测的活跃聚类数限制为 L,其中 L 为可调超参数。
  • 使用高效的 C++ 加速选择算法(如 Blum-Floyd-Pratt 算法)计算 top-L 责任,实现快速且可扩展的推断。
  • 无缝集成至均场变分推断(MVI)与随机变分推断(SVI)中,支持增量与小批量训练。
  • 证明在变分目标下,top-L 选择过程具有最优性,即在 L-稀疏后验中最小化 KL 散度。
  • 将该方法应用于高斯混合模型与 LDA,利用指数族似然与共轭先验的闭式期望。

实验结果

研究问题

  • RQ1将变分后验限制为每个观测最多 L 个非零聚类分配,是否能显著降低混合模型与主题模型中的计算成本,同时不降低模型质量?
  • RQ2是否存在一个 L > 1 的最优值,使其在速度与精度之间平衡得优于 L = 1(硬分配)或 L = K(密集后验)?
  • RQ3所提出的稀疏变分方法在包含数十万至数百万观测与数千个聚类的大规模数据集上是否具备良好的可扩展性?
  • RQ4该稀疏后验方法能否在不修改架构的前提下,高效集成至现有的随机与增量推断框架中?
  • RQ5在变分目标下,稀疏后验的 top-L 选择过程是否能提供可证明最优的近似?

主要发现

  • 在 K = 200 个聚类时,L = 8 的稀疏方法在 360 万张图片数据集上实现了与密集推断(L = K)相当的保留数据似然,但训练速度提高了 5 倍以上。
  • 在 Wikipedia 数据集(K = 800)上,MVI 使用 L = 8 时在 200 秒内收敛,而密集推断(L = K)需超过 1000 秒才能达到相似性能。
  • 硬分配(L = 1)始终表现较差,常因缺乏对词-主题模糊性的建模灵活性而过早收敛或陷入次优局部极小值。
  • 在 NYTimes 数据集(180 万篇文章)上,L = 8 配置的性能优于或等同于 LightLDA 与 SparseLDA,且训练速度提升 3–5 倍。
  • 在 NYTimes 上,SVIGibbs 使用 S = 10 个样本优于 S = 5,但进一步增加 S 超过 10 后无进一步增益,表明收益递减。
  • 该方法在大 K 情况下仍具有效扩展性:当 K > 200 时,LightLDA 在时间限制内无法追上性能,而 L-稀疏方法保持竞争力且更快。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。