[论文解读] Improved Bayesian Logistic Supervised Topic Models with Data Augmentation
本文提出了一种正则化的贝叶斯逻辑回归监督主题模型(gSLDA),通过正则化参数平衡词和响应变量的贡献,并引入基于多项式-伽马数据增广的高效吉布斯采样算法,实现无需均场假设的精确后验推断。该方法在分类准确率和训练速度方面均有显著提升,尤其在并行化处理下表现更优,优于标准sLDA和变分方法。
Supervised topic models with a logistic likelihood have two issues that potentially limit their practical use: 1) response variables are usually over-weighted by document word counts; and 2) existing variational inference methods make strict mean-field assumptions. We address these issues by: 1) introducing a regularization constant to better balance the two parts based on an optimization formulation of Bayesian inference; and 2) developing a simple Gibbs sampling algorithm by introducing auxiliary Polya-Gamma variables and collapsing out Dirichlet variables. Our augment-and-collapse sampling algorithm has analytical forms of each conditional distribution without making any restricting assumptions and can be easily parallelized. Empirical results demonstrate significant improvements on prediction performance and time efficiency.
研究动机与目标
- 解决监督主题模型中因词频与响应变量尺度差异导致的模型不平衡问题,使响应变量不被低估。
- 克服由于非共轭似然函数导致的逻辑回归监督主题模型后验推断不可解的问题。
- 开发一种可扩展、高效的推断算法,避免使用限制性强的均场变分近似方法。
- 通过多项式-伽马变量的数据增广与退化吉布斯采样,实现精确的贝叶斯推断。
- 在大规模文本分类任务中实现高性能与良好的并行可扩展性。
提出的方法
- 在广义贝叶斯推断框架中引入正则化参数,以平衡代理分类损失(响应似然)与词似然。
- 利用多项式-伽马分布的辅助变量重述逻辑似然,构建尺度混合表示,实现条件共轭性。
- 推导所有潜变量(包括主题、主题分配和分类器参数)的解析可处理的条件分布。
- 对主题和混合比例的狄利克雷先验进行退化处理,以改善吉布斯采样中的混合效果并降低维度。
- 实现一种退化吉布斯采样器,避免使用梅特罗波利斯-黑斯廷斯步骤,并利用GraphLab支持高效并行化。
- 使用预 burn-in 步骤以在实际中提升采样过程的收敛性与稳定性。
实验结果
研究问题
- RQ1如何在监督主题模型中有效缓解词频与响应变量之间的模型不平衡问题?
- RQ2使用多项式-伽马变量进行数据增广是否能实现在广义逻辑回归监督主题模型中的精确、高效吉布斯采样?
- RQ3正则化参数对分类准确率与模型稳定性有何影响?
- RQ4所提出的吉布斯采样算法在性能与可扩展性方面相较于变分推断方法表现如何?
- RQ5该算法在不损失预测准确率的前提下,可并行化的程度有多大?
主要发现
- 当正则化参数取最优值时(二分类c=25,多分类c=256),gSLDA模型的测试准确率显著高于标准sLDA(c=1),且在c值广泛变化范围内表现稳定。
- 模型在20个预 burn-in 步骤内即可收敛至最优性能,且训练时间随预 burn-in 步骤数线性增长。
- 基于GraphLab的并行实现相比串行吉布斯采样,实现了约两个数量级的速度提升。
- 在狄利克雷先验α值从0.1到10的多种取值下,分类性能保持稳定且具有竞争力,表明对先验设定具有鲁棒性。
- 所提出的结合多项式-伽马增广的吉布斯采样器在混合效果与推断质量方面优于均场变分方法,且无需使用梅特罗波利斯-黑斯廷斯校正。
- 实证结果表明,该方法在真实世界数据集上的预测准确率与时间效率方面均优于现有方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。