Skip to main content
QUICK REVIEW

[论文解读] Online Bayesian Passive-Aggressive Learning

Tianlin Shi, Jun Zhu|arXiv (Cornell University)|Dec 12, 2013
Machine Learning and Algorithms参考文献 85被引用 18
一句话总结

本文提出在线贝叶斯被动-攻击(BayesPA)学习,这是一种新颖的框架,通过引入隐变量和非参数先验,将在线被动-攻击学习扩展至贝叶斯推断,实现了高效、可扩展的在线最大间隔学习。该方法在保持真实数据集上主题建模任务竞争力的同时,相比批量方法实现了显著的速度提升。

ABSTRACT

Online Passive-Aggressive (PA) learning is an effective framework for performing max-margin online learning. But the deterministic formulation and estimated single large-margin model could limit its capability in discovering descriptive structures underlying complex data. This pa- per presents online Bayesian Passive-Aggressive (BayesPA) learning, which subsumes the online PA and extends naturally to incorporate latent variables and perform nonparametric Bayesian inference, thus providing great flexibility for explorative analysis. We apply BayesPA to topic modeling and derive efficient online learning algorithms for max-margin topic models. We further develop nonparametric methods to resolve the number of topics. Experimental results on real datasets show that our approaches significantly improve time efficiency while maintaining comparable results with the batch counterparts.

研究动机与目标

  • 为解决确定性在线被动-攻击学习在捕捉复杂数据结构方面的局限性。
  • 将最大间隔学习的判别能力与贝叶斯推断的结构灵活性相结合。
  • 实现在具有隐变量和无界复杂度的贝叶斯最大间隔模型中的高效在线推断。
  • 开发用于最大间隔主题模型的可扩展在线算法,包括非参数扩展。
  • 与批量方法相比,显著提升训练速度的同时保持预测准确性。

提出的方法

  • BayesPA 通过将在线 PA 学习形式化为带有变分后验近似的贝叶斯推断问题,推广了在线 PA 学习。
  • 其采用变分贝叶斯更新规则,通过最小化结合预测损失和与先验的 KL 散度的正则化目标函数。
  • 该框架天然支持隐变量和非参数先验(如狄利克雷过程),从而实现无界模型复杂度。
  • 在主题建模中,BayesPA 被用于推导在线最大间隔 LDA(paMedLDA)和非参数 HDP(paMedHDP)的算法。
  • 该方法使用小批量更新与随机近似,其中每次更新在变分后验下最小化一个代理损失函数。
  • 采用预热步骤和采样策略,以提高在线设置中后验近似的稳定性。

实验结果

研究问题

  • RQ1能否将在线被动-攻击学习扩展为支持隐变量和非参数先验的贝叶斯框架?
  • RQ2如何在在线流式设置中高效更新贝叶斯最大间隔模型?
  • RQ3小批量大小、样本数量和预热步骤对在线 BayesPA 主题模型性能的影响如何?
  • RQ4在线 BayesPA 是否能在显著减少训练时间的同时,实现与批量方法相当的预测准确性?
  • RQ5该框架在大规模多任务分类和非参数主题建模中的可扩展性如何?

主要发现

  • 所提出的在线 BayesPA 框架在大规模数据集(如 110 万篇维基百科文章集合)上,训练速度相比批量方法最高可提升一个数量级。
  • 在 20NG 数据集上,paMedLDA 和 paMedHDP 的分类准确率与批量对应方法相比仅相差 1% 以内,同时显著减少了训练时间。
  • 保留样本数($\mathcal{J}$)对模型性能的影响大于预热步骤($\beta$),且当 $\mathcal{J}=9$ 时,在所有设置下均获得稳定结果。
  • 当 $\mathcal{J} \geq 3$ 时,即使仅进行一次迭代($\mathcal{I}=1$)也能达到具有竞争力的性能,表明小批量中存在冗余性。
  • 多任务扩展(paMedLDA-mt 和 paMedHDP-mt)在维基百科数据集上实现了与批量模型相当的 F1 分数,但训练时间大幅减少。
  • 实验结果证实,BayesPA 提供了一种可扩展、高效的批量贝叶斯最大间隔模型替代方案,且不损失预测准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。