Skip to main content
QUICK REVIEW

[论文解读] Expectation-maximization for logistic regression

James G. Scott, L. Sun|arXiv (Cornell University)|May 31, 2013
Statistical Methods and Inference参考文献 9被引用 13
一句话总结

本文提出了一种新颖的期望最大化(EM)算法用于逻辑回归,利用Polya-Gamma隐变量表示实现高效的后验推断。通过将逻辑回归似然表示为通过隐Polya-Gamma变量的正态尺度混合,该方法实现了对后验众数的收敛,并与变分贝叶斯建立了正式联系,同时支持鲁棒的二阶在线学习,具备可证明的收敛性,并可处理诱导稀疏性的先验分布。

ABSTRACT

We present a family of expectation-maximization (EM) algorithms for binary and negative-binomial logistic regression, drawing a sharp connection with the variational-Bayes algorithm of Jaakkola and Jordan (2000). Indeed, our results allow a version of this variational-Bayes approach to be re-interpreted as a true EM algorithm. We study several interesting features of the algorithm, and of this previously unrecognized connection with variational Bayes. We also generalize the approach to sparsity-promoting priors, and to an online method whose convergence properties are easily established. This latter method compares favorably with stochastic-gradient descent in situations with marked collinearity.

研究动机与目标

  • 开发一种适用于二项分布和负二项分布逻辑回归的原理性EM算法,确保收敛性。
  • 阐明此前未被认识到的在逻辑回归背景下EM与变分贝叶斯之间的联系。
  • 将该方法扩展至在线学习和诱导稀疏性的先验分布,同时保持收敛性。
  • 在高共线性场景下,提供一种鲁棒的二阶替代方法,以替代随机梯度下降。
  • 提供一种具有有意义不确定性度量的后验近似,不同于一阶方法的点估计。

提出的方法

  • 该方法采用隐变量表示,其中逻辑回归似然通过Polya-Gamma分布的隐变量表示为正态尺度混合。
  • EM算法在E步中计算当前参数估计下Polya-Gamma隐变量的后验均值,M步中通过加权最小二乘法更新回归系数。
  • M步中的工作参数ωt计算为ωt = mt/(2ψt) tanh(ψt/2),构成正态近似的对角精度矩阵。
  • 该算法源自精确EM框架,其中Polya-Gamma分布为逻辑回归似然提供了有效的数据增广方案。
  • 通过Polyak-Ruppert平均方法开发了在线变体,在温和条件下保证收敛性,支持高效的大规模学习。
  • 通过重尾先验分布(如拉普拉斯或horseshoe)引入稀疏性,这些先验分布与EM框架天然兼容,并保持收敛性。

实验结果

研究问题

  • RQ1能否基于Polya-Gamma表示构建逻辑回归的精确EM算法,其是否能保证收敛至后验众数?
  • RQ2所提出的EM算法与变分贝叶斯方法有何关系?为何尽管推导方式不同,二者却产生相同的不动点?
  • RQ3EM框架能否扩展至具备可证明收敛性和对学习率调度鲁棒性的在线学习?
  • RQ4在计算预算有限的高共线性场景下,在线EM是否优于随机梯度下降?
  • RQ5该方法在保持收敛性和不确定性度量的前提下,能否有效结合非凸稀疏诱导先验分布(如horseshoe)?

主要发现

  • 由于EM算法的上升性质以及后验分布的对数凹性,该EM算法可收敛至后验众数。
  • 该方法在形式上建立了EM算法与文献[1]中变分贝叶斯方法的等价性,表明相同的参数ωt通过不同推导路径产生。
  • 在包含100,000个样本和250个预测变量的高共线性模拟实验中,尽管计算时间相近,在线EM在收敛速度和稳定性方面优于随机梯度下降。
  • 与已知对学习率衰减调度高度敏感的随机梯度下降不同,在线EM对学习率衰减调度具有鲁棒性。
  • 该方法天然支持非凸稀疏诱导先验分布(如horseshoe),而这类先验分布与随机梯度下降结合较为困难。
  • 在线EM的后验近似提供了比点估计更具意义的误差条,其质量与变分贝叶斯方法相当,且具备一致性保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。