[论文解读] Monte Carlo Structured SVI for Two-Level Non-Conjugate Models
该论文提出蒙特卡洛结构化随机变分推断(MC-SSVI)方法,用于无共轭假设的两层潜变量模型,通过结构化变分近似和自然梯度实现可扩展的推断。该方法通过证明当先验分布与变分分布具有相同指数族形式时,将SVI扩展至非共轭模型,利用混合梯度方法在高斯模型中提升收敛性。
The stochastic variational inference (SVI) paradigm, which combines variational inference, natural gradients, and stochastic updates, was recently proposed for large-scale data analysis in conjugate Bayesian models and demonstrated to be effective in several problems. This paper studies a family of Bayesian latent variable models with two levels of hidden variables but without any conjugacy requirements, making several contributions in this context. The first is observing that SVI, with an improved structured variational approximation, is applicable under more general conditions than previously thought with the only requirement being that the approximating variational distribution be in the same family as the prior. The resulting approach, Monte Carlo Structured SVI (MC-SSVI), significantly extends the scope of SVI, enabling large-scale learning in non-conjugate models. For models with latent Gaussian variables we propose a hybrid algorithm, using both standard and natural gradients, which is shown to improve stability and convergence. Applications in mixed effects models, sparse Gaussian processes, probabilistic matrix factorization and correlated topic models demonstrate the generality of the approach and the advantages of the proposed algorithms.
研究动机与目标
- 解决随机变分推断(SVI)在具有两层潜变量的非共轭贝叶斯模型中的局限性。
- 将MC-SSVI扩展至一般两层潜变量模型(2L-LVM),无需共轭性假设,从而将适用范围从指数族共轭模型拓展至更广范围。
- 提出一种混合算法(H-MC-SSVI),在潜变量为高斯分布的模型中,结合自然梯度用于协方差、标准梯度用于均值,以提升收敛性和稳定性。
- 在多种模型中验证MC-SSVI的有效性,包括混合效应模型、稀疏高斯过程、概率矩阵分解和相关主题模型。
- 提供一个统一框架,阐明现有变分近似之间的关系,并识别2L-LVM族中最佳的结构化近似。
提出的方法
- 提出MC-SSVI作为结构化SVI在2L-LVM上的推广,利用小批量数据采样和蒙特卡洛估计处理不可计算的期望。
- 应用基于自然梯度关系推导的固定点更新,实现在先验分布与变分分布属于同一指数族时的优化。
- 针对潜变量为高斯分布的模型,提出H-MC-SSVI,结合协方差的自然梯度与均值的标准梯度,以提升收敛性。
- 使用重要性采样和后验抽样方案估计测试集归一化负对数似然(NLL),用于模型评估。
- 实现具有对角和全协方差近似的变分推断,并通过蒙特卡洛采样和Chib风格估计比较边缘似然性能。
- 将算法应用于多种模型:广义混合效应模型(GME)、稀疏高斯过程(sGP)、概率矩阵分解(PMF)和相关主题模型(CTM),并在nips和enron数据集上进行实证验证。
实验结果
研究问题
- RQ1能否在不依赖共轭指数族条件分布的前提下,将结构化变分推断扩展至非共轭的两层潜变量模型?
- RQ2在2L-LVM中,结构化变分近似在何种条件下仍为最优?其与LDA或PMF等模型中现有近似的关系如何?
- RQ3在潜变量为高斯分布的模型中,结合协方差的自然梯度与均值的标准梯度,如何提升收敛性和稳定性?
- RQ4在大规模非共轭模型(如CTM和PMF)中,MC-SSVI相较于平均场和标准SVI的性能增益如何?
- RQ5不同的重要性采样方案和协方差膨胀策略如何影响CTM中预测对数似然的估计?
主要发现
- 当潜变量的先验分布与变分分布属于同一指数族时,MC-SSVI可应用于2L-LVM,显著拓展了SVI在非共轭模型中的适用范围。
- 采用混合梯度的H-MC-SSVI(协方差使用自然梯度,均值使用标准梯度)在潜高斯模型中实现了更优的收敛性和稳定性,优于平均场和标准SVI变体。
- 在nips数据集上,K=50时,采用最优结构化近似的H-MC-SSVI在所有评估方案中均取得最低的测试集归一化NLL,优于平均场和S-DSVI。
- 结合后验抽样和协方差膨胀(如+I)的重要性采样方案产生更精确的NLL估计,且随着样本量增加,估计值趋于一致。
- 在NLL估计中引入对数先验项后,平均场与H-MC-SSVI在最优近似下的性能差距更加明显,表明H-MC-SSVI更能准确捕捉模型不确定性。
- 在enron数据集上,H-MC-SSVI采用对角协方差随时间定位到更优的解,证实其在大规模设置下具备更强的优化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。