Skip to main content
QUICK REVIEW

[论文解读] A Variational Algorithm for Bayesian Variable Selection

Xichen Huang, Jin Wang|arXiv (Cornell University)|Feb 24, 2016
Statistical Methods and Inference参考文献 12被引用 15
一句话总结

本文提出了一种快速、可扩展的变分贝叶斯算法,用于使用尖刺-平滑先验的变量选择,采用分批更新方案,即使在特征维度随样本量呈指数增长的情况下也能保证渐近一致性。与以往的变分方法不同,该方法在弱正则性条件下同时实现了频率学派和贝叶斯一致性。

ABSTRACT

There has been an intense development on the estimation of a sparse regression coefficient vector in statistics, machine learning and related fields. In this paper, we focus on the Bayesian approach to this problem, where sparsity is incorporated by the so-called spike-and-slab prior on the coefficients. Instead of replying on MCMC for posterior inference, we propose a fast and scalable algorithm based on variational approximation to the posterior distribution. The updating scheme employed by our algorithm is different from the one proposed by Carbonetto and Stephens (2012). Those changes seem crucial for us to show that our algorithm can achieve asymptotic consistency even when the feature dimension diverges exponentially fast with the sample size. Empirical results have demonstrated the effectiveness and efficiency of the proposed algorithm.

研究动机与目标

  • 开发一种快速、可扩展的MCMC替代方法,用于使用尖刺-平滑先验的贝叶斯变量选择。
  • 解决在p随n快速增长的高维设置下MCMC的计算瓶颈问题。
  • 在弱正则性条件下,为变分推断算法建立理论一致性——同时具备频率学派和贝叶斯一致性。
  • 证明当p随n呈指数发散时,分批更新是实现一致性的关键。
  • 提供一种确定性、收敛的算法,在相关高维设置下优于顺序更新方案。

提出的方法

  • 使用变分贝叶斯近似来逼近回归系数β和包含指标γ的联合后验分布。
  • 采用分批更新方案,同时更新所有特征参数,避免在高维或相关设置下误差累积。
  • 对后验分布应用平均场近似,将变分分布分解为q(β, γ) = q(β|γ)q(γ)。
  • 利用对数分摊函数和矩生成函数推导出变分参数的闭式更新。
  • 基于后验包含概率φj引入阈值规则,以确定最终的模型选择。
  • 利用浓度不等式和β与w_n的矩的渐近界,证明收敛性和一致性。

实验结果

研究问题

  • RQ1当预测变量数量p随样本量n呈指数增长时,确定性变分算法是否能实现频率学派的选择一致性?
  • RQ2在高维且相关的设计下,变分推断中的分批更新方案是否在一致性和鲁棒性方面优于顺序更新?
  • RQ3在何种条件下,变分后验会集中在真实模型上,从而确保贝叶斯一致性?
  • RQ4尽管缺乏后验的闭式表达,是否仍可为高维变量选择中的变分贝叶斯方法建立理论一致性?
  • RQ5超参数(如v1和an)的选择如何影响算法的收敛性和一致性?

主要发现

  • 所提出的算法实现了频率学派的选择一致性,即当n → ∞时,以概率趋于1正确识别出真实模型S*n。
  • 该算法确保了贝叶斯一致性,即真实模型的后验概率q(γ*) → 1,前提是p ≺ exp(n^{(a−1−η₃)/2})且v₁以指数速率趋于∞。
  • 分批更新方案对一致性至关重要;在相同条件下,顺序更新(如Carbonetto & Stephens, 2012)无法实现一致性。
  • w_n的变分近似方差被有界于O(σ² / λ_n1),确保了在高维情形下的稳定性。
  • 在p、n和信号强度的弱正则性条件下,无关变量的包含概率φj以概率收敛于0,而相关变量的包含概率φj收敛于1。
  • 当样本量较大时,该算法有高概率在一次迭代内收敛,原因在于后验包含概率集中在0或1附近。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。