[论文解读] Inferences in Bayesian variable selection problems with large model spaces
本文主张,在高维变量选择问题中,基于马尔可夫链蒙特卡洛(MCMC)采样的经验贝叶斯推断优于重归一化方法,证明了基于频率的估计量是无偏且更精确的,尤其在包含概率的估计方面。通过在35个变量的数据集上进行精确计算,作者表明经验方法相比重归一化方法能提供更优的估计结果,而后者可能表现出强烈的偏差。
An important aspect of Bayesian model selection is how to deal with huge model spaces, since exhaustive enumeration of all the models entertained is unfeasible and inferences have to be based on the very small proportion of models visited. This is the case for the variable selection problem, with a moderate to large number of possible explanatory variables being considered in this paper. We review some of the strategies proposed in the literature and argue that inferences based on empirical frequencies via Markov Chain Monte Carlo sampling of the posterior distribution outperforms recently proposed searching methods. We give a plausible yet very simple explanation of this effect, showing that estimators based on frequencies are unbiased. The results obtained in two illustrative examples provide strong evidence in favor of our arguments.
研究动机与目标
- 解决在模型空间庞大、穷举枚举不可行的高维贝叶斯变量选择挑战。
- 在高维模型空间中,比较基于MCMC采样频率的经验估计量与基于归一化贝叶斯因子的重归一化估计量。
- 证明经验估计量无偏且具有可测量的精度,而重归一化方法则不具备此特性。
- 提供经验和理论证据,表明基于MCMC的频率估计在估计包含概率及其他感兴趣特征方面,比重归一化策略更可靠。
提出的方法
- 使用Zellner的g-先验,以在高斯线性模型中实现贝叶斯因子的闭式表达,简化计算。
- 采用MCMC采样从模型空间的后验分布中生成代表性模型样本($\mathcal{M}^*$)。
- 将经验估计量视为与规模成比例的概率抽样(PPS)估计量,在标准MCMC假设下确保无偏性。
- 基于$\mathcal{M}^*$中的访问频率,比较经验估计量与基于归一化贝叶斯因子的重归一化估计量,并利用35个变量数据集的精确结果进行验证。
- 使用并行化的C代码计算精确的包含概率和HPMs(最高后验概率模型),以验证近似方法并建立基准。
- 推导并应用基于经验频率的包含概率方差估计量,以量化估计不确定性。
实验结果
研究问题
- RQ1在高维贝叶斯变量选择中,基于MCMC访问频率的经验估计量是否无偏?
- RQ2当真实值已知时,经验估计量与重归一化估计量在估计包含概率方面表现如何比较?
- RQ3重归一化方法因强调高后验概率模型,是否在实践中导致估计偏差?
- RQ4尽管未显式针对高概率模型,经验方法是否仍能比重归一化方法获得更高的精度?
- RQ5抽样设计与估计策略在决定大模型空间中贝叶斯模型选择可靠性方面起什么作用?
主要发现
- 基于MCMC访问频率的经验估计量是无偏的,因为其本质上属于PPS抽样;而重归一化估计量可能表现出强烈偏差。
- 在包含35个协变量的Ozone35数据集中,经验方法的估计结果与精确包含概率高度一致,而重归一化方法则显示出显著偏差。
- 对于HPM(最高后验概率模型),经验方法与重归一化方法表现相似,因为两者均聚焦于高概率模型。
- 经验方法为包含概率提供了可靠的方差估计,从而支持不确定性量化,而重归一化方法则难以实现这一点。
- 在更大的Ozone65问题(65个协变量)中,经验方法保持了高精度与稳定性,而重归一化方法则表现出不稳定与偏差。
- 作者结论:尽管重归一化策略在直觉上更具吸引力,但经验方法在估计包含概率等特征方面总体更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。