[论文解读] Methods and Tools for Bayesian Variable Selection and Model Averaging in Univariate Linear Regression
本文评估并比较了四个R包——BMS、BayesVarSel、mombf和BayesFactor——在单变量线性回归中进行贝叶斯变量选择与模型平均的表现。结果表明,尽管所有包的输出高度相似,但在计算效率、先验灵活性以及并行计算、收敛诊断等特性上的差异,使得BayesVarSel在小到中等样本量下表现最优,而BMS在大数据集上更具优势。
In this paper we briefly review the main methodological aspects concerned with the application of the Bayesian approach to model choice and model averaging in the context of variable selection in regression models. This includes prior elicitation, summaries of the posterior distribution and computational strategies. We then examine and compare various publicly available { t R}-packages for its practical implementation summarizing and explaining the differences between packages and giving recommendations for applied users. We find that all packages reviewed lead to very similar results, but there are potentially important differences in flexibility and efficiency of the packages.
研究动机与目标
- 评估并比较四个公开可用的R包在单变量线性回归中进行贝叶斯变量选择与模型平均的性能、灵活性和可用性。
- 评估不同先验分布(特别是Jeffreys、Zellner和Siow等传统先验)对模型选择与推断的影响。
- 基于计算效率、收敛速度以及固定协变量、层次建模和并行计算等可用功能,为应用研究者提供实用建议。
- 考察数值实现策略(如MCMC、可逆跳跃、重要性抽样)及其对后验模型概率和包含概率的CPU时间与精度的影响。
- 评估各包的文档质量与用户界面设计,以指导应用用户进行工具选择。
提出的方法
- 本研究回顾并实现了基于边际似然与后验模型概率的贝叶斯变量选择,其中模型由表示变量包含与否的二值向量索引。
- 采用传统先验——特别是Zellner-Siow和Jeffreys型先验——因其客观性、非信息性及最优的频率学风险行为而被选用。
- 论文比较了四个R包:BMS(贝叶斯模型抽样)、BayesVarSel(贝叶斯变量选择)、mombf(基于边际似然的模型选择)和BayesFactor(贝叶斯假设检验),各包采用不同的计算策略。
- 通过基准数据集(如波士顿房价和GDP增长率)上的收敛速度与后验包含概率(PIPs)的准确性来评估计算性能,结果在烧除期后进行评估。
- 分析包括各包间PIPs的数值比较,以及固定协变量、主效应优先于交互效应的层次结构原则(heredity principle)实施、收敛诊断等特性的评估。
- 研究使用模拟数据与真实数据,检验各包结果的稳健性与一致性,重点关注可重现性与实际可用性。
实验结果
研究问题
- RQ1在单变量线性回归中,四个R包(BMS、BayesVarSel、mombf、BayesFactor)在贝叶斯变量选择的计算效率与收敛速度方面如何比较?
- RQ2不同先验分布(特别是传统先验)的差异在多大程度上影响各包的后验模型概率与包含概率?
- RQ3对于小样本、中等样本或大样本量的研究者而言,哪个包在灵活性、可用性与性能之间提供了最佳平衡?
- RQ4固定协变量、层次建模(层次结构原则)、并行计算等特性在实际包选择中起到何种影响?
- RQ5后验包含概率(PIPs)在各包中是否可靠?它们是否在合理计算时间内收敛至相近值?
主要发现
- 所有四个包在计算30分钟后产生的后验包含概率(PIPs)高度相似,差异最多仅在小数点后第二位。
- 当样本量较小时,推荐使用BayesVarSel,因其计算效率高且收敛速度快,尤其在$ n $较小时表现更优。
- 当数据集较大时,推荐使用BMS,因其具有良好的可扩展性,能高效处理高维模型空间,尤其在$ n $较大时表现更佳。
- 由于其相对缓慢的性能和较差的可扩展性,尤其在$ p $或$ n $较大时,不推荐将BayesFactor用于一般用途。
- mombf使用了与传统Zellner-Siow族略有不同的先验,但能快速获得与之相当的PIPs估计值,尽管其估计值的变异性略高于BMS或BayesVarSel。
- BMS提供更优的收敛诊断工具与MCMC收敛监控功能,而BayesVarSel与BMS均支持并行计算,可在多核系统上显著提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。