QUICK REVIEW
[论文解读] Bayesian variable selection in high dimensional problems without assumptions on prior model probabilities
James O. Berger, Gonzalo García‐Donato|arXiv (Cornell University)|Jul 11, 2016
Statistical Methods and Inference参考文献 16被引用 5
一句话总结
该论文提出了一种新颖的贝叶斯变量选择方法,适用于高维线性模型(即预测变量数量 $ p $ 超过样本量 $ n $)的情形,且无需对先验模型概率做假设。该方法引入了正则化的传统先验,扩展了标准的 $ g $-先验和 $ g $-混合先验,使得在 $ p \gg n $ 的设定下仍能实现一致的模型选择和后验分布对真实模型的集中。实证结果表明,该方法在识别真实协变量的同时有效排除了虚假协变量,表现强劲。
ABSTRACT
We consider the problem of variable selection in linear models when $p$, the number of potential regressors, may exceed (and perhaps substantially) the sample size $n$ (which is possibly small).
研究动机与目标
- 解决高维线性模型中 $ p \gg n $ 的贝叶斯变量选择问题,这是现代统计学中的常见挑战。
- 消除对先验模型概率相等的假设,该假设在高维设定下通常不现实。
- 开发一类新的先验——正则化传统先验,将其推广至 $ p \gg n $ 的情形,以扩展标准 $ g $-先验和 $ g $-混合先验。
- 在温和的正则性条件下,确保后验一致性并使后验分布集中于真实模型。
- 提供一个理论基础坚实、计算上可行的方法,同时保持如模型选择一致性等经典频率学派性质。
提出的方法
- 引入正则化传统先验作为传统先验的扩展,通过修改先验尺度矩阵 $ \mathbf{S}_\gamma $ 以处理 $ \mathbf{V}_\gamma^T \mathbf{V}_\gamma $ 的奇异问题,从而实现 $ p \gg n $ 的情形。
- 采用层次先验结构,对全局尺度参数 $ t $ 使用混合密度 $ p_n(t) $,确保在 $ n \leq k_\gamma $ 时仍能实现合理的后验推断。
- 使用贝叶因子 $ B_\gamma = m_\gamma(\mathbf{y}) / m_0(\mathbf{y}) $ 作为主要的模型比较工具,其边际似然在新先验下计算。
- 应用预测匹配准则来验证先验结构,确保先验分布对重参数化不变,并在预测意义上与零模型一致。
- 使用后验模型概率 $ f(\boldsymbol{\gamma} \mid \mathbf{y}) \propto B_\gamma f(\boldsymbol{\gamma}) $ 进行模型选择,其中 $ f(\boldsymbol{\gamma}) $ 保持非信息性以避免偏差。
- 将模型空间分解为正则和奇异子集,以分析后验集中性,结果表明当 $ n $ 足够大时,后验质量会集中在正则部分。
实验结果
研究问题
- RQ1在 $ p \gg n $ 的高维模型中,是否可以不假设先验模型概率相等,仍能实现一致的贝叶斯变量选择?
- RQ2传统先验(如 $ g $-先验)应如何扩展以处理 $ p \gg n $ 的情形,同时保持理想的理论性质?
- RQ3在高维线性模型中,$ n/p $ 的比值对后验集中性和模型选择准确性有何影响?
- RQ4与 Lasso 等经典频率学派方法相比,该方法在变量选择准确性和稀疏性方面表现如何?
- RQ5当 $ n \to \infty $ 时,即使 $ p $ 的增长速度快于 $ n $,后验分布是否仍会集中于真实模型?
主要发现
- 在 $ n = 41 $,$ p = 8408 $,且仅有 4 个真实协变量的模拟中,奇异模型子集的后验概率仅为 0.004,表明后验质量强烈集中于正则模型空间。
- 两个真实协变量 $ x_1 $ 和 $ x_3 $ 的包含概率较高(分别为 0.809 和 0.726),而所有虚假协变量的包含概率均低于 0.038。
- 当 $ n = 10 $ 时,奇异子集的后验模型概率为 0.995,表明数据信息被 $ p \gg n $ 所淹没;但当 $ n $ 增加到 30 时,该值下降至 0.320,表明数据信息逐渐增强。
- 后验概率最高的模型(HPM)为 $ \{x_1, x_3\} $,正确识别了真实模型,且该结果在不同混合密度先验选择下均保持稳健。
- Lasso 方法在 $ \lambda_{\text{min}} $ 下选择了 1–38 个虚假变量,而 $ \lambda_{1\text{se}} $ 下仅选择 1–13 个,但中位数模型包含了 $ x_2 $、$ x_{3780} $ 和 $ x_{4494} $,表明其结果不稳定;相比之下,贝叶斯方法表现出稳定且准确的选择。
- 该方法保持了理论一致性:当 $ n \to \infty $ 时,即使 $ p $ 的增长速度快于 $ n $,真实模型的后验概率仍会收敛于 1。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。