[论文解读] Model Selection and Multiple Testing - A Bayesian and Empirical Bayes Overview and some New Results
本文对模型选择与多重检验提供了全面的贝叶斯与经验贝叶斯综述,引入了高维设定下的新一致性定义,并证明:当参数数量的增长速度慢于样本量时,仅用极小部分数据来使不当先验正规化,而将大部分数据用于推断,可实现一致性最优。核心贡献在于为高维贝叶斯模型选择中的数据分割策略提供了理论依据。
We provide a brief overview of both Bayes and classical model selection. We argue tentatively that model selection has at least two major goals, that of finding the correct model or predicting well, and that in general both these goals may not be achieved in an optimum manner by a single model selection rule. We discuss, briefly but critically, through a study of well-known model selection rules like AIC, BIC, DIC and Lasso, how these different goals are pursued in each paradigm. We introduce some new definitions of consistency, results and conjectures about consistency in high dimensional model selection problems. Finally we discuss some new or recent results in Full Bayes and Empirical Bayes multiple testing, and cross-validation. We show that when the number of parameters tends to infinity at a smaller rate than sample size, then it is best from the point of view of consistency to use most of the data for inference and only a negligible proportion to make an improper prior proper.
研究动机与目标
- 为在高维设定下调和正确模型识别与最优预测的双重目标,实现模型选择。
- 通过在贝叶斯与经验贝叶斯框架下重新评估其理论基础,解决现有模型选择规则(如AIC、BIC、DIC和Lasso)中的一致性问题。
- 为高维模型选择提出新的、更具实际意义的一致性定义,以更好地反映基因组学等现实场景。
- 研究交叉验证与交叉验证贝叶斯因子在提升模型选择一致性方面的作用,特别是在参数数量随样本量增长时的情形。
- 将经验贝叶斯与多重检验方法扩展至高维及复杂数据结构,如全基因组关联研究(GWAS)中常见的数据结构。
提出的方法
- 提出一种高维模型选择中的一致性新定义,放宽经典一致性的严格要求,使其更适用于具有大量弱信号的现代数据。
- 应用惩罚似然与古迹风险界的概念,评估并比较AIC与BIC等经典准则,表明AIC在预测方面具有最优性,而BIC在特定条件下适用于模型选择。
- 提出一种数据分割策略:仅用极小部分数据使不当先验正规化,其余数据用于推断,前提是参数数量的增长速度慢于样本量。
- 推导出该数据分割策略在模型选择中确保一致性的理论条件,使用大偏差与渐近理论。
- 分析交叉验证贝叶斯因子(CVBF),并证明其在正则条件下渐近等价于标准贝叶斯因子,但其设计可能导致有限样本下产生不同的模型选择结果。
- 将经验贝叶斯方法应用于多重检验问题,特别是在有序或趋势性数据背景下,并讨论在混合方向性FDR控制下向方向性多重检验的扩展。
实验结果
研究问题
- RQ1当正确模型识别与最优预测目标发生冲突时,如何评估模型选择规则?
- RQ2在参数数量随样本量增长的高维设定下,哪些新一致性定义更合适且可证明?
- RQ3在高维贝叶斯模型选择中,何时最优策略是使用几乎所有数据进行推断,仅用可忽略的极小部分数据来正规化不当先验?
- RQ4在有限样本模型选择中,交叉验证贝叶斯因子(CVBF)与标准贝叶斯因子有何不同?其对一致性的含义是什么?
- RQ5经验贝叶斯与多重检验框架能否扩展至处理具有方向性误差控制的高维复杂、有序实验条件?
主要发现
- 当参数数量的增长速度慢于样本量时,使用几乎全部数据进行推断、仅用极小部分数据使不当先验正规化,可实现一致性最优。
- 所提出的高维模型选择一致性新定义比经典定义更具实用性且更易证明,尤其适用于具有大量弱信号的场景。
- 交叉验证贝叶斯因子(CVBF)在正则条件下渐近等价于标准贝叶斯因子,但其设计可能导致有限样本下产生不同的模型选择结果。
- 模拟研究显示,在具有大量真实回归变量(如40个)的GWAS类似设定中,SIS(Sure Independence Screening)程序可能因多基因效应引起的虚假相关性而失效。
- 在具有大量弱信号(多基因)的高维设定中,识别强效应个体基因的前提是其效应必须超过所有多基因组分的总效应,这揭示了一个关键可识别性条件。
- 在有序或趋势性数据中,多重检验的经验贝叶斯框架可借助方向性误差控制进行扩展,但目前尚无适用于此类多维问题的完整贝叶斯解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。