[论文解读] Bootstrap inference after using multiple queries for model selection
本文提出了一种基于自助法的推断方法,用于在非参数设定下对多次查询后的模型选择进行推断,利用选择性中心极限定理和投影Langevin蒙特卡洛采样。该方法在一大类分布上实现了对称渐近枢轴的自助统计量,通过允许在复杂选择程序(包括数据切割和多视角)后构造有效的置信区间和假设检验,解决了Lees和Pötscher(2006a)提出的不可能性结果。
In this work, we provide a refinement of the selective CLT result of Tian and Taylor (2015), which allows for selective inference in non-parametric settings by adjusting for the asymptotic Gaussian limit for selection. Under some regularity assumptions on the density of the randomization, including heavier tails than Gaussian satisfied by e.g. logistic distribution, we prove the selective CLT holds without any assumptions on the underlying parameter, allowing for rare selection events. We also show a selective CLT result for Gaussian randomization, though the quantitative results are qualitatively different for the Gaussian randomization as compared to the heavier tailed results. Furthermore, we propose a bootstrap version of this test statistic, which is provably asymptotically pivotal uniformly across a family of non-parametric distributions. This result can be interpreted as resolving the impossibility results of Leeb and Potscher (2006). We describe several sampling methods involving the projected Langevin Monte Carlo to compute the bootstrapped test statistic and the corresponding confidence intervals valid after selection. The applications of our work include valid inferential and sampling tools after running various model selection algorithms including their combinations into multiple views/queries framework. We also present a way to do data carving, providing more powerful tests than classical data splitting by reusing the information in the data from the first stage.
研究动机与目标
- 开发一种自助程序,可在使用多次查询进行模型选择后,产生渐近枢轴的推断结果。
- 将选择性中心极限定理(CLT)扩展至具有通用随机化密度的非参数模型,包括重尾分布(如逻辑分布)。
- 通过在选择后构建统一有效的推断,解决Lees和Pötscher(2006a)的不可能性结果,即使在罕见选择事件下也成立。
- 实现数据切割并重用多次查询中的信息,从而在功效上优于经典的数据分割方法。
- 提供基于投影Langevin蒙特卡洛的实用采样算法,用于计算自助检验统计量和置信区间。
提出的方法
- 采用选择性CLT框架,对多次查询的选择结果进行条件化处理,通过选择性似然比调整选择偏差。
- 应用具有拉普拉斯、逻辑或高斯密度等随机化机制,确保在不假设底层参数条件下选择性CLT成立。
- 开发出一个在非参数分布族上统一渐近枢轴的自助检验统计量。
- 采用投影Langevin蒙特卡洛采样从选择性自助分布中生成样本,使用基于梯度的优化变量和随机化参数更新。
- 推导出选择性自助分布对数密度的显式梯度表达式,从而在自助权重和辅助变量上实现高效的MCMC采样。
- 提出两种采样方案:一种用于选择性自助,另一种用于野生自助,两者均使用重参数化的随机化映射和雅可比校正。
实验结果
研究问题
- RQ1能否构造一种自助程序,使得在非高斯或重尾误差分布下,即使在多次模型选择查询后,仍能实现渐近枢轴的推断?
- RQ2选择性CLT是否能在不假设底层参数有界或远离选择边界的情况下,统一适用于非参数模型?
- RQ3如何实现数据切割,以重用模型选择第一阶段的信息,从而在功效上优于经典的数据分割方法?
- RQ4在高维、非i.i.d.设定下,哪些采样方法能有效近似选择性自助分布?
- RQ5能否通过使用随机化选择和自助校准,绕过Lees和Pötscher(2006a)在后选择推断中提出的不可能性结果?
主要发现
- 在随机化密度满足正则性条件(包括重于高斯分布的尾部,如逻辑分布)时,选择性CLT即使在罕见选择事件下也成立,且无需对底层参数做任何假设。
- 对于高斯随机化,选择性CLT仍然成立,但其渐近行为与重尾分布相比具有定性差异。
- 所提出的自助检验统计量在一大类非参数模型上统一渐近枢轴,确保在多样化数据生成机制下均能实现有效推断。
- 基于梯度更新的投影Langevin蒙特卡洛采样可高效计算选择后的自助置信区间和检验统计量。
- 该方法通过重用选择第一阶段的信息支持数据切割,从而在功效上优于经典的数据分割方法。
- 在多视角和组LASSO设定下,理论与实际结果均得到验证,并为广义线性模型和非高斯误差提供了显式采样算法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。