Skip to main content
QUICK REVIEW

[论文解读] On Estimating Many Means, Selection Bias, and the Bootstrap

Noah Simon, Richard Simon|arXiv (Cornell University)|Nov 15, 2013
Statistical Methods and Inference参考文献 12被引用 8
一句话总结

该论文提出了一种频率学派框架,用于估计高维均值估计中的选择偏差,其中极端效应大小因选择而被系统性地高估。该方法引入了一种参数自展法来估计并校正这种偏差,表明其性能与经验贝叶斯方法相当,但适用范围更广,尤其在经验贝叶斯方法因模型复杂性或缺乏参数假设而不可行的非正则或非参数设置中表现更优。

ABSTRACT

With recent advances in high throughput technology, researchers often find themselves running a large number of hypothesis tests (thousands+) and esti- mating a large number of effect-sizes. Generally there is particular interest in those effects estimated to be most extreme. Unfortunately naive estimates of these effect-sizes (even after potentially accounting for multiplicity in a testing procedure) can be severely biased. In this manuscript we explore this bias from a frequentist perspective: we give a formal definition, and show that an oracle estimator using this bias dominates the naive maximum likelihood estimate. We give a resampling estimator to approximate this oracle, and show that it works well on simulated data. We also connect this to ideas in empirical Bayes.

研究动机与目标

  • 从频率学派视角正式定义高维均值估计中的选择偏差,特别是当极端效应大小被选中报告时。
  • 为估计均值的顺序统计量定义频率学派偏差,并证明偏差校正估计量在均方误差方面优于朴素的最大似然估计量。
  • 开发一种通用的、基于重采样的方法(参数自展法)来估计这种选择偏差,即使在经验贝叶斯方法因模型复杂性或缺乏参数假设而失效时也适用。
  • 通过模拟和真实数据(如前列腺癌基因表达数据)展示该方法的性能,表明在有利情况下与经验贝叶斯方法高度一致,并在复杂场景中表现出更优的鲁棒性。

提出的方法

  • 将选择偏差定义为样本均值的顺序统计量与所选特征真实均值之间的期望差:$\beta_k = \mathbb{E}[z_{(k)} - \mu_{i(k)}]$。
  • 提出一种参数自展程序,通过从参数估计的正态模型中重采样,并利用顺序统计量的经验分布来估计 $\beta_k$。
  • 使用自展估计 $\hat{\beta}_k$ 通过 $\tilde{\mu}_{i(k)} = z_{(k)} - \hat{\beta}_k$ 校正极端样本均值,从而得到一种降低均方误差的收缩估计量。
  • 将自展估计量与基于 Tweedie 公式和非参数密度估计的经验贝叶斯方法进行比较,突出其在收缩行为上的异同。
  • 将该方法应用于模拟数据和真实高通量数据(如前列腺癌微阵列数据),在多种场景下均表现出一致的性能。
  • 证明在正则条件下,自展估计量具有理论一致性,即随着样本量增加,估计偏差收敛于真实偏差。

实验结果

研究问题

  • RQ1如何从频率学派视角正式定义并量化高维均值估计中的选择偏差?
  • RQ2能否开发一种通用的、基于重采样的方法来估计并校正这种选择偏差,而无需依赖参数先验?
  • RQ3与既有的经验贝叶斯方法相比,所提出的自展方法在偏差减少和均方误差方面表现如何?
  • RQ4在何种场景下,自展方法比经验贝叶斯更具鲁棒性或实用性,尤其是在参数假设不成立时?

主要发现

  • 在经验贝叶斯方法适用的场景下,基于自展法的偏差校正方法在均方误差方面与经验贝叶斯方法表现相当,尤其在具有已知结构的模拟和真实数据中。
  • 该方法显著减少了极端顺序统计量中的选择偏差,校正后的估计值表现出强烈的向总体均值收缩的趋势,尤其对最极端的值更为明显。
  • 当经验贝叶斯方法不可行时(如检验统计量的边际分布未知或复杂时),自展方法仍保持有效且计算上可行。
  • 理论分析证实,随着特征数量的增加,自展估计量收敛于真实偏差,支持其在正则条件下的的一致性。
  • 在前列腺癌数据上的实证结果表明,与朴素样本均值相比,自展收缩估计量对顶级特征的效应大小估计更稳定、更不乐观。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。