Skip to main content
QUICK REVIEW

[论文解读] Selection Bias Correction and Effect Size Estimation under Dependence

Kean Ming Tan, Noah Simon|arXiv (Cornell University)|May 16, 2014
Statistical Methods and Inference被引用 4
一句话总结

该论文提出了一种新颖的频率学方法,用于校正当未校正检验统计量存在依赖关系时高维效应量估计中的选择偏差,通过非参数和参数自助法重采样以考虑相关结构。在模拟和真实基因表达数据中,该方法在存在依赖关系时优于基于独立估计的现有技术,且无需正态性假设。

ABSTRACT

We consider large-scale studies in which it is of interest to test a very large number of hypotheses, and then to estimate the effect sizes corresponding to the rejected hypotheses. For instance, this setting arises in the analysis of gene expression or DNA sequencing data. However, naive estimates of the effect sizes suffer from selection bias, i.e., some of the largest naive estimates are large due to chance alone. Many authors have proposed methods to reduce the effects of selection bias under the assumption that the naive estimates of the effect sizes are independent. Unfortunately, when the effect size estimates are dependent, these existing techniques can have very poor performance, and in practice there will often be dependence. We propose an estimator that adjusts for selection bias under a recently-proposed frequentist framework, without the independence assumption. We study some properties of the proposed estimator, and illustrate that it outperforms past proposals in a simulation study and on two gene expression data sets.

研究动机与目标

  • 解决在未校正估计存在依赖关系时高维效应量估计中的选择偏差问题,这是基因组学和大规模推断中的常见问题。
  • 克服现有方法假设未校正估计之间相互独立的局限性,而这种假设在真实数据(如基因表达数据)中常被违反。
  • 开发一种稳健的非参数框架,避免对数据或检验统计量施加强参数假设(如正态性)。
  • 提供一种实用且可推广的方法,适用于广泛类型的检验统计量和数据类型,包括非正态分布。
  • 通过模拟和前列腺癌与肺癌基因表达数据集的真实数据应用,展示效应量估计准确性的提升。

提出的方法

  • 将 Simon 和 Simon (2016) 的频率学框架适配于在未校正估计存在依赖关系时校正选择偏差,且不假设未校正估计之间相互独立。
  • 使用非参数自助法重采样检验统计量的联合分布,以在重采样数据中保持观察到的依赖结构。
  • 在多元正态假设下使用参数自助法,以建模未校正估计的依赖结构。
  • 通过在自助重采样中平均,估计给定观察到的检验统计量时真实效应量的条件期望,从而校正选择偏差。
  • 将基于自助法的估计器应用于校正最大效应量估计,这些估计最易因选择偏差而被过度估计。
  • 通过训练/测试集划分的交叉验证验证该方法,性能通过测试集中校正估计与未校正估计之间平方差之和来衡量。

实验结果

研究问题

  • RQ1未校正检验统计量之间的依赖关系如何影响假设独立性的现有选择偏差校正方法的准确性?
  • RQ2当未校正估计存在依赖关系时,基于自助法的频率学框架能否有效校正选择偏差?
  • RQ3在存在依赖关系时,所提出方法与经验贝叶斯及 James-Stein 类估计器的性能相比如何?
  • RQ4通过自助法重采样考虑依赖关系是否能提高真实基因表达数据中效应量估计的准确性?
  • RQ5在特征相关性较高的高维设置中,所提出方法在多大程度上减少了极端效应量的过度估计?

主要发现

  • 所提出的参数和非参数自助法在未校正估计存在依赖关系时,显著优于现有方法(如 tweedie、nlpden 和 James-Stein)。
  • 在前列腺癌数据集中,采用相关性校正的参数自助法(para-cor)在 k=15 时取得最低的平方差之和(51.07),优于所有其他方法。
  • 在肺癌数据集中,para-cor 再次表现最佳(k=15 时为 59.38),表明其在真实世界数据中对依赖关系具有鲁棒性。
  • 非参数自助法(nonpara)表现几乎与参数版本相当,表明其在无需正态性假设的情况下也有效。
  • 依赖于密度估计的方法(nlpden、tweedie)表现较差,原因在于极端值不足,难以准确估计边际密度。
  • 采用相关性校正的参数自助法(para-cor)优于无相关性校正的版本(para-uncor),证实建模依赖关系可提升估计准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。