Skip to main content
QUICK REVIEW

[论文解读] BONuS: Multiple multivariate testing with a data-adaptivetest statistic

Chiao-Yu Yang, Lihua Lei|arXiv (Cornell University)|Jun 29, 2021
Statistical Methods in Clinical Trials参考文献 33被引用 4
一句话总结

BONuS 是一种用于多重多变量检验的数据自适应经验贝叶斯框架,通过从完整数据集中学习最优 p 值变换来提高统计统计功效,同时在有限样本中严格控制错误发现率(FDR)——即使在模型误设的情况下亦然。它采用遮蔽数据方案,实现交互式模型构建,同时不损害 FDR 控制。

ABSTRACT

We propose a new adaptive empirical Bayes framework, the Bag-Of-Null-Statistics (BONuS) procedure, for multiple testing where each hypothesis testing problem is itself multivariate or nonparametric. BONuS is an adaptive and interactive knockoff-type method that helps improve the testing power while controlling the false discovery rate (FDR), and is closely connected to the "counting knockoffs" procedure analyzed in Weinstein et al. (2017). Contrary to procedures that start with a $p$-value for each hypothesis, our method analyzes the entire data set to adaptively estimate an optimal $p$-value transform based on an empirical Bayes model. Despite the extra adaptivity, our method controls FDR in finite samples even if the empirical Bayes model is incorrect or the estimation is poor. An extension, the Double BONuS procedure, validates the empirical Bayes model to guard against power loss due to model misspecification.

研究动机与目标

  • 解决在每个假设涉及高维或非参数数据的多重检验场景中,无偏多变量检验统计功效低下的问题。
  • 开发一种方法,从联合数据分布中学习最优检验统计量,以提升各假设下的平均功效。
  • 即使经验贝叶斯模型误设或估计不佳,也确保有限样本中的 FDR 控制。
  • 提供一种稳健、可交互的框架,使分析人员能够使用合成对照改进检验统计量,同时不违反 FDR 保证。

提出的方法

  • BONuS 使用‘零统计量集合’方法,通过汇集所有 n 个多变量假设的信息,估计数据自适应的 p 值变换。
  • 它采用遮蔽数据方案,将部分数据从分析人员处隐藏,从而在保持有限样本 FDR 控制的前提下,实现安全的交互式模型拟合。
  • 该方法通过选择最大拒绝区域来估计最优嵌套拒绝区域序列,前提是 FDP 估计量低于预设的 α 水平。
  • 它采用经验贝叶斯模型,从数据中学习对替代参数的先验分布,聚焦于从零假设偏离的最相关方向。
  • Double BONuS 扩展采用类似交叉验证的验证方法,测试多个模型并选择性能最佳者,以防范模型误设。
  • 在多变量正态和多项分布设置中,BONuS 使用稳健协方差估计和合成控制生成方法,构建依赖结构下的有效零分布。

实验结果

研究问题

  • RQ1与 GLRT 等无偏方法相比,数据自适应的检验统计量是否能在低维设置下显著提升多变量多重检验的功效?
  • RQ2当经验贝叶斯先验模型错误或估计不佳时,BONuS 程序是否仍能保持有限样本 FDR 控制?
  • RQ3在具有多变量表型的全基因组关联研究(GWAS)等真实应用场景中,BONuS 表现如何?
  • RQ4Double BONuS 程序是否能通过模型验证有效防范因模型误设导致的功效损失?
  • RQ5当底层信号稀疏且具有方向性时,BONuS 相较于标准 FDR 程序(如 Benjamini-Hochberg)能多大程度上实现性能超越?

主要发现

  • 在十维正态分布模拟中,BONuS 使用信号方向的插值估计器,实现了接近理论最优(oracle)的功效,显著优于 GLRT 和无偏方法。
  • 在多重检验中,BONuS 的真正发现比例显著高于使用 GLRT 统计量的 Benjamini-Hochberg 程序,尤其在低 α 水平下表现更优。
  • 在代谢综合征 GWAS 研究中,BONuS 检测到的发现数多于无偏方法,尽管由于每个 SNP 的效应预期稀疏,增益相对适中。
  • Double BONuS 程序通过验证多个模型并选择最优者,展现出稳健性,有效减少了因模型误设导致的功效损失。
  • BONuS 在所有实验中均保持了有限样本 FDR 控制,即使经验贝叶斯模型误设,证实了其理论稳健性。
  • 在依赖结构下,该方法性能稳定,如在多项分布和 GWAS 应用中所示,稳健协方差估计使有效合成控制成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。