Skip to main content
QUICK REVIEW

[论文解读] Set-Based Tests for Genetic Association Using the Generalized Berk-Jones Statistic

Ryan Sun, Xihong Lin|arXiv (Cornell University)|Oct 6, 2017
Genetic Associations and Epidemiology参考文献 24被引用 15
一句话总结

本文提出了广义Berk-Jones(GBJ)检验用于基于集合的遗传关联分析,该方法将Berk-Jones统计量扩展以考虑集合中SNP之间的相关性,在中等稀疏信号下提升了检验效能。该方法可基于汇总统计量实现解析p值计算,在不同信号稀疏性和连锁不平衡模式下表现稳健,相较于GHC和MinP等现有方法在多种情境下表现更优。

ABSTRACT

Studying the effects of groups of Single Nucleotide Polymorphisms (SNPs), as in a gene, genetic pathway, or network, can provide novel insight into complex diseases, above that which can be gleaned from studying SNPs individually. Common challenges in set-based genetic association testing include weak effect sizes, correlation between SNPs in a SNP-set, and scarcity of signals, with single-SNP effects often ranging from extremely sparse to moderately sparse in number. Motivated by these challenges, we propose the Generalized Berk-Jones (GBJ) test for the association between a SNP-set and outcome. The GBJ extends the Berk-Jones (BJ) statistic by accounting for correlation among SNPs, and it provides advantages over the Generalized Higher Criticism (GHC) test when signals in a SNP-set are moderately sparse. We also provide an analytic p-value calculation procedure for SNP-sets of any finite size. Using this p-value calculation, we illustrate that the rejection region for GBJ can be described as a compromise of those for BJ and GHC. We develop an omnibus statistic as well, and we show that this omnibus test is robust to the degree of signal sparsity. An additional advantage of our method is the ability to conduct inference using individual SNP summary statistics from a genome-wide association study. We evaluate the finite sample performance of the GBJ though simulation studies and application to gene-level association analysis of breast cancer risk.

研究动机与目标

  • 解决在信号稀疏且SNP因连锁不平衡而相关时,基于集合的遗传关联检验效能低下的挑战。
  • 将Berk-Jones统计量扩展以考虑SNP集合中SNP之间的相关性,提升小样本下的性能表现。
  • 为任意有限大小的SNP集合开发GBJ的解析p值计算方法,实现基于汇总统计量的推断。
  • 构建一种全貌检验,确保在不同信号稀疏水平和相关性结构下均保持稳健的检验效能。
  • 提供一种在基因水平和通路水平GWAS中常见的中等稀疏设定下,优于GHC、MinP和SKAT等现有方法的方法。

提出的方法

  • GBJ检验通过在标准Berk-Jones统计量中引入SNP间的相关性矩阵,调整由连锁不平衡引起的依赖性。
  • 采用基于上确界(supremum)的检验统计量,通过最大化集合中所有可能SNP子集的证据,提升对稀疏信号的敏感性。
  • 基于广义卡方近似推导出解析p值计算方法,实现无需置换检验的精确推断。
  • 将该方法推广至一类基于上确界的全局检验,使在相关性结构下对HC、GHC、BJ及类似统计量的推断成为可能。
  • 通过将GBJ与其他统计量结合,构建全貌检验,确保对未知信号稀疏性和相关性模式的稳健性。
  • 该方法利用GWAS中单个SNP的汇总统计量,实现无需访问原始基因型数据即可应用。

实验结果

研究问题

  • RQ1Berk-Jones统计量能否被调整以在SNP集合中存在相关性时仍保持高检验效能?
  • RQ2在基因水平GWAS中常见的中等稀疏信号设定下,GBJ与GHC和MinP的性能相比如何?
  • RQ3能否在任意相关性结构下为广义Berk-Jones检验推导出解析p值?
  • RQ4基于GBJ的全貌检验是否能在不同信号稀疏性和相关性水平下保持高检验效能?
  • RQ5GBJ的拒绝域是否可解释为BJ与GHC拒绝域之间的折中,从而在不同信号位置间保持敏感性平衡?

主要发现

  • 在高连锁不平衡设定下,GBJ优于标准Berk-Jones检验,后者因未考虑相关性而丧失效能。
  • GBJ的拒绝域在最极端和中等极端顺序统计量处均接近最优边界,实现对不同信号位置的敏感性平衡。
  • 模拟结果显示,在中等稀疏设定下,GBJ的效能高于GHC和MinP;当信号稀疏且无相关性时,GBJ优于SKAT。
  • 基于GBJ的全貌检验在所有稀疏性水平下均保持稳健效能,且从不表现最差,尽管极少成为最优方法。
  • 在CGEMS乳腺癌GWAS数据中的应用显示,GBJ在所有测试方法中产生最显著的p值,表明其具有强大的实证表现。
  • GBJ的解析p值计算方法准确且计算高效,可广泛应用于基于汇总统计量的GWAS。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。