Skip to main content
QUICK REVIEW

[论文解读] Controlling the joint local false discovery rate is more powerful than meta-analysis methods in joint analysis of summary statistics from multiple genome-wide association studies

Wei Jiang, Weichuan Yu|arXiv (Cornell University)|May 28, 2016
Genetic Associations and Epidemiology参考文献 23被引用 4
一句话总结

本文提出了一种基于汇总统计量的新型联合分析方法,通过控制联合局部错误发现率(Jlfdr)来提升多GWAS研究中的统计功效。该方法利用各研究间z得分的联合分布,在无需个体水平数据的前提下,相较于传统元分析方法展现出更高的统计功效,尤其在异质性条件下表现更优,并在真实数据集中识别出更多真实关联。

ABSTRACT

In genome-wide association studies (GWASs) of common diseases/traits, we often analyze multiple GWASs with the same phenotype together to discover associated genetic variants with higher power. Since it is difficult to access data with detailed individual measurements, summary-statistics-based meta-analysis methods have become popular to jointly analyze data sets from multiple GWASs. In this paper, we propose a novel summary-statistics-based joint analysis method based on controlling the joint local false discovery rate (Jlfdr). We prove that our method is the most powerful summary-statistics-based joint analysis method when controlling the false discovery rate at a certain level. In particular, the Jlfdr-based method achieves higher power than commonly used meta-analysis methods when analyzing heterogeneous data sets from multiple GWASs. Simulation experiments demonstrate the superior power of our method over meta-analysis methods. Also, our method discovers more associations than meta-analysis methods from empirical data sets of four phenotypes. The R-package is available at: http://bioinformatics.ust.hk/Jlfdr.html.

研究动机与目标

  • 开发一种在缺乏个体水平数据时,适用于多GWAS的更强大汇总统计量联合分析方法。
  • 解决传统元分析方法的局限性,即通过合并检验统计量而损失信息,并假设各研究间同质性。
  • 建立一种在固定错误发现率(FDR)控制下最大化统计功效的方法,尤其适用于异质性数据环境。
  • 证明控制联合局部错误发现率(Jlfdr)可获得高于标准元分析技术的统计功效。
  • 提供一个实用的开源R包,便于在真实世界遗传关联研究中实现与应用。

提出的方法

  • 该方法基于联合局部错误发现率(Jlfdr),即局部FDR概念在多研究中的推广,用于估计给定多个GWAS中某SNP的z得分时,该SNP为非关联的概率。
  • 通过高斯混合模型对多个研究的检验统计量(z得分)的联合分布进行建模,假设SNP之间相互独立。
  • 利用EM算法估计混合模型的参数,以推断原假设与备择假设的比例及其对应的效应量分布。
  • 拒绝准则定义为Jlfdr(z) ≤ 阈值,其中阈值设定以控制FDR在预设水平。
  • 该方法已实现为R包,公开发布于http://bioinformatics.ust.hk/Jlfdr.html,供公众使用。
  • 理论上证明该方法是在已知底层分布下最强大的汇总统计量方法,且在FDR控制下具有最优性。

实验结果

研究问题

  • RQ1在分析异质性GWAS数据时,基于汇总统计量的联合分析方法是否能实现高于标准元分析方法的统计功效?
  • RQ2控制联合局部错误发现率(Jlfdr)是否是识别真实遗传关联的更强大准则,相较于传统元分析?
  • RQ3在真实与模拟数据中,Jlfdr方法在发现率与FDR控制方面相较于固定效应与随机效应元分析的表现如何?
  • RQ4在多大程度上,Jlfdr方法在识别真实GWAS数据集中新关联方面优于元分析?
  • RQ5在存在连锁不平衡或模型误设的情况下,Jlfdr方法在何种条件下性能会下降,以及如何改进其性能?

主要发现

  • 在模拟场景中,Jlfdr方法实现了72%的经验功效,而元分析方法仅达36%,表明在异质性数据中具有显著更高的功效。
  • 在GIANT的BMI数据集中,Jlfdr方法识别出2,717个相关SNP,而固定效应元分析为2,667个,随机效应元分析为2,186个,FDR水平相同。
  • 在WHRadjBMI数据集中,Jlfdr方法发现了452个SNP,超过固定效应元分析的420个和随机效应元分析的192个,FDR = 5×10⁻⁵。
  • Jlfdr方法识别出四个元分析方法未检测到的新基因座,凸显其发现以往遗漏关联的能力。
  • 当研究间存在异质性时,Jlfdr方法优于元分析,因其保留了元分析在合并统计量时丢失的研究层面变异信息。
  • 在同质性条件下,Jlfdr方法退化为固定效应元分析,证实其在理想条件下与既定方法的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。