[논문 리뷰] Controlling the joint local false discovery rate is more powerful than meta-analysis methods in joint analysis of summary statistics from multiple genome-wide association studies
이 논문은 개별 데이터가 가용하지 않은 다중 GWAS 연구에서 통계적 검정력을 향상시키기 위해 요약 통계 기반의 공동 분석 방법을 제안한다. 이 방법은 연합 국소 FDR(Jlfdr)를 제어하여, 특히 이질성 존재 시 기존 메타분석 방법보다 높은 검정력을 확보한다. 개별 수준의 데이터가 필요로 하지 않으며, 실제 데이터 세트에서 더 많은 참 연관성을 식별한다.
In genome-wide association studies (GWASs) of common diseases/traits, we often analyze multiple GWASs with the same phenotype together to discover associated genetic variants with higher power. Since it is difficult to access data with detailed individual measurements, summary-statistics-based meta-analysis methods have become popular to jointly analyze data sets from multiple GWASs. In this paper, we propose a novel summary-statistics-based joint analysis method based on controlling the joint local false discovery rate (Jlfdr). We prove that our method is the most powerful summary-statistics-based joint analysis method when controlling the false discovery rate at a certain level. In particular, the Jlfdr-based method achieves higher power than commonly used meta-analysis methods when analyzing heterogeneous data sets from multiple GWASs. Simulation experiments demonstrate the superior power of our method over meta-analysis methods. Also, our method discovers more associations than meta-analysis methods from empirical data sets of four phenotypes. The R-package is available at: http://bioinformatics.ust.hk/Jlfdr.html.
연구 동기 및 목표
- 개별 수준의 데이터가 확보되지 않은 다중 GWAS 연구에 대해 더 높은 검정력을 갖춘 요약 통계 기반 공동 분석 방법을 개발하는 것.
- 기존 메타분석 방법의 한계를 해결하기 위해, 검정 통계량을 요약함으로써 정보를 손실하고 연구 간 동질성을 가정하는 문제를 해결하는 것.
- 특히 이질성 있는 데이터 설정에서 고정된 FDR 제어 하에 통계적 검정력을 최대화하는 방법을 수립하는 것.
- 연합 국소 FDR(Jlfdr)를 제어할 경우 기존 메타분석 기법보다 더 높은 검정력을 확보할 수 있음을 입증하는 것.
- 실제 유전 연관성 연구에 적용 가능한 실용적이고 오픈소스인 R 패키지를 제공하는 것.
제안 방법
- 이 방법은 다수의 연구에 걸쳐 z-통계량의 조합을 고려한 국소 FDR 개념의 일반화인 연합 국소 FDR(Jlfdr)에 기반한다. 이는 특정 SNP가 연관이 없을 확률을 다수의 GWAS에서의 z-통계량을 바탕으로 추정한다.
- 다양한 연구에서의 검정 통계량(z-통계량)의 연합 분포를 정규 분포 혼합 모형으로 모델링하며, SNP 간 상관관계가 없다는 가정을 둔다.
- 혼합 모형의 매개변수는 EM 알고리즘을 통해 추정되어, 귀무가설과 대립가설의 비율 및 해당 효과 크기 분포를 추론한다.
- 기각 기준은 Jlfdr(z) ≤ 임계값으로 정의되며, 이 임계값은 사전 설정된 수준에서 FDR를 제어하도록 설정된다.
- 이 방법은 공개적으로 사용 가능한 R 패키지로 구현되어 있으며, http://bioinformatics.ust.hk/Jlfdr.html 에서 이용할 수 있다.
- 이론적으로 알려진 배경 분포 하에서 Jlfdr 방법은 요약 통계 기반 분석 중에서 가장 검정력이 높은 방법이며, FDR 제어 하에서 최적성도 입증되어 있다.
실험 결과
연구 질문
- RQ1이질적인 GWAS 데이터를 분석할 때, 요약 통계 기반 공동 분석 방법이 기존 메타분석 방법보다 더 높은 통계적 검정력을 확보할 수 있는가?
- RQ2연합 국소 FDR(Jlfdr)를 제어하는 것이 기존 메타분석 기법보다 진정한 유전 연관성을 식별하는 데 더 높은 검정력을 제공하는가?
- RQ3실제 및 시뮬레이션 데이터 기반으로, Jlfdr 방법의 발견률 및 FDR 제어 성능이 고정효과 및 랜덤효과 메타분석과 비교해 어떻게 되는가?
- RQ4실제 GWAS 데이터 세트에서 Jlfdr 방법이 메타분석에 비해 얼마나 더 많은 새로운 연관성을 식별하는가?
- RQ5Jlfdr 방법이 연합형태나 모형 오류가 발생할 경우에 어떻게 성능이 저하되는가? 그리고 연합형태나 모형 오류 상황에서 성능을 향상시키기 위한 방법은 무엇인가?
주요 결과
- Jlfdr 기반 방법은 메타분석 방법이 36%에 그치는 시뮬레이션 시나리오에서 72%의 실증적 검정력을 확보하여 이질성 있는 데이터에서 뛰어난 검정력을 입증한다.
- GIANT의 BMI 데이터 세트에서 Jlfdr 방법은 FDR 수준이 동일할 때 고정효과 메타분석의 2,667개보다 더 많은 2,717개의 연관 SNP를 식별했다.
- WHRadjBMI 데이터 세트에서는 Jlfdr 방법이 고정효과 메타분석의 420개, 랜덤효과 메타분석의 192개를 초월해 FDR = 5×10⁻⁵에서 452개의 SNP를 발견했다.
- Jlfdr 방법은 메타분석 기법이 탐지하지 못한 네 개의 새로운 유전자 위치를 식별하여, 이전에 놓친 연관성을 회수할 수 있음을 보여준다.
- 연구 간 이질성이 존재할 경우, Jlfdr 방법은 메타분석에서 손실되는 연구 수준의 변동성 정보를 유지하므로 메타분석보다 더 뛰어난 성능을 보인다.
- 동질성 조건에서는 Jlfdr 방법이 고정효과 메타분석으로 수렴하여 이상적인 조건에서 기존 방법과의 일致성을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.