Skip to main content
QUICK REVIEW

[논문 리뷰] A model selection approach to genome wide association studies

Florian Frommlet, Felix Ruhaltinger|arXiv (Cornell University)|2010. 10. 01.
Genetic Associations and Epidemiology참고 문헌 39인용 수 9
한 줄 요약

이 논문은 복잡한 형질에서 유의미한 유전자형 연관 분석(Causal SNP)을 탐지하는 데 성능을 향상시키기 위해 수정 베이지안 정보 기준(mBIC 및 mBIC2)을 사용하는 모델 선택 접근법을 제안한다. 단일 유전자형을 개별적으로 검정하는 기존의 다중 검정 방식과는 달리, 여러 유전자형을 동시에 모델링함으로써 통계적 검정력과 가짜 양성 결과를 감소시킨다. 이는 시뮬레이션 및 HapMap 유전자 발현 데이터를 활용한 실제 데이터 분석에서 기존의 다중 검정 기법을 능가한다.

ABSTRACT

For the vast majority of genome wide association studies (GWAS) published so far, statistical analysis was performed by testing markers individually. In this article we present some elementary statistical considerations which clearly show that in case of complex traits the approach based on multiple regression or generalized linear models is preferable to multiple testing. We introduce a model selection approach to GWAS based on modifications of Bayesian Information Criterion (BIC) and develop some simple search strategies to deal with the huge number of potential models. Comprehensive simulations based on real SNP data confirm that model selection has larger power than multiple testing to detect causal SNPs in complex models. On the other hand multiple testing has substantial problems with proper ranking of causal SNPs and tends to detect a certain number of false positive SNPs, which are not linked to any of the causal mutations. We show that this behavior is typical in GWAS for complex traits and can be explained by an aggregated influence of many small random sample correlations between genotypes of a SNP under investigation and other causal SNPs. We believe that our findings at least partially explain problems with low power and nonreplicability of results in many real data GWAS. Finally, we discuss the advantages of our model selection approach in the context of real data analysis, where we consider publicly available gene expression data as traits for individuals from the HapMap project.

연구 동기 및 목표

  • 복잡한 유전적 구조에서 단일 마커 검정 기법의 한계, 특히 낮은 검정력과 높은 가짜 양성 비율을 해결하기 위해.
  • 희박한 신호가 있는 고차원 유전자형 데이터에 적합한 수정 BIC 기준(mBIC 및 mBIC2)을 기반으로 한 모델 선택 프레임워크를 개발하기 위해.
  • 시뮬레이션 및 실제 데이터 분석을 통해 모델 선택 기법이 단일 마커 검정 기법보다 유의미한 유전자형을 더 잘 탐지하고 정확하게 순위를 매길 수 있음을 입증하기 위해.
  • 유의미한 유전자형과 비의미한 유전자형 간의 무작위 상관관계로 인해 단일 마커 검정에서 p-값 순서가 불안정해지는 이유를 설명하기 위해.
  • HapMap 유전자 발현 데이터에서 전통적인 다중 검정 기법으로는 탐지되지 않은 새로운 전방성 유전자형 연관 관계를 식별하기 위해.

제안 방법

  • 단일 변수 검정의 한계를 피하기 위해 다중 회귀 또는 일반화선형모형 프레임워크를 사용하여 여러 유전자형을 동시에 모델링한다.
  • 고차원 환경과 희박한 신호 탐지에 적합한 펜alties를 적용한 mBIC 및 mBIC2를 모델 선택 기준으로 사용한다.
  • 이중 단계 검색 전략을 적용: 먼저 전진 선택 또는 걸러내기 방법을 통해 유망한 유전자형 조합을 선별하고, 이후 국소 검색 또는 단계적 방법을 통해 정밀화한다.
  • mBIC에 비해 더 넓은 희박성 조건 하에서 渐近적 최적성을 확보한 mBIC2를 활용하여 모델 선택의 일관성을 향상시킨다.
  • 실제 HapMap 프로젝트의 유전자형 데이터를 활용해 유전적 상관관계가 현실적인 구조를 반영한 GWAS 데이터를 시뮬레이션하고, 모델 성능을 검증한다.
  • 표준 다중 검정 절차와의 비교를 통해 검정력, 가짜 발현률, 진짜 유의미한 유전자형 탐지 능력에 초점을 맞춘다.

실험 결과

연구 질문

  • RQ1복잡한 유전적 모델에서 mBIC 또는 mBIC2를 사용한 모델 선택이 단일 마커 검정보다 유의미한 유전자형 탐지에 더 높은 통계적 검정력을 가지는가?
  • RQ2비의미한 유전자형과 유의미한 유전자형 간의 무작위 상관관계가 단일 마커 GWAS에서 p-값 순서를 어느 정도 왜곡시키는가?
  • RQ3모델 선택 기법은 기존의 다중 검정 기법으로는 탐지하지 못한 생물학적으로 의미 있는 전방성 유전자형 연관 관계를 탐지할 수 있는가?
  • RQ4고차원적이고 희박한 GWAS 환경에서 mBIC와 mBIC2는 모델 선택 일관성과 가짜 양성 제어 측면에서 어떻게 성능을 보이는가?
  • RQ5표본 크기가 실제 GWAS 데이터에서 복잡한 다유전자형 연관 관계를 식별하는 데 있어 모델 선택의 능력에 어떤 영향을 미치는가?

주요 결과

  • mBIC 및 mBIC2를 사용한 모델 선택은 다유전자형 상호작용이 있는 복잡한 모델에서 다중 검정 기법보다 훨씬 뛰어난 성능을 보이며, 유의미한 유전자형을 탐지한다.
  • 단일 마커 검정은 모델링되지 않은 유의미한 유전자형에 기인한 잔차 제곱합의 과다 증가로 인해 낮은 검정력을 겪으며, 이는 다중 검정 보정으로는 해결되지 않는 핵심적 한계이다.
  • 비의미한 유전자형과 유의미한 유전자형 간의 작은 무작위 상관관계는 잘못된 p-값 순서를 초래하여 가짜 양성 결과와 진짜 유전자형의 탐지 실패를 유발한다.
  • HapMap 유전자 발현 형질에 대한 실제 데이터 분석에서 mBIC2는 원래의 다중 검정 분석에서 발견되지 않은 새로운 전방성 유전자형을 탐지했으며, 원래 연구에서 놓친 한 개의 전방성 유전자형도 포함되어 있었다.
  • 모델 선택 기법은 여러 유전자의 공통 조절 영역을 식별했으며, 특히 염색체 6의 위치 32.5–32.8 Mb에서 강력한 신호를 보였고, 이 지역의 다수의 전방성 유전자형이 유의미한 유전자형과 높은 상관관계를 보였다.
  • 표본 크기가 작아 최대 모델 크기가 11개 유전자형으로 제한되었음에도 불구하고, 생물학적으로 타당한 연관 관계를 탐지했으며, 더 큰 코hort에서 더 큰 잠재력을 지닌 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.