Skip to main content
QUICK REVIEW

[논문 리뷰] Inferring genotyping error rates from genotyped trios

Luke Jostins|arXiv (Cornell University)|2011. 09. 07.
Genetic Associations and Epidemiology참고 문헌 8인용 수 3
한 줄 요약

이 논문은 메נדל 유전 법칙과 앨레일 빈도 데이터를 이용해 삼형제 유전체에서 유전체 오류율을 추정하는 가능성 기반 방법을 제시한다. 이는 정확한 최대우도 추정을 가능하게 한다. 23andMe의 삼형제 데이터에 적용한 결과, 오류율이 8.5 × 10⁻⁵(95% 신뢰구간: 6.8–10.2 × 10⁻⁵)로 낮게 추정되었으며, 개인 유전체 데이터에서 높은 유전체 정확도를 보여준다.

ABSTRACT

Genotyping errors are known to influence the power of both family-based and case-control studies in the genetics of complex disease. Estimating genotyping error rate in a given dataset can be complex, but when family information is available error rates can be inferred from the patterns of Mendelian inheritance between parents and offspring. I introduce a novel likelihood-based method for calculating error rates from family data, given known allele frequencies. I apply this to an example dataset, demonstrating a low genotyping error rate in genotyping data from a personal genomics company.

연구 동기 및 목표

  • 기존의 메נדל 오류율 측정 방법의 한계를 해결하기 위해, 가족 삼형제 데이터에서 유전체 오류율을 추정하는 강력한 통계적 방법을 개발하는 것.
  • 메נדל 불일치 유전자형과 하디-바이너게 평형 하에서의 전체 유전자형 빈도 분포를 모두 통합하여 오류율 추정을 향상시키는 것.
  • 오류가 발생한 유전자형과 오류가 없는 유전자형을 모두 고려하는 가능성 기반 프레임워크를 제공하여 추정 정확도를 높이는 것.
  • 실제 개인 유전체 기업의 데이터를 적용하여 고속 유전체 분석 플랫폼에서의 유전체 품질을 평가하는 것.

제안 방법

  • 이 방법은 삼형제의 N개 유전자위에서 관측된 유전자형과 진짜 유전자형의 결합 가능도를 모델링하며, 메נדל 유전 법칙과 하디-바이너게 평형 하에서의 유전자형 빈도를 통합한다.
  • 오직 단일 오류만 발생한다고 가정하는 단순화된 오류 모델을 사용하며, ε² 이상의 항은 무시한다. 오류가 없을 확률은 (1−ε)⁶, 한 개의 오류가 있을 확률은 ε(1−ε)⁵이다.
  • 관측된 유전자형이 진짜 유전자형과 일치하는 항과 한 개의 유전자형 오류가 있는 항으로 가능도를 분할하여, 사전에 계산된 유전자형 빈도를 활용해 효율적인 계산을 가능하게 한다.
  • 최대우도 추정은 가능도 함수를 오류율 ε에 대해 최적화하여 수행되며, 사전에 계산된 유전자형 빈도 항을 사용한다.
  • 하디-바이너게 평형 하에서의 유전자형 확률에 대한 사전 확률을 제공하기 위해 외부 자료(예: HapMap 3 CEU 데이터)의 앨레일 빈도를 활용한다.
  • 오류율에 대한 신뢰구간은 표준 가능도 프로파일 방법을 사용하여 유도된다.

실험 결과

연구 질문

  • RQ1메נדל 오류율 측정 방법만을 사용하는 것과 비교해, 가능성 기반 방법이 유전체 오류율 추정을 향상시킬 수 있는가?
  • RQ2메נדל 불일치 유전자형과 전체 유전자형 빈도 스펙트럼을 모두 통합함으로써 오류율 추론이 어떻게 향상되는가?
  • RQ323andMe와 같은 개인 유전체 기업에서 제공하는 고속 유전체 분석 데이터의 진짜 유전체 오류율은 얼마인가?
  • RQ4유전체 분석에서 희귀 오류가 유전적 연관 연구의 검정력과 신뢰성에 어느 정도 영향을 미치는가?

주요 결과

  • 이 방법은 715,566개 변이와 HapMap 3 CEU 앨레일 빈도를 사용하여 23andMe에서 유전체 분석을 수행한 삼형제 데이터를 바탕으로 유전체 오류율 8.5 × 10⁻⁵를 성공적으로 추정하였다.
  • 오류율에 대한 95% 신뢰구간은 6.8 × 10⁻⁵에서 10.2 × 10⁻⁵ 사이로, 추정의 높은 정밀도를 보여준다.
  • 낮은 오류율은 23andMe의 유전체 분석 플랫폼이 높은 정확도를 유지하고 있음을 시사하며, 이는 신뢰할 수 있는 케이스-컨트롤 연관 연구에 매우 중요하다.
  • 이 방법은 오류가 발생한 유전자형과 오류가 없는 유전자형 양측의 정보를 통합함으로써 기존의 메נדל 오류율 측정 방법보다 우수한 성능을 보이며, 추정의 강건성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.