Skip to main content
QUICK REVIEW

[논문 리뷰] The Expected Linkage Disequilibrium in Finite Populations Revisited

Ulrike Ober, Alexander Malinowski|arXiv (Cornell University)|2013. 04. 17.
Genetic Mapping and Diversity in Plants and Animals참고 문헌 32인용 수 9
한 줄 요약

이 논문은 유한한 집단에서의 기대 연합불균형도(LD)를 다루며, 기존의 널리 사용되는 Sved의 공식보다 더 수학적으로 엄밀한 마르코프 체인 기반의 재귀 공식을 제안한다. 저자들은 자신의 접근 방식이 효과적 집단 크기($N_e$)의 더 정확한 추정치를 제공함을 보이며, 재귀 공식의 오차가 소형 등위유전자 빈도 분포에 따라 $N_e$ 추정치에 최대 30%의 변동을 일으킬 수 있음을 밝힌다. 특히 HapMap 데이터 분석에서 그러한 영향이 두드러진다.

ABSTRACT

The expected level of linkage disequilibrium (LD) in a finite ideal population at equilibrium is of relevance for many applications in population and quantitative genetics. Several recursion formulae have been proposed during the last decades, whose derivations mostly contain heuristic parts and therefore remain mathematically questionable. We propose a more justifiable approach, including an alternative recursion formula for the expected LD. Since the exact formula depends on the distribution of allele frequencies in a very complicated manner, we suggest an approximate solution and analyze its validity extensively in a simulation study. Compared to the widely used formula of Sved, the proposed formula performs better for all parameter constellations considered. We then analyze the expected LD at equilibrium using the theory on discrete-time Markov chains based on the linear recursion formula, with equilibrium being defined as the steady-state of the chain, which finally leads to a formula for the effective population size N_e. An additional analysis considers the effect of non-exactness of a recursion formula on the steady-state, demonstrating that the resulting error in expected LD can be substantial. In an application to the HapMap data of two human populations we illustrate the dependency of the N_e-estimate on the distribution of minor allele frequencies (MAFs), showing that the estimated N_e can vary by up to 30% when a uniform instead of a skewed distribution of MAFs is taken as a basis to select SNPs for the analyses. Our analyses provide new insights into the mathematical complexity of the problem studied.

연구 동기 및 목표

  • 기존의 Sved의 공식에 대한 기대 연합불균형도($\mathbb{E}(r^2)$) 유도 과정에서의 수학적 한계를 해결하기 위해.
  • 이산 시간 마르코프 체인을 활용하여 기대 LD에 대한 더 타당하고 수학적으로 타당한 재귀 공식을 개발하기 위해.
  • 재귀 공식의 부정확성이 정착 상태의 LD와 $N_e$ 추정치에 미치는 영향을 정량화하기 위해.
  • 실제 게놈 데이터(예: HapMap)에서 소형 등위유전자 빈도(MAF) 분포가 $N_e$ 추정치에 어떻게 영향을 미치는지 분석하기 위해.
  • LD 패atters를 바탕으로 효과적 집단 크기($N_e$)를 더 정확하고 이론적으로 탄탄한 방법으로 추정하기 위한 방법을 제공하기 위해.

제안 방법

  • 이산 시간 마르코프 체인 모델을 사용하여, 첫 번째 룩스에서의 유전적 동일성(Identity by Descent, IBD)이 있을 조건에서 두 번째 룩스에서의 IBD 확률에 대한 선형 재귀 공식을 수립한다.
  • 마르코프 체인의 정적 분포 $\boldsymbol{\pi}^*$를 유도하여 평형 상태에서의 기대 LD를 정확히 계산하며, 이전 유도에서의 히우리스틱 가정을 엄밀한 확률론으로 대체한다.
  • 진짜 전이 동역학과의 편차를 정량화하기 위해 오차 항 $\boldsymbol{\varepsilon}$을 도입하고, 이로 인한 $\mathbb{E}(r^2)$에 미치는 영향을 평가한다.
  • 다양한 $N$과 $c$를 가진 시뮬레이션 연구를 수행하여, 새로운 재귀 공식이 Sved의 공식보다 성능이 얼마나 우수한지 평가한다.
  • 모델을 HapMap 데이터에 적용하여 $N_e$ 추정치가 소형 등위유전자 빈도(MAF) 스펙트럼에 어떻게 의존하는지 분석한다.
  • 재귀 공식의 부정확성에 의한 $N_e$ 추정치 민감도 평가를 위해 상대 오차 측정치 $\left|\frac{\boldsymbol{\pi}^{*}\boldsymbol{\varepsilon}}{b}\right|$를 활용한다.

실험 결과

연구 질문

  • RQ1기존의 히우리스틱 접근 방식보다 더 수학적으로 엄밀한 방법으로 기대 연합불균형도를 어떻게 도출할 수 있는가?
  • RQ2재귀 공식의 부정확성이 정착 상태의 기대 LD와 그에 따른 $N_e$ 추정치에 어떤 영향을 미치는가?
  • RQ3소형 등위유전자 빈도(MAF) 분포가 LD 자료에서 효과적 집단 크기($N_e$) 추정치에 어떻게 영향을 미치는가?
  • RQ4다양한 파rameter 설정에서 제안된 마르코프 체인 기반 재귀 공식이 Sved의 공식보다 얼마나 더 정확한가?
  • RQ5이론적 프레임워크는 HapMap과 같은 실제 게놈 데이터에 적용되어 $N_e$ 추정치의 편향을 드러낼 수 있는가?

주요 결과

  • 모의 실험에서 모든 테스트 파라미터 조합($N = 4, 8, 16$, $c = 0.001$에서 $0.3$)에서 제안된 재귀 공식이 Sved의 공식보다 더 우수한 성능을 보였다.
  • 재귀 공식의 오차로 인한 기대 LD의 상대 오차는 상당히 클 수 있으며, $\left|\frac{\boldsymbol{\pi}^{*}\boldsymbol{\varepsilon}}{b}\right|$는 모델 신뢰성에 대한 핵심 진단 지표가 된다.
  • HapMap 데이터에서는 SNP 선택에 균일한지 혹은 비대칭적인 MAF 분포를 가정하느냐에 따라 $N_e$ 추정치가 최대 30%까지 변동할 수 있다.
  • 마르코프 체인의 정적 분포 $\boldsymbol{\pi}^*$는 평형 상태에서의 기대 LD를 정확히 계산할 수 있게 하여 이전 유도에서의 히우리스틱 가정을 대체한다.
  • 분석 결과 Sved의 공식은 널리 사용되지만, 특히 재귀 공식 유도와 항등식 $Q_T = \mathbb{E}(r_T^2)$ 유도 과정에서 수학적으로 의심스러운 유도를 하고 있음을 확인했다.
  • 본 연구는 SNP 선택 시 MAF 분포의 선택이 $N_e$ 추정치에 상당한 영향을 미치며, 이는 인구 유전학적 추론에서 중요한 편향 원인이 됨을 드러냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.