Skip to main content
QUICK REVIEW

[논문 리뷰] YFitter: Maximum likelihood assignment of Y chromosome haplogroups from low-coverage sequence data

Luke Jostins, Yali Xu|arXiv (Cornell University)|2014. 07. 30.
Genetic Associations and Epidemiology참고 문헌 10인용 수 16
한 줄 요약

YFitter는 저용량 시퀀싱 또는 유전자형 데이터로부터 Y 염색체 히브로그룹을 할당하기 위해 최대우도법과 동적 프로그래밍을 사용하는 방법이다. 이 방법은 신뢰도 집합을 통해 불확실성을 정량화하면서도 정확하게 히브로그룹을 규명한다. 높은 정확도와 해상도를 달성하여 수작업 할당 및 기존 도구들을 능가하며, 특히 유전자형 및 시퀀싱 데이터 응용에서 뛰어난 성능을 보인다.

ABSTRACT

Low-coverage short-read resequencing experiments have the potential to expand our understanding of Y chromosome haplogroups. However, the uncertainty associated with these experiments mean that haplogroups must be assigned probabilistically to avoid false inferences. We propose an efficient dynamic programming algorithm that can assign haplogroups by maximum likelihood, and represent the uncertainty in assignment. We apply this to both genotype and low-coverage sequencing data, and show that it can assign haplogroups accurately and with high resolution. The method is implemented as the program YFitter, which can be downloaded from http://sourceforge.net/projects/yfitter/

연구 동기 및 목표

  • 저용량 시퀀싱 데이터에서 확률적이고 자동화된 Y 염색체 히브로그룹 할당 문제를 해결하기 위해, 불확실성과 저용량으로 인한 잘못된 추론를 방지하고자 한다.
  • Y 염색체 히브로그룹 나무 전체에 걸쳐 우도를 계산하는 효율적인 알고리즘을 개발하여 최대우도 할당과 함께 불확실성의 해소를 가능하게 하고자 한다.
  • 대규모 인구유전학 연구를 위한 확장 가능한 자동화된 솔루션을 제공하여 시간이 많이 소요되는 수작업 할당을 대체하고자 한다.
  • 아카이크 정보 기준(Akaike Information Criterion, AIC)을 활용해 히브로그룹 할당에 불확실성 정량화를 통합하여 통계적 지지를 반영하는 신뢰도 히브로그룹 집합을 생성하고자 한다.

제안 방법

  • Y 염색체 히브로그룹의 계통수를 사용하며, 변이를 지점별 변이로 정의하고, 각 위치의 리드 데이터를 기반으로 우도를 계산한다.
  • 하향 우도 $ L^{ ightarrow}_{i} $ 는 叶 노드에서 상향 방향으로 계산되며, 노드 $ i $ 에서 돌연변이가 없을 경우 하류 리드를 관측할 확률을 나타낸다.
  • 상향 우도 $ L^{ ightarrow}_{i} $ 는 루트에서 하향 방향으로 계산되며, 노드 $ i $ 에서 돌연변이가 존재할 경우 비자손 리드를 관측할 확률을 나타낸다.
  • 각 노드의 전체 우도 $ L_i $ 는 자식 노드의 우도 중 최댓값으로 정의되며, 최대 우도를 가진 가장 최근 공통 조상이 선택되도록 보장한다.
  • 최대우도 히브로그룹은 최고 우도를 가진 모든 노드들 중 가장 최근 조상이며, 최대 우도에서 8.685 phred-스케일링된 로그 단위 이내의 모든 히브로그룹이 포함된 신뢰도 집합을 형성한다.
  • 이 방법은 C++로 구현된 YFitter로 구현되었으며, 입력 데이터는 phyloXML 형식을 사용하고, samtools 또는 PLINK을 통합하여 입력 처리를 수행한다.

실험 결과

연구 질문

  • RQ1저용량 시퀀싱 데이터에서 불확실성을 고려한 최대우도 할당을 효율적으로 계산할 수 있는 동적 프로그래밍 알고리즘이 존재하는가?
  • RQ2YFitter의 정확도와 해상도는 유전자형 및 시퀀싱 데이터에서 수작업 또는 기존 자동화 도구와 비교해 어떻게 다른가?
  • RQ3AIC 기반의 신뢰도 히브로그룹 집합은 저용량 환경에서 강건성과 잘못된 추론 감소에 얼마나 기여하는가?
  • RQ4YFitter는 저용량 데이터로부터 미세한 해상도의 히브로그룹 구조를 고해상도의 고용량 또는 유전자형 기반 할당 수준과 비교해도 우수한 성능을 보일 수 있는가?

주요 결과

  • Genomes Unzipped 프로젝트의 유전자형 데이터에서, YFitter는 9명의 개별에서 일관된 히브로그룹 할당을 달성했으며, ISOGG2010와 YCC2008 계통수 간 명명법 차이로 인한 미세한 불일치 외에는 문제 없이 작동했다.
  • 1000 Genomes 프로젝트의 저용량 데이터에서, 286개의 최대우도 히브로그룹 할당 중 285개가 HapMap 기반 수작업 할당과 완전히 일치했다.
  • 일치한 285개의 할당 중 203개는 시퀀싱 데이터에서 더 높은 해상도를 보였고, 71개는 동일한 해상도를, 오직 11개만이 낮은 해상도를 보여 시퀀싱 데이터에서의 해상도 향상이 뚜렷했다.
  • 신뢰도 히브로그룹을 사용할 경우, 어떤 불일치도 관찰되지 않았으며, 199개의 할당에서 더 높은 해상도, 75개는 동일한 해상도를 기록했고, 이는 유전자형 기반 할당 대비 향상된 성능을 의미한다.
  • 신뢰도 히브로그룹은 최대우도 할당보다 약간 낮은 해상도를 보였지만, 정보 손실가 장소에서 매우 적은 손실을 보이며 강건한 불확실성 정량화를 보여주었다.
  • YFitter는 저용량 데이터로부터 미세한 해상도의 히브로그룹 구조를 성공적으로 규명했으며, 정확도를 유지하면서도 유전자형 기반 방법보다 뛰어난 해상도를 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.