Skip to main content
QUICK REVIEW

[논문 리뷰] Maximum Likelihood de novo reconstruction of viral populations using paired end sequencing data

Raunaq Malhotra, Manjari Mukhopadhyay Steven Wu|arXiv (Cornell University)|2015. 02. 14.
Genomics and Phylogenetic Studies참고 문헌 20인용 수 12
한 줄 요약

MLEHaplo는 최대우도 추정을 사용하여 쌍서열 NGS 데이터로부터 바이러스 허플로타입을 재구성하는 최대우도 신규조립 방법이며, De Bruijn 그래프에서 새로운 경로 탐색 알고리즘(ViPRA)을 적용한다. 시뮬레이션 데이터셋에서 250x 시퀀싱 깊이에서 진짜 허플로타입과 100% 일치하는 결과를 보이며, 참조 기반 방법에 비해 과도한 유전자 다양성 추정을 최소화하고 HIV-1 및 HCV 집단에서 더 많은 유전적 변이를 포착한다.

ABSTRACT

We present MLEHaplo, a maximum likelihood de novo assembly algorithm for reconstructing viral haplotypes in a virus population from paired-end next generation sequencing (NGS) data. Using the pairing information of reads in our proposed Viral Path Reconstruction Algorithm (ViPRA), we generate a small subset of paths from a De Bruijn graph of reads that serve as candidate paths for true viral haplotypes. Our proposed method MLEHaplo then generates a maximum likelihood estimate of the viral population using the paths reconstructed by ViPRA. We evaluate and compare MLEHaplo on simulated datasets of 1200 base pairs at different sequence coverage, on HCV strains with sequencing errors, and on a lab mixture of five HIV-1 strains. MLEHaplo reconstructs full length viral haplotypes having a 100% sequence identity to the true viral haplotypes in most of the small genome simulated viral populations at 250x sequencing coverage. While reference based methods either under-estimate or over-estimate the viral haplotypes, MLEHaplo limits the over-estimation to 3 times the size of true viral haplotypes, reconstructs the full phylogeny in the HCV to greater than 99% sequencing identity and captures more sequencing variation for the HIV-1 strains dataset compared to their known consensus sequences.

연구 동기 및 목표

  • 참조 게놈에 의존하지 않고 바이러스 집단 내 허플로타입을 재구성하는 데 도전하는 것.
  • 시퀀싱 오류와 잘못된 정렬으로 인해 자주 과다 추정하는 참조 기반 방법의 한계를 극복하는 것.
  • 실제 계통발생학적 계통도와 바이러스 퀼리스펙트 내 유전적 변이를 정확히 포착하는 신규조립 방법을 개발하는 것.
  • 쌍서열 시퀀싱 정보를 활용하여 De Bruijn 그래프 내 경로 선택을 향상시켜 더 정확한 허플로타입 재구성하는 것.
  • 거짓 양성 허플로타입 호출을 최소화하고 다양한 바이러스 집단에서 진짜 바이러스 허플로타입과의 일치도를 향상시키는 것.

제안 방법

  • 메서드는 쌍서열 리드의 k-mer로부터 생성된 De Bruijn 그래프를 사용하여 바이러스 집단을 표현한다.
  • ViPRA는 상위 M개의 경로 알고리즘으로, 각 정점에서 공통의 싱크로 향해 그래프를 탐색하면서 높은 우도 점수를 가진 경로를 우선순위로 선별하여 후보 허플로타입 경로를 식별한다.
  • 경로 점수는 시퀀스 우도, 삽입 크기 제약 조건, 그리고 가짜 진짜 경로 쌍 집합(PS)에의 소속 여부를 기반으로 계산되며, 일관성 없거나 긴 경로에 대해 페널티를 적용한다.
  • 알고리즘은 후진 제거와 메모이제이션을 적용하여 각 정점에 대해 상위 M개 경로를 효율적으로 계산함으로써 계산 오버헤드를 줄인다.
  • MLEHaplo는 ViPRA가 생성한 후보 경로들 중에서 최대우도 추정치를 선택하여, 시퀀스 일치도와 계통발생학적 정확도를 최적화한다.
  • 메서드는 쌍서열 리드 정보를 통합하여 경로 선택의 모호함을 해소하고 재구성 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1쌍서열 NGS 데이터를 사용하여 참조 기반 없이 전체 길이의 바이러스 허플로타입을 고정밀도로 재구성할 수 있는가?
  • RQ2MLEHaplo는 참조 기반 방법에 비해 허플로타입 다양성의 과다 추정 정도에서 어떻게 다른가?
  • RQ3MLEHaplo는 HCV 및 HIV-1와 같은 바이러스 집단의 완전한 계통발생학적 계통도를 어느 정도 회복할 수 있는가?
  • RQ4ViPRA 알고리즘은 복잡한 De Bruijn 그래프에서 생물학적으로 타당한 경로를 얼마나 효과적으로 선별하는가?
  • RQ5쌍서열 리드 정보 통합이 단일서열 접근법에 비해 허플로타입 재구성 정확도를 어떻게 크게 향상시키는가?

주요 결과

  • MLEHaplo는 대부분의 시뮬레이션 집단에서 250x 시퀀싱 깊이에서 진짜 허플로타입과 100% 일치하는 전체 길이의 바이러스 허플로타입을 재구성했다.
  • 메서드는 바이러스 허플로타입의 과다 추정을 진짜 수치의 3배 이내로 제한하여 참조 기반 접근법에 비해 거짓 양성 수를 크게 감소시켰다.
  • HCV 주형에서는 MLEHaplo가 참조 집단 구조와 99% 이상의 일치도로 완전한 계통발생학적 계통도를 재구성했다.
  • 5개의 혼합된 HIV-1 랩스터믹스에서 MLEHaplo는 알려진 공통 서열보다 더 많은 유전적 변이를 포착하여 소량의 허플로타입을 더 잘 해석함을 보였다.
  • ViPRA 알고리즘이 De Bruijn 그래프에서 고우도 경로를 효율적으로 식별하여 정확한 후속 최대우도 추정을 가능하게 하였다.
  • 메서드는 고돌연변이율과 재조합 사건이 많은 다양한 바이러스 집단에서도 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.