Skip to main content
QUICK REVIEW

[논문 리뷰] Estimation of genome size using k-mer frequencies from corrected long reads

Hengchao Wang, Bo Liu|arXiv (Cornell University)|2020. 03. 26.
Genomics and Phylogenetic Studies참고 문헌 18인용 수 12
한 줄 요약

이 논문은 보정된 제3세대 장거리 시퀀싱 데이터(예: PacBio, Nanopore)를 사용하여 k-mer 빈도 분석을 통해 게놈 크기를 신뢰성 있게 추정할 수 있음을 입증한다. 이를 통해 제2세대 Illumina 데이터가 필요로 하는 것을 제거할 수 있다. 저자들은 보정된 장거리 리드에서 정확한 k-mer 수를 세는 데에 적합한 경량 C/C++ 도구인 kmerfreq를 개발하였다. 이 도구는 비용 효율적인 단일 기술 게놈 프로젝트를 가능하게 한다.

ABSTRACT

The third-generation long reads sequencing technologies, such as PacBio and Nanopore, have great advantages over second-generation Illumina sequencing in de novo assembly studies. However, due to the inherent low base accuracy, third-generation sequencing data cannot be used for k-mer counting and estimating genomic profile based on k-mer frequencies. Thus, in current genome projects, second-generation data is also necessary for accurately determining genome size and other genomic characteristics. We show that corrected third-generation data can be used to count k-mer frequencies and estimate genome size reliably, in replacement of using second-generation data. Therefore, future genome projects can depend on only one sequencing technology to finish both assembly and k-mer analysis, which will largely decrease sequencing cost in both time and money. Moreover, we present a fast light-weight tool kmerfreq and use it to perform all the k-mer counting tasks in this work. We have demonstrated that corrected third-generation sequencing data can be used to estimate genome size and developed a new open-source C/C++ k-mer counting tool, kmerfreq, which is freely available at https://github.com/fanagislab/kmerfreq.

연구 동기 및 목표

  • 데노보 어셈블리 프로젝트에서 게놈 크기 추정을 위해 제2세대 시퀀싱 데이터에 의존하는 것을 제거하기 위해.
  • 제3세대 플랫폼에서 유도된 보정된 장거리 리드가 정확한 k-mer 빈도 분석을 지원할 수 있는지 평가하기 위해.
  • 장거리 리드 데이터에 적합한 빠르고 경량의 k-mer 수 계산 도구를 개발하기 위해.
  • 단일 기술(제3세대 전용) 게놈 워크플로우가 게놈 크기 추정에 있어 실현 가능하다는 것을 입증하기 위해.

제안 방법

  • k-mer 빈도 분석의 입력으로 PacBio 및 Nanopore 플랫폼의 보정된 장거리 리드 시퀀싱 데이터를 사용하였다.
  • 장거리 리드 데이터 세트에서 k-mers를 효율적으로 수량화하기 위해 고유의 C/C++ 도구인 kmerfreq를 개발하였다.
  • 게놈 크기를 추정하기 위해 k-mer 빈도 분포의 피크를 분석하였으며, 히스토GRAM의 특징적인 '무릎' 형태를 활용하였다.
  • 이 방법은 게놈 내 대부분의 k-mers가 고유하거나 낮은 빈도로 발생하며, 분포의 모드가 이四十형 게놈에 대한 기대되는 k-mer 빈도에 해당한다고 가정한다.
  • 다음 공식을 사용한다: 게놈 크기 ≈ (k-mers 총 수) / (피크 k-mers 빈도), 시퀀싱 깊이 및 오류 보정을 고려하여 조정한다.
  • 성능은 보정된 장거리 리드와 Illumina 기반 추정치를 기준으로 다수의 종에 대해 검증되었다.

실험 결과

연구 질문

  • RQ1보정된 제3세대 장거리 리드가 게놈 크기 추정에 적합한 명확한 k-mer 빈도 분포를 생성할 수 있는가?
  • RQ2보정된 장거리 리드로 제2세대 시퀀싱 데이터를 대체하여 k-mer 기반 게놈 분석을 수행할 수 있는가?
  • RQ3보정된 장거리 리드에서 유도된 k-mer 빈도를 사용한 게놈 크기 추정이 기존 방법과 비교해 얼마나 정확한가?
  • RQ4장거리 리드 데이터 전용으로 설계된 경량이고 효율적인 k-mer 수 계산 도구를 개발할 수 있는가?

주요 결과

  • 보정된 장거리 리드 데이터는 명확한 피크를 가진 k-mer 빈도 분포를 생성하여 정확한 게놈 크기 추정이 가능하였다.
  • 보정된 장거리 리드에서 유도된 게놈 크기 추정치는 Illumina 데이터로부터 유도된 기준 값과 높은 일치를 보였다.
  • kmerfreq 도구는 높은 속도와 낮은 메모리 사용량을 달성하여 대규모 게놈 분석 응용 분야에 적합하였다.
  • 본 연구는 제3세대 전용 단일 기술 워크플로우가 제2세대 시퀀싱을 요구하지 않고도 신뢰성 있게 게놈 크기를 추정할 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.