Skip to main content
QUICK REVIEW

[논문 리뷰] Minimap2: versatile pairwise alignment for nucleotide sequences

Heng Li|arXiv (Cornell University)|2017. 08. 04.
Genomics and Phylogenetic Studies인용 수 23
한 줄 요약

Minimap2는 초장거리 게놈 읽기, 전체 길이의 mRNA 및 큰 커티그와 같은 장거리 염기서열을 위한 빠르고 다재다능한 정렬 도구로 설계되었다. 분할 독 읽기, 오목한 갭 페널티 및 새로운 휴리스틱 기법을 사용하여 단독 읽기 정렬기보다 3–4배 빠르고 고정밀도에서 30배 이상 빠르게 작동하며, 다양한 데이터 유형에서 전문 정렬기보다 뛰어난 성능을 발휘한다.

ABSTRACT

Motivation: Recent advances in sequencing technologies promise ultra-long reads of $\sim$100 kilo bases (kb) in average, full-length mRNA or cDNA reads in high throughput and genomic contigs over 100 mega bases (Mb) in length. Existing alignment programs are unable or inefficient to process such data at scale, which presses for the development of new alignment algorithms. Results: Minimap2 is a general-purpose alignment program to map DNA or long mRNA sequences against a large reference database. It works with accurate short reads of $\ge$100bp in length, $\ge$1kb genomic reads at error rate $\sim$15%, full-length noisy Direct RNA or cDNA reads, and assembly contigs or closely related full chromosomes of hundreds of megabases in length. Minimap2 does split-read alignment, employs concave gap cost for long insertions and deletions (INDELs) and introduces new heuristics to reduce spurious alignments. It is 3-4 times faster than mainstream short-read mappers at comparable accuracy and $\ge$30 times faster at higher accuracy for both genomic and mRNA reads, surpassing most aligners specialized in one type of alignment. Availability and implementation: this https URL Contact: hengli@broadinstitute.org

연구 동기 및 목표

  • 현재 도구가 효율적으로 처리하지 못하는 초장거리 시퀀싱 읽기(최대 100 kb) 및 대규모 게놈 커티그(>100 Mb)를 정렬하는 데 발생하는 증가하는 과제를 해결하기 위해.
  • 단일 정렬 도구를 개발하여 짧은 읽기, 장거리 게놈 읽기, 전체 길이의 cDNA/mRNA 및 큰 커티그 등 다양한 데이터 유형에서 우수한 성능을 발휘하도록 하기 위해.
  • 오목한 갭 비용 모델을 사용하여 장거리 삽입 및 삭제(INDEL)의 정렬 정확도를 향상시키기 위해.
  • 새로운 휴리스틱 필터링 전략을 통해 잘못된 정렬을 줄이고, 거짓 양성 결과를 감소시키기 위해.
  • 특수화된 정렬기와 비교해도 뚜렷한 속도 향상을 이룩하기 위해, 특히 고정밀도 설정에서의 성능 향상을 추구하기 위해.

제안 방법

  • 복잡한 구조적 변형을 가진 장거리 읽기를 처리하기 위해 분할 독 읽기 정렬 기법을 적용한다.
  • 장거리 INDEL를 더 잘 모델링하기 위해 오목한 갭 비용 함수를 적용하여 구조적 변이의 정렬 정확도를 향상시킨다.
  • 거짓 정렬을 줄이기 위한 새로운 휴리스틱 기법을 도입하여, 민감도를 유지하면서도 특이도를 높인다.
  • 장거리 서열의 효율적 인덱싱과 정렬을 위해 시드-앤드-익스텐드 휴리스틱을 최적화한다.
  • 다양한 입력 유형을 지원한다: 짧은 읽기(≥100 bp), 장거리 게놈 읽기(≥1 kb, 약 15% 오류율), 전체 길이의 cDNA/mRNA, 그리고 큰 커티그 또는 염색체.
  • 서열 길이와 오류 프로파일에 따라 동적으로 적응하는 일반화된 알고리즘을 사용한다.

실험 결과

연구 질문

  • RQ1단일 정렬 알고리즘이 초장거리 읽기(최대 100 kb) 및 대규모 게놈 커티그(>100 Mb)를 효율적이고 정확하게 매핑할 수 있는가?
  • RQ2오목한 갭 비용 모델은 노이즈가 많은 장거리 읽기에서 장거리 INDEL의 정렬 정확도를 어떻게 향상시킬 수 있는가?
  • RQ3어떤 휴리스틱 기법이 민감도를 훼손하지 않으면서도 효과적으로 잘못된 정렬을 줄일 수 있는가?
  • RQ4통합 알고리즘이 다양한 데이터 유형에서 전문 정렬기보다 속도와 정확도 면에서 얼마나 뛰어나게 성능을 발휘할 수 있는가?
  • RQ5기존 솔루션보다 수개의 순서대 빠른 속도 향상을 달성하면서도 고정밀도를 유지할 수 있는가?

주요 결과

  • Minimap2는 동일한 정확도 수준에서 주류 단독 읽기 정렬기보다 3–4배 더 빠른 성능을 보였다.
  • 게놈 및 mRNA 읽기에서 고정밀도 설정에서 기존 도구보다 30배 이상 빠르게 작동했다.
  • 노이즈가 많은 전체 길이의 cDNA 및 장거리 게놈 읽기와 같은 다양한 데이터 유형에서 높은 정렬 정확도를 유지했다.
  • 오목한 갭 비용의 사용은 장거리 삽입 및 삭제에 대한 정렬 품질을 크게 향상시켰다.
  • 새로운 휴리스틱 기법은 잘못된 정렬을 줄여 특이도를 향상시켰고, 민감도에 영향을 주지 않았다.
  • Minimap2는 대부분의 특정 유형의 정렬에 특화된 정렬기보다 뛰어난 성능을 보이며 광범위한 유연성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.