Skip to main content
QUICK REVIEW

[논문 리뷰] Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM

Heng Li|DROPS (Schloss Dagstuhl – Leibniz Center for Informatics)|2013. 03. 16.
Cell Image Analysis Techniques인용 수 5,235
한 줄 요약

BWA-MEM은 70 bp에서 수 메가바이트대까지의 읽기와 contig을 다루는 새로운 정렬 알고리즘으로, 로컬과 엔드투엔드 정렬 간 자동 선택을 수행하고, 키메릭(chimeric) 및 paired-end 매핑을 빠르고 정확하게 지원합니다.

ABSTRACT

Summary: BWA-MEM is a new alignment algorithm for aligning sequence reads or long query sequences against a large reference genome such as human. It automatically chooses between local and end-to-end alignments, supports paired-end reads and performs chimeric alignment. The algorithm is robust to sequencing errors and applicable to a wide range of sequence lengths from 70bp to a few megabases. For mapping 100bp sequences, BWA-MEM shows better performance than several state-of-art read aligners to date. Availability and implementation: BWA-MEM is implemented as a component of BWA, which is available at http://github.com/lh3/bwa. Contact: hengli@broadinstitute.org

연구 동기 및 목표

  • 짧은 리드와 긴 리드, contigs 및 조립 개선을 모두 다루는 다재다능한 정렬기의 필요성을 제기합니다.
  • 다양한 길이의 리드를 견고하게 매핑하기 위해 긴 정확 일치를 이용하는 seed-and-extend 및 re-seeding을 포함한 정렬 알고리즘을 개발합니다.
  • 참조 바이어스를 줄이고 구조적 변이를 다루기 위해 로컬 및 엔드투엔드 정렬 간 자동 선택을 가능하게 합니다.
  • 삽입 크기와 키메릭 리드를 고려하여 누락된 매치를 구출하고 정보를 바탕으로 쌍 위치를 맞추는 paired-end 매핑을 지원합니다.

제안 방법

  • seed-and-extend를 supermaximal exact matches (SMEMs)를 사용하여 정렬의 시드를 생성합니다.
  • 재시딩을 도입합니다: SMEM이 너무 길 때, 중간 염기를 포함하는 최소 k+1회 발생하는 가장 긴 정확 일치들로 시드합니다.
  • 탐욕적으로 시드를 체인으로 연결하고 짧고 포함된 체인은 걸러 확장 낭비를 줄입니다.
  • 밴드형 아피니-갭 페널티 DP로 시드를 확장하고 X-drop와 유사한 중지 규칙을 적용해 불리한 확장을 피합니다.
  • 쿼리 끝에서 끝나는 최상의 확장을 추적하여 로컬 대 엔드투엔드 정렬을 자동으로 결정합니다.
  • paired-end 매핑의 경우 삽입 사이즈 창에서 SW 정렬로 누락된_hits를 구출하고 결합 점수 S_ij를 최대화하여 엔드를 페어링합니다.
  • S_ij를 S_i, S_j, 및 로그4 변환과 상한 U를 가진 삽입 크기 항의 확률적 용어를 사용하여 계산합니다.
Figure 1: Percent mapped reads as a function of the false alignment rate under different mapping quality cutoff. Alignments with mapping quality 3 or lower are excluded. An alignment is wrong if after correcting clipping, its start position is within 20bp from the simulated position. $10^{6}$ pairs
Figure 1: Percent mapped reads as a function of the false alignment rate under different mapping quality cutoff. Alignments with mapping quality 3 or lower are excluded. An alignment is wrong if after correcting clipping, its start position is within 20bp from the simulated position. $10^{6}$ pairs

실험 결과

연구 질문

  • RQ1BWA-MEM은 70 bp에서 수 Mb에 이르는 광범위한 길이 스펙트럼의 시퀀싱 리드를 정확하게 매핑하고 contigs를 정렬할 수 있나요?
  • RQ2참조 바이어스를 최소화하면서 정렬 품질을 유지하기 위해 알고리즘이 로컬와 엔드투엔드 정렬 간 자동 선택을 수행하나요?
  • RQ3단일 엔드와 페어드 엔드 리드 모두에 대해 정확도와 속도에서 BWA-MEM의 성능이 최신 매퍼들과 어떤 차이가 있나요?
  • RQ4구조적 변이나 오조립이 존재하는 경우 누락된 매치를 구출하고 리드를 올바르게 페어링하는 효과적인 전략이 있나요?
  • RQ5BWA-MEM이 키메릭 리드를 식별하고 기존 도구보다 긴 시퀀스에 더 잘 확장할 수 있나요؟

주요 결과

  • BWA-MEM은 단일 엔드 및 페어드 엔드 리드 모두에 대해 좋은 정확도를 보이며 SE에서 NovoAlign에 근접하고 PE에서는 GEM/Cushaw2와 비슷합니다.
  • 일반 데이터에서 GEM 및 Bowtie2와 유사한 속도로 실행되며 650 bp 긴 리드 데이터셋에서는 Bowtie2 및 Cushaw2보다 약 6배 빠릅니다.
  • 이 알고리즘은 긴 리드와 contigs를 처리하고 키메릭 리드를 식별한다는 점이 contig 정렬에 결정적입니다.
  • SMEM으로 시드를 만들고 재시드링과 체인 필터링을 더해 시드 확장의 효율성과 정확성을 향상시킵니다.
  • 엔드투엔드 대 로컬 정렬 간의 결정은 쿼리 끝 확장의 품질을 추적하여 자동화되며, 참조 바이어스를 줄이면서 과도한 간격을 피합니다.
  • 긴 유전체 테스트에서 BWA-MEM은 nucmer와 비슷한 결과를 내고 대형 유전체에 더 잘 확장되지만, per-alignment 기준으로는 nucmer가 더 빠릅니다.
Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.