Skip to main content
QUICK REVIEW

[論文レビュー] Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM

Heng Li|DROPS (Schloss Dagstuhl – Leibniz Center for Informatics)|Mar 16, 2013
Cell Image Analysis Techniques被引用数 5,235
ひとこと要約

BWA-MEM は、70 bp から数メガベースまでのリードとコンティグを扱い、局所整列とエンドツーエンド整列の自動選択を行い、キメラおよびペアエンドマッピングを高い速度と精度でサポートする新しいアライメントアルゴリズムです。

ABSTRACT

Summary: BWA-MEM is a new alignment algorithm for aligning sequence reads or long query sequences against a large reference genome such as human. It automatically chooses between local and end-to-end alignments, supports paired-end reads and performs chimeric alignment. The algorithm is robust to sequencing errors and applicable to a wide range of sequence lengths from 70bp to a few megabases. For mapping 100bp sequences, BWA-MEM shows better performance than several state-of-art read aligners to date. Availability and implementation: BWA-MEM is implemented as a component of BWA, which is available at http://github.com/lh3/bwa. Contact: hengli@broadinstitute.org

研究の動機と目的

  • 短いリードと長いリードの両方、コンティグ、およびアセンブリ改善を扱う多用途のアライナーの必要性を動機づける。
  • 長い完全一致を含むシード・アンド・エクステンドとリシードを用いて、さまざまな長さのリードを堅牢にマップするアライメントアルゴリズムを開発する。
  • 局所整列とエンドツーエンド整列の自動選択を有効にして参照バイアスを減らし、構造変異を扱えるようにする。
  • 挿入サイズとキメラリードを考慮して、欠損ヒットを回収し、情報に基づくペアリングを行うペアエンドマッピングをサポートする。

提案手法

  • 整列をシードするために、supermaximal exact matches (SMEMs) を用いたシード・アンド・エクステンドを使用する。
  • リシーディングを導入する:SMEM が長すぎる場合、中間塩基を覆い、少なくとも k+1 回発生する最長の完全一致でシードする。
  • シードを貪欲にチェーン化してチェーンにし、短く包含されたチェーンをフィルタリングして拡張の無駄を減らす。
  • バンド付きアフィンギャップペナルティ DP でシードを拡張し、X-drop に類似した停止規則を適用して貧弱な拡張を回避する。
  • クエリ末で終わる最良の拡張を追跡し、局所整列とエンドツーエンド整列を自動的に決定する。
  • ペアエンドマッピングでは、挿入サイズ窓内でSW整列によって欠損ヒットを回収し、結合スコア S_ij を最大化することで端をペアリングする。
  • S_ij は S_i、S_j、および対数変換 log4 を用いた確率的な項と上限 U を持つ項を用いて計算する。)
Figure 1: Percent mapped reads as a function of the false alignment rate under different mapping quality cutoff. Alignments with mapping quality 3 or lower are excluded. An alignment is wrong if after correcting clipping, its start position is within 20bp from the simulated position. $10^{6}$ pairs
Figure 1: Percent mapped reads as a function of the false alignment rate under different mapping quality cutoff. Alignments with mapping quality 3 or lower are excluded. An alignment is wrong if after correcting clipping, its start position is within 20bp from the simulated position. $10^{6}$ pairs

実験結果

リサーチクエスチョン

  • RQ1BWA-MEMは、広い長さスペクトル(70 bp から数 Mb)にわたるシーケンシングリードを正確にマッピングし、コンティグを整列できるか?
  • RQ2アルゴリズムは局所整列とエンドツーエンド整列の自動選択を行い、整列品質を保ちながら参照バイアスを最小化するか?
  • RQ3単独終端およびペアエンドリードの両方に対して、精度と速度の点で最先端のマッパーと比較してBWA-MEMはどう性能を示すか?
  • RQ4構造変異やミスアセンブリがある場合に欠損ヒットを回収し、リードを正しくペアリングする有効な戦略はあるか?
  • RQ5BWA-MEMはキメラリードを識別し、長いシーケンスに対して既存のツールよりもスケールアップできるか?

主な発見

  • BWA-MEM はシングルエンドおよびペアエンドリードの双方で良好な精度を示し、SE では NovoAlign に近づき、PE では GEM/Cushaw2 に匹敵する。
  • BWA-MEM は典型的なデータで GEM と Bowtie2 と同程度の速度で動作し、650 bp の長リードデータセットでは Bowtie2 と Cushaw2 の約6倍高速。
  • アルゴリズムは長いリードとコンティグを扱い、キメラリードを識別する。これはコンティグ整列にとって重要である。
  • SMEMs でのシード付けとリシーディングおよびチェーンフィルタリングは、シード拡張の効率と精度を向上させる。
  • エンドツーエンド整列と局所整列の決定は、クエリ末端拡張品質を追跡することで自動化され、参照バイアスを減らしつつ過大なギャップを回避する。
  • 長ゲノムテストでは、BWA-MEM は nucmer と同等の結果を出しつつ大規模ゲノムへのスケールが良く、per-alignment での nucmer の方が速いにもかかわらず。
Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。