[論文レビュー] Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM
BWA-MEM は、70 bp から数メガベースまでのリードとコンティグを扱い、局所整列とエンドツーエンド整列の自動選択を行い、キメラおよびペアエンドマッピングを高い速度と精度でサポートする新しいアライメントアルゴリズムです。
Summary: BWA-MEM is a new alignment algorithm for aligning sequence reads or long query sequences against a large reference genome such as human. It automatically chooses between local and end-to-end alignments, supports paired-end reads and performs chimeric alignment. The algorithm is robust to sequencing errors and applicable to a wide range of sequence lengths from 70bp to a few megabases. For mapping 100bp sequences, BWA-MEM shows better performance than several state-of-art read aligners to date. Availability and implementation: BWA-MEM is implemented as a component of BWA, which is available at http://github.com/lh3/bwa. Contact: hengli@broadinstitute.org
研究の動機と目的
- 短いリードと長いリードの両方、コンティグ、およびアセンブリ改善を扱う多用途のアライナーの必要性を動機づける。
- 長い完全一致を含むシード・アンド・エクステンドとリシードを用いて、さまざまな長さのリードを堅牢にマップするアライメントアルゴリズムを開発する。
- 局所整列とエンドツーエンド整列の自動選択を有効にして参照バイアスを減らし、構造変異を扱えるようにする。
- 挿入サイズとキメラリードを考慮して、欠損ヒットを回収し、情報に基づくペアリングを行うペアエンドマッピングをサポートする。
提案手法
- 整列をシードするために、supermaximal exact matches (SMEMs) を用いたシード・アンド・エクステンドを使用する。
- リシーディングを導入する:SMEM が長すぎる場合、中間塩基を覆い、少なくとも k+1 回発生する最長の完全一致でシードする。
- シードを貪欲にチェーン化してチェーンにし、短く包含されたチェーンをフィルタリングして拡張の無駄を減らす。
- バンド付きアフィンギャップペナルティ DP でシードを拡張し、X-drop に類似した停止規則を適用して貧弱な拡張を回避する。
- クエリ末で終わる最良の拡張を追跡し、局所整列とエンドツーエンド整列を自動的に決定する。
- ペアエンドマッピングでは、挿入サイズ窓内でSW整列によって欠損ヒットを回収し、結合スコア S_ij を最大化することで端をペアリングする。
- S_ij は S_i、S_j、および対数変換 log4 を用いた確率的な項と上限 U を持つ項を用いて計算する。)

実験結果
リサーチクエスチョン
- RQ1BWA-MEMは、広い長さスペクトル(70 bp から数 Mb)にわたるシーケンシングリードを正確にマッピングし、コンティグを整列できるか?
- RQ2アルゴリズムは局所整列とエンドツーエンド整列の自動選択を行い、整列品質を保ちながら参照バイアスを最小化するか?
- RQ3単独終端およびペアエンドリードの両方に対して、精度と速度の点で最先端のマッパーと比較してBWA-MEMはどう性能を示すか?
- RQ4構造変異やミスアセンブリがある場合に欠損ヒットを回収し、リードを正しくペアリングする有効な戦略はあるか?
- RQ5BWA-MEMはキメラリードを識別し、長いシーケンスに対して既存のツールよりもスケールアップできるか?
主な発見
- BWA-MEM はシングルエンドおよびペアエンドリードの双方で良好な精度を示し、SE では NovoAlign に近づき、PE では GEM/Cushaw2 に匹敵する。
- BWA-MEM は典型的なデータで GEM と Bowtie2 と同程度の速度で動作し、650 bp の長リードデータセットでは Bowtie2 と Cushaw2 の約6倍高速。
- アルゴリズムは長いリードとコンティグを扱い、キメラリードを識別する。これはコンティグ整列にとって重要である。
- SMEMs でのシード付けとリシーディングおよびチェーンフィルタリングは、シード拡張の効率と精度を向上させる。
- エンドツーエンド整列と局所整列の決定は、クエリ末端拡張品質を追跡することで自動化され、参照バイアスを減らしつつ過大なギャップを回避する。
- 長ゲノムテストでは、BWA-MEM は nucmer と同等の結果を出しつつ大規模ゲノムへのスケールが良く、per-alignment での nucmer の方が速いにもかかわらず。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。