Skip to main content
QUICK REVIEW

[論文レビュー] Fine-grained parallelization of similarity search between protein sequences

Van Hoa Nguyen, Dominique Lavenier|ArXiv.org|Apr 23, 2008
Genomics and Phylogenetic Studies参考文献 15被引用数 4
ひとこと要約

本稿では、マルチコアCPUおよびGPU向けに高度に最適化された、細粒度並列処理が可能なタンパク質およびヌクレオチド配列類似性検索アルゴリズムであるPLAST-P、TPLAST-N、PLAST-Xを提示する。SIMD命令、GPUアクセラレーション、サブセット・シードを用いた効率的なインデキシングを活用することで、NCBI BLASTと同等の感度と出力形式を維持しながら、5倍から10倍の高速化を達成した。

ABSTRACT

This report presents the implementation of a protein sequence comparison algorithm specifically designed for speeding up time consuming part on parallel hardware such as SSE instructions, multicore architectures or graphic boards. Three programs have been developed: PLAST-P, TPLAST-N and PLAST-X. They provide equivalent results compared to the NCBI BLAST family programs (BLAST-P, TBLAST-N and BLAST-X) with a speed-up factor ranging from 5 to 10.

研究の動機と目的

  • データ量の爆発的増加に伴う大規模ゲノムデータベース検索における計算負荷の増大に対処する。
  • 集中的な配列比較ワークロードにおける逐次的BLAST実装の性能ボトルネックを克服する。
  • 感度と出力形式の互換性を保ちながら実行時間を著しく短縮するBLASTの並列化代替手法を開発する。
  • マルチコアCPUおよびGPUなどの現代的な並列ハードウェアを活用して、タンパク質およびヌクレオチドデータベースにおける効率的な類似性検索を可能にする。
  • サブセット・シードインデキシングと細粒度並列化戦略を用いて、メモリアクセスおよびアルゴリズム段階を最適化する。

提案手法

  • BLASTを模倣した5段階パイプライン(インデキシング、ヒット検出、アンギャップ拡張、ギャップ拡張、トレースバック)を設計する。
  • CPU上で16ビットおよび8ビット整数演算にSIMD命令(SSE)を用いた細粒度並列化を実装する。
  • 特にアンギャップおよび小規模ギャップアラインメントの重要な段階をCUDAを用いてGPUに移植し、大規模な並列処理を実現する。
  • スレッドレベル並列化とデータレベル並列化を統合するマルチコアおよびGPUハイブリッド実行モデルを統合する。
  • ヒット検出段階におけるメモリアクセスの最適化と、初期フィルタリング段階での誤検出の低減のため、サブセット・シードを活用する。
  • 生物情報学パイプラインへのシームレスな統合を可能にするために、BLASTの-m 8出力形式との後方互換性を維持する。

実験結果

リサーチクエスチョン

  • RQ1SIMDおよびGPUアーキテクチャを用いた細粒度並列化は、感度を損なわず、タンパク質およびヌクレオチド類似性検索を著しく高速化できるか?
  • RQ2PLAST-P、TPLAST-N、PLAST-Xの性能は、さまざまな入力サイズおよびハードウェア構成において、NCBI BLASTの対応実装と比較してどの程度異なるか?
  • RQ3サブセット・シードおよび最適化されたインデキシングの使用は、大規模な配列比較におけるメモリアクセスおよびフィルタ効率をどの程度向上させるか?
  • RQ4最適化されたPLASTパイプラインは、BLASTと比較して感度にどの程度のトレードオフを生じるか、特に生物学的に意味のあるアラインメントを検出する能力に影響は何か?
  • RQ5マルチコアとGPUアクセラレーションをハイブリッド実行モデルで組み合わせた場合、得られる最大の高速化率はどの程度か?

主な発見

  • 10k配列データセットを用いたマルチGPU構成では、PLAST-XがマルチコアBLAST-Xと比較して5.5倍から6倍の高速化を達成した。
  • 10k配列データセットにおいて、GPUアクセラレーテッドPLAST-Xは、アンギャップアラインメントの処理時間を最適化なしの1.99秒からGPU利用時の0.31秒に短縮した。
  • PLAST-Xの感度はBLAST-Xと非常に類似しており、10k配列の10%閾値において98.5%のアラインメントが回復された。
  • すべての実装において段階2(アンギャップ拡張)の選別性が保持されており、最適化レベルに応じて0.132%から0.168%の成功率を示した。
  • マルチコア+GPUハイブリッド版のPLAST-Xは最良のパフォーマンスを示し、10k配列データセットにおいて、BLAST-Xの7,550秒から1,531秒に合計実行時間を短縮した。
  • 10k配列データセットにおいて、SIMD最適化済み8ビット版のPLAST-Xは、非最適化バージョンと比較してアンギャップアラインメントで12.05倍の高速化を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。