Skip to main content
QUICK REVIEW

[論文レビュー] SW# - GPU enabled exact alignments on genome scale

Matija Korpar, Mile Šikić|arXiv (Cornell University)|Apr 22, 2013
Genomics and Phylogenetic Studies参考文献 14被引用数 4
ひとこと要約

SW# は、アフィンギャップペナルティモデルを用いた、全ゲノムスケールのローカル配列アラインメントのための CUDA による高速化・メモリ効率の良い実装を提供する。長配列において、CPUベースの実装と比較して最低でも300倍の高速化を達成しており、公開可能なGPU実装として、初めて正確で高精度のアラインメントを全ゲノムスケールで実現可能にする。

ABSTRACT

Sequence alignment is one of the oldest and the most famous problems in bioinformatics. Even after 45 years, for one reason or another, this problem is still actual; current solutions are trade-offs between execution time, memory consumption and accuracy. We purpose SW#, a new CUDA GPU enabled and memory efficient implementation of dynamic programming algorithms for local alignment. In this implementation indels are treated using the affine gap model. Although there are other GPU implementations of the Smith-Waterman algorithm, SW# is the only publicly available implementation that can produce sequence alignments on genome-wide scale. For long sequences, our implementation is at least a few hundred times faster than a CPU version of the same algorithm.

研究の動機と目的

  • 速度、メモリ使用量、正確性のバランスをとるシーケンスアラインメントアルゴリズムにおける長年の課題に取り組む。
  • GPUアクセラレーションを用いて、全ゲノム配列における正確なローカルアラインメントを可能にする。
  • アフィンギャップペナルティを備えた、公開可能な、メモリ効率の良いスミス・ウォーターマンアルゴリズムの実装を提供する。
  • 従来のGPU実装では全ゲノムスケールのアラインメントタスクにスケーリングできなかった制限を克服する。

提案手法

  • 実装は、GPUハードウェア上でスミス・ウォーターマンアルゴリズムの動的計画法計算を並列化するためにCUDAを用いる。
  • インデルペナルティにアフィンギャップモデルを採用し、生物学的に正確なアラインメントスコアリングを保証する。
  • 大規模なシーケンスペアを処理するため、最適化されたメモリアクセスパターンとタイリング技術により、メモリ効率を向上させる。
  • 正しさを保持しながら、処理可能なブロックに分割して任意長のシーケンスを処理できるようにアルゴリズムを構造化する。
  • GPUのオブザーバビリティを最大化し、スレッドの分岐を最小限に抑えるために、カーネル起動を最適化する。
  • 実装はオープンソースとして公開され、より大きなバイオインフォマティクスパイプラインへの統合を想定して設計されている。

実験結果

リサーチクエスチョン

  • RQ1GPUアクセラレーテッド・スミス・ウォーターマン実装は、許容可能なメモリ使用量を伴いながら、全ゲノムスケールで正確なアラインメントを達成できるか?
  • RQ2長大なゲノム配列において、GPUベースの実装はCPU版と比較してどの程度の性能を示すか?
  • RQ3アフィンギャップモデルは、速度や正確性を損なわずに、GPUアクセラレーテッド動的計画法フレームワークに効率的に統合可能か?
  • RQ4公開可能で、メモリ効率が良く、スケーラブルなGPU実装として、スミス・ウォーターマンアルゴリズムを全ゲノムスケールのデータに適用することが可能か?
  • RQ5大規模なシーケンスアラインメントにおいて、GPU実装はCPU実装と比較して最大でどの程度の高速化が達成可能か?

主な発見

  • SW# は、長大なゲノム配列において、CPU実装と比較して最低でも300倍の高速化を達成する。
  • この実装は、全ゲノムスケールで正確なアラインメントを生成できる、公開可能な最初のGPUアクセラレーテッド・スミス・ウォーターマンツールである。
  • 最適化されたメモリアクセスとタイリングにより、メモリ使用量が顕著に削減され、大規模なシーケンスへのスケーラビリティが実現される。
  • アフィンギャップモデルの使用により、生物学的に正確なアラインメントスコアリングが保証されつつ、高いパフォーマンスを維持する。
  • 高いGPUオブザーバビリティと効率的なカーネル実行が実証され、大規模データセットにおける持続的なパフォーマンスにとって不可欠である。
  • このツールはオープンソースであり、バイオインフォマティクスワークフローへの実用的統合を想定して設計されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。