Skip to main content
QUICK REVIEW

[論文レビュー] MICA: A fast short-read aligner that takes full advantage of Intel Many Integrated Core Architecture (MIC)

Sze-Hang Chan, Jeanno Cheung|arXiv (Cornell University)|Feb 20, 2014
Genomics and Phylogenetic Studies参考文献 1被引用数 13
ひとこと要約

MICA は、Intel の Many Integrated Core (MIC) アーキテクチャを活用するように最適化された短鎖アラインャーであり、1 枚の MIC ボードで BWA-MEM より 4.9 倍高速で、GPU に基づく SOAP3-dp を上回る性能を発揮する。MIC の 60 コア設計におけるスレッドレベルおよびデータレベルの並列処理を活用し、大規模なゲノムワークロードのための効率的なスケールアップを実現する。

ABSTRACT

Background: Short-read aligners have recently gained a lot of speed by exploiting the massive parallelism of GPU. An uprising alternative to GPU is Intel MIC; supercomputers like Tianhe-2, currently top of TOP500, is built with 48,000 MIC boards to offer ~55 PFLOPS. The CPU-like architecture of MIC allows CPU-based software to be parallelized easily; however, the performance is often inferior to GPU counterparts as an MIC board contains only ~60 cores (while a GPU board typically has over a thousand cores). Results: To better utilize MIC-enabled computers for NGS data analysis, we developed a new short-read aligner MICA that is optimized in view of MICs limitation and the extra parallelism inside each MIC core. Experiments on aligning 150bp paired-end reads show that MICA using one MIC board is 4.9 times faster than the BWA-MEM (using 6-core of a top-end CPU), and slightly faster than SOAP3-dp (using a GPU). Furthermore, MICAs simplicity allows very efficient scale-up when multiple MIC boards are used in a node (3 cards give a 14.1-fold speedup over BWA-MEM). Summary: MICA can be readily used by MIC-enabled supercomputers for production purpose. We have tested MICA on Tianhe-2 with 90 WGS samples (17.47 Tera-bases), which can be aligned in an hour less than 400 nodes. MICA has impressive performance even though the current MIC is at its initial stage of development (the next generation of MIC has been announced to release in late 2014).

研究の動機と目的

  • GPU アクセelerated アラインャーと CPU ベースのシステムとの間のパフォーマンスギャップを埋めるために、Intel の Many Integrated Core (MIC) アーキテクチャを活用すること。
  • MIC の高コア数と CPU に似たプログラミングモデルを組み合わせた独自の特性を最大限に活かせる短鎖アラインャーを設計すること。
  • 大規模なゲノムデータ処理のため、複数の MIC マシン上で高いパフォーマンスと効率的なスケールアップを達成すること。
  • Tianhe-2 のように 48,000 枚の MIC ボードを搭載する MIC ベースのスーパーコンピュータ上で本番環境でのアラインメントを可能にすること。

提案手法

  • MICA は、リード間の粗粒度のタスクレベル並列処理と、各 MIC コア内での細粒度のデータレベル並列処理の両方を対象とするハイブリッド並列化戦略を採用している。
  • アラインャーは、MIC の 60 コアアーキテクチャに最適化されており、ベクトル命令セットと効率的なメモリアクセスパターンを活用して遅延を最小限に抑える。
  • MIC の x86 指令セットを活用することで、既存の CPU 最適化コードを最小限の移植作業で再利用可能になる。
  • MICA は、MIC のスレーディングモデルに適応した効率的なビット並列処理を用いたシード・アンド・エクステンド戦略を採用している。
  • 実装では OpenMP と Intel のオフロードプログラミングモデルを活用し、MIC ボード上のデータ移動とカーネル実行を管理している。
  • 単一および複数の MIC ノードへのデプロイメントをサポートしており、追加のカードによる線形スケールアップを実現している。

実験結果

リサーチクエスチョン

  • RQ1GPU よりもコア数が少ないにもかかわらず、MICA は Intel MIC アーキテクチャ上で競争力のあるパフォーマンスを達成できるか?
  • RQ2MICA は、各 MIC コア内および複数の MIC ボード間で利用可能な並列処理をどれほど効果的に活用できるか?
  • RQ3MICA は、実世界のゲノムワークロードにおいて、SOAP3-dp のような既存の GPU ベースのアラインャーを上回ることができるか?
  • RQ41 枚の MIC ボードを使用した場合、MICA は従来の CPU ベースのアラインャーである BWA-MEM よりどれほどのスピードアップを達成できるか?
  • RQ51 つのコンピューティングノード内で複数の MIC カードを使用した場合、MICA のスケーリング特性はいかがなものか?

主な発見

  • 1 枚の MIC ボードを使用した場合、MICA は BWA-MEM の 6 コア CPU 実行と比較して 4.9 倍のスピードアップを達成した。
  • GPU ベースの SOAP3-dp よりわずかに優れた性能を発揮し、MIC 上でも競争力のあるパフォーマンスを示した。
  • 1 ノードに 3 枚の MIC カードを搭載した場合、MICA は BWA-MEM より 14.1 倍のスピードアップを達成し、優れたスケールアップ能力を示した。
  • Tianhe-2 では、MICA が 400 ノード未満で 90 例の全ゲノムシーケンシング(17.47 テラバイト)を 1 時間未満でアラインメントした。
  • MIC が初期段階にあったにもかかわらず、パフォーマンス優位性が維持されており、次世代の MIC は 2014 年後半に登場予定である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。