[論文レビュー] Parallel Pairwise Correlation Computation On Intel Xeon Phi Clusters
この論文では、Intel Xeon Phi クラスタ上で、SIMD、スレッドレベル、アクセラレータレベルの並列性を活用した、最初の並列的で分散型の全ペアピアソン相関係数(PCC)計算フレームワークであるLightPCCを提示する。16個のPhiで、順次処理のALGLIBに対して最大218.2倍の高速化、シングルスレッドのMKLに対して71.4倍の高速化を達成し、強いスケーラビリティを示し、対称的ペアワイズ計算のための新規な全単射ワークロードバランシングフレームワークを備えている。
Co-expression network is a critical technique for the identification of inter-gene interactions, which usually relies on all-pairs correlation (or similar measure) computation between gene expression profiles across multiple samples. Pearson's correlation coefficient (PCC) is one widely used technique for gene co-expression network construction. However, all-pairs PCC computation is computationally demanding for large numbers of gene expression profiles, thus motivating our acceleration of its execution using high-performance computing. In this paper, we present LightPCC, the first parallel and distributed all-pairs PCC computation on Intel Xeon Phi (Phi) clusters. It achieves high speed by exploring the SIMD-instruction-level and thread-level parallelism within Phis as well as accelerator-level parallelism among multiple Phis. To facilitate balanced workload distribution, we have proposed a general framework for symmetric all-pairs computation by building bijective functions between job identifier and coordinate space for the first time. We have evaluated LightPCC and compared it to two CPU-based counterparts: a sequential C++ implementation in ALGLIB and an implementation based on a parallel general matrix-matrix multiplication routine in Intel Math Kernel Library (MKL) (all use double precision), using a set of gene expression datasets. Performance evaluation revealed that with one 5110P Phi and 16 Phis, LightPCC runs up to $20.6 imes$ and $218.2 imes$ faster than ALGLIB, and up to $6.8 imes$ and $71.4 imes$ faster than single-threaded MKL, respectively. In addition, LightPCC demonstrated good parallel scalability in terms of number of Phis. Source code of LightPCC is publicly available at http://lightpcc.sourceforge.net.
研究の動機と目的
- 共-expressionネットワーク構築に用いられる大規模な遺伝子発現データセットにおける計算が重い全ペアPCC計算を高速化すること。
- ゲノムワイド関連解析やパーミュテーションテストにおける、逐次的およびCPUベースのPCC計算の性能ボトルネックを解消すること。
- Intel Xeon Phi クラスタの全並列性—SIMD、マルチスレーディング、およびPhi間のアクセラレーション—を活用して、高性能な相関解析を実現すること。
- 対称的全ペア計算における処理要素間で均等なジョブ割り当てを保証する一般化された全単射ワークロード分配フレームワークを設計すること。
- 実際の遺伝子発現データと合成データ上で、LightPCCの性能を最先端のCPUベース実装(ALGLIBとMKL)と比較して評価すること。
提案手法
- LightPCCは、各PhiのベクタユニットにおけるSIMD命令レベルの並列性を活用するため、C++テンプレートベースの実装を採用している。
- 各Phiの複数コアを介したスレッドレベルの並列性を活用し、独立したPCC計算を同時に処理する。
- マスタースレーブモデルを用いてクラスタ内の複数Phiにジョブを分散させることで、アクセラレータレベルの並列性を実現する。
- 対称的PCC行列の上三角行列内の座標ペアに一意にジョブIDを割り当てる新規な全単射マッピング関数を導入し、負荷のバランスを保証する。
- 効率的なベクタ化とGEMMに類似した最適化を可能にするために、標準的な代数的恒等式を用いてPCC計算を再定式化する。
- ジョブの分配は、各ユニークなペア(i,j)(i < j)に一意のIDを割り当てる対称的ジョブ行列を介して管理され、座標の逆再構築が可能になる。

実験結果
リサーチクエスチョン
- RQ1分散的で並列的なPCC計算フレームワークは、大規模な遺伝子発現データに対して、逐次的およびCPU最適化実装よりも顕著な高速化を達成できるか?
- RQ2Intel Xeon Phi クラスタ上で、SIMD、マルチスレーディング、Phi間並列性といった多段階の並列性を、対称的全ペア相関計算に効果的に活用できるか?
- RQ3提案された全単射ジョブIDから座標へのマッピングは、複数のPhiにわたる負荷のバランスとスケーラビリティを実現できるか?
- RQ4LightPCCは、異なる数のPhiとデータセットサイズにおいて、ALGLIBおよびMKLと比較してどの程度の性能向上を示すか?
- RQ5LightPCCは、Phiの数が増加するに従ってどのようにスケーリングするか?また、実際のヒトゲノムデータにおいて、最大でどの程度の高速化が達成可能か?
主な発見
- 1つの5110P Phiで、LightPCCはALGLIBに対して13.7倍の高速化、シングルスレッドのMKLに対して4.7倍の高速化を達成した。
- 16個のPhiを用いた場合、実際のヒトゲノムデータセットにおいて、ALGLIBに対して最大218.2倍、シングルスレッドのMKLに対して71.4倍の高速化を達成した。
- LightPCCは強い並列スケーラビリティを示し、実データにおいて16個のPhiで1つのPhiと比較して11.9倍の高速化を達成した。
- 16個のPhiを用いた場合、16スレッドのMKLに対して最大4.3倍の高速化を達成したが、4個のPhiを越えた以降にのみ、MKLを上回った。
- 全単射ワークロード分配フレームワークにより、すべてのPhiが均等に利用され、効率的な処理が可能になった。
- 人工的および実際のデータセットにおける性能評価により、問題サイズやハードウェア構成が異なる状況でも、一貫したスケーラブルな性能向上が確認された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。