[論文レビュー] Performance Analysis and Efficient Execution on Systems with multi-core CPUs, GPUs and MICs
本稿では、CPU、GPU、Intel Xeon Phi (MIC)アクセラレータを備えたハイブリッドシステムを対象に、画像解析ワークロードを想定したパフォーマンスに配慮したスケジューリング戦略—PADASおよびPAMS—を提案する。データアクセスパターンと計算強度に基づいて、デバイス間での演算パフォーマンスのばらつきをモデル化することで、著者らはPAMSがHEFTおよびFCFSよりも少なくとも1.15倍の応用パフォーマンス向上を達成することを示している。特に、実行時間予測の誤差が生じる状況下でも有効である。
We carry out a comparative performance study of multi-core CPUs, GPUs and Intel Xeon Phi (Many Integrated Core - MIC) with a microscopy image analysis application. We experimentally evaluate the performance of computing devices on core operations of the application. We correlate the observed performance with the characteristics of computing devices and data access patterns, computation complexities, and parallelization forms of the operations. The results show a significant variability in the performance of operations with respect to the device used. The performances of operations with regular data access are comparable or sometimes better on a MIC than that on a GPU. GPUs are more efficient than MICs for operations that access data irregularly, because of the lower bandwidth of the MIC for random data accesses. We propose new performance-aware scheduling strategies that consider variabilities in operation speedups. Our scheduling strategies significantly improve application performance compared to classic strategies in hybrid configurations.
研究の動機と目的
- 顕微鏡画像解析における一般的な演算処理について、マルチコアCPU、GPU、Intel Xeon Phi (MIC)アクセラレータのパフォーマンスを分析・比較すること。
- データアクセスパターン(規則的 vs. 不規則的)、計算強度、並列化戦略が、異なるアクセラレータ上でパフォーマンスに与える影響を特定すること。
- パフォーマンスのばらつきを考慮したタスク割り当てに基づく、性能に配慮したスケジューリング戦略を設計し、ハイブリッド構成における実行効率を向上させること。
- CPU、GPU、MICを搭載したノードを備えた分散メモリクラスタにおいて、これらの戦略の有効性を評価すること。
提案手法
- 実ハードウェアを用いて、CPU、GPU、MIC上で画像解析パイプラインのコア演算処理の実験的パフォーマンス評価を実施する。
- 観測されたパフォーマンスを、デバイスの特性、データアクセスパターン、計算複雑度、並列化形式と関連付ける。
- 演算のスループット向上とデバイス固有のパフォーマンスばらつきを考慮した、性能に配慮したタスク割り当てに基づく、2つの新しいスケジューリング戦略—PADASおよびPAMS—を設計する。
- CPU、GPU、MICを搭載したノードを備えた分散メモリクラスタ上で、これらの戦略を実装・評価する。
- スケジューリング意思決定のためのパフォーマンスモデルを、マイクロカーネル測定値と実アプリケーションワークロードを用いて補正する。
- 実行時間の入力における推定誤差の程度を変化させながら、提案戦略(PADAS、PAMS)を古典的手法(FCFS、HEFT)と比較する。
実験結果
リサーチクエスチョン
- RQ1画像解析パイプラインにおける、規則的および不規則的なデータアクセスパターンを示す演算処理について、GPU、CPU、MICのパフォーマンスはどのように比較されるか?
- RQ2計算強度と並列化戦略の違いが、異なるアクセラレータタイプにおける演算処理のパフォーマンスに与える影響は何か?
- RQ3演算処理間でのパフォーマンスのばらつきが、ハイブリッドCPUアクセラレータシステムにおけるタスクスケジューリング効率に与える影響は何か?
- RQ4パフォーマンスに配慮したスケジューリング戦略は、FCFS や HEFT といった従来のスケジューリング方針と比較して、応用実行時間を顕著に短縮できるか?
- RQ5演算処理の実行時間の推定値に不正確さが生じた場合、パフォーマンスに配慮したスケジューラーはどの程度の耐性を示すか?
主な発見
- 原子的演算(atomic operations)を多く使用する不規則なデータアクセスパターンの演算処理では、GPUがMICを上回る性能を発揮する。これは、ランダムアクセスに適した高いメモリ帯域幅のおかげである。
- 規則的なデータアクセスパターンと高いデータ並列性を示す演算処理では、MICがGPUと同等またはそれ以上のパフォーマンスを達成する。
- データアクセスパターンや計算パターンの違いに起因する、演算処理間での顕著なパフォーマンスばらつきが存在するため、デバイスに配慮したスケジューリングが不可欠である。
- PAMSスケジューリング戦略は、ハイブリッド構成(CPU、GPU、MICを併用)において、最も近い競合戦略(HEFT)と比較して少なくとも1.15倍の高速化を達成する。
- パフォーマンスに配慮したスケジューラー(PADASおよびPAMS)は、実行時間の推定値に誤差が生じても、依然として高い耐性を示す。一方、HEFTは推定誤差が大きいと著しく性能が低下する。
- 提案手法により、CPUとアクセラレータの協調的利用が可能となり、分散メモリ環境における良好なスケーラビリティが実現される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。