[論文レビュー] A performance evaluation of CCS QCD Benchmark on the COMA (Intel(R) Xeon Phi$^{TM}$, KNC) system
この論文は、Intel Xeon Phi (KNC) コプロセッサを搭載した COMA システムにおける CCS QCD ベンチマークの性能を評価し、逆オフロードと SCIF 通信を用いて、オーバlapされた制限付き加法的 Schwarz (RAS) 前処理を最適化した単精度 BiCGStab ソルバーを実装している。$24^3 \times 96$ ラティス上でウィルソン・クローラー散乱行列乗算について、~190 GFlops の持続性能を達成し、通信と計算のオーバーラップが効果的であることを示し、$24^3 \times 32$ ラティスサイズを超える強力な弱スケーリングを実証した。
The most computationally demanding part of Lattice QCD simulations is solving quark propagators. Quark propagators are typically obtained with a linear equation solver utilizing HPC machines. The CCS QCD Benchmark is a benchmark program solving the Wilson-Clover quark propagator, and is developed at the Center for Computational Sciences (CCS), University of Tsukuba. We optimized the benchmark program for a \Intel \XeonPhi (Knights Corner, KNC) system named "COMA (PACS-IX)" at CCS Tsukuba under the Intel Parallel Computing Center program. A single precision BiCGStab solver with the overlapped Restricted Additive Schwarz (RAS) preconditioner was implemented using SIMD intrinsics, OpenMP and MPI in the offload mode. With the reverse-offloading technique, we could reduce the communication and offloading overheads. We observed a performance of $\sim 200$ GFlops sustained for the Wilson-Clover hopping matrix multiplication on the lattice sizes larger than $24^3 imes 32$ on a sinlge card of the COMA system. A good weak scaling perofmace was observed on the local lattice sizes larger than $24^3 imes 32$.
研究の動機と目的
- COMA システムに搭載された Intel Xeon Phi (KNC) コプロセッサ上で、CCS QCD ベンチマークの性能を評価・最適化すること。
- ホストプロキシサーバーを介した逆オフロードを実装することで、オフロードモードにおける通信およびオフロードのオーバーヘッドを低減すること。
- SIMD、OpenMP、MPI を用いて、単精度ウィルソン・クローラークォーカー行列乗算における高い持続性能を達成すること。
- ハッピング行列乗算カーネルにおいてタスク分離を用いて、通信と計算のオーバーラップを可能にすること。
- 大規模な局所的ラティスサイズ (> $24^3 \times 32$) における強い弱スケーリングの挙動を実証すること。
提案手法
- オフロードモードで、SIMD 指令、OpenMP、MPI を用いて、オーバーラップされた制限付き加法的 Schwarz (RAS) 前処理を備えた単精度 BiCGStab ソルバーを実装した。
- 対称通信インターフェース (SCIF) を介してホスト CPU プロキシに MPI 通信リクエストをオフロードすることで、逆オフロードを用いてオフロードのオーバーヘッドを最小化した。
- ハッピング行列乗算を、前処理 (MULT_PRE)、内部サイト計算 (MULT_IN)、表面サイト計算 (MULT_PST) の3段階に分割し、条件分岐を排除した。
- 非ブロッキング SCIF 呼び出しを用いて通信と計算のオーバーラップを実現し、通信の遅延を計算で隠蔽した。
- 計算カーネルに対して、プリフェッチ、スレーディング、ベクトル化といった標準的な KNC 最適化技術を適用した。
- 局所的ラティスサイズと並列分割の変化に応じた性能測定を通じて、弱スケーリングを評価した。
実験結果
リサーチクエスチョン
- RQ1逆オフロードと SCIF を用いた通信は、Xeon Phi (KNC) システムにおける MPI ベースの HPC 応用において、オフロードのオーバーヘッドを低減できるか?
- RQ2最適化されたカーネルを用いた場合、COMA システムにおける単精度ウィルソン・クローラー散乱行列乗算でどの程度の性能が達成できるか?
- RQ3タスク分離と非ブロッキング通信を用いることで、BiCGStab ソルバーにおける通信と計算のオーバーラップはどの程度達成できるか?
- RQ4COMA システムにおいて、ラティスサイズと並列分割の増加に伴い、弱スケーリング性能はどのように変化するか?
- RQ5ソルバーにおいて通信遅延を効果的に隠蔽するための最小の局所的ラティスサイズは何か?
主な発見
- 最適化された単精度 BiCGStab ソルバーは、$24^3 \times 32$ を超えるラティスサイズに対して、1枚の KNC カードで ~200 GFlops の持続性能を達成した。
- 局所的ラティスサイズが $24^3 \times 96$ の場合、ウィルソン・クローラー散乱行列乗算は ~190 GFlops の持続性能を達成した。
- 通信隠蔽は、局所的ラティスサイズ $N_S \geq 24$ の場合にのみ効果的であり、弱スケーリングテストにおける塗潰し済みと空欄のシンボルの差が小さくなった。
- 3次元の並列分割において良好な弱スケーリングが観察され、プロセス数の増加に伴って性能が安定した。
- 逆オフロード技術により、オフロードのオーバーヘッドが成功裏に低減され、SCIF を介した非ブロッキング通信が可能になった。
- 性能向上は、MULT カーネルにおけるタスク分離による通信と計算の効果的なオーバーラップに起因するとされた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。