[論文レビュー] Heterogeneous computing for a hybridizable discontinuous Galerkin geometric multigrid method
本稿では、IntelのXeon Phi(Knights Landing)を用いた異種コンピューティングアプローチを提示し、ハイブリッド可能不連続ガラーキン(HDG)幾何的多重グリッド(GMG)ソルバの高速化を実現している。行列フリーなアセンブリ、静的縮退、およびバリアフリーな行列ベクトル乗算を活用することで、高次多項式においてピークメモリ帯域幅の80%を達成し、強力なデータ局所性と演算強度を実現することで、高い性能を実現している。
We present a heterogeneous computing strategy for a hybridizable discontinuous Galerkin (HDG) geometric multigrid (GMG) solver. Parallel GMG solvers require a combination of coarse grain and fine grain parallelism is utilized to improve time to solution performance. In this work we focus on fine grain parallelism. We use Intel's second generation Xeon Phi (Knights Landing) to enable acceleration. The GMG method achieves ideal convergence rates of $0.2$ or less, for high polynomial orders. A matrix free (assembly free) technique is exploited to save considerable memory usage and increase arithmetic intensity. HDG enables static condensation, and due to the discontinuous nature of the discretization, we developed a matrix-vector multiply routine that does not require any costly synchronizations or barriers. Our algorithm is able to attain 80\% of peak bandwidth performance for higher order polynomials. This is possible due to the data locality inherent in the HDG method. Very high performance is realized for high order schemes, due to good arithmetic intensity, which declines as the order is reduced.
研究の動機と目的
- 細粒度並列性を活用することで、高次不連続ガラーキン法における幾何的多重グリッドソルバのソリューションまでの時間を短縮すること。
- 行列フリーな実装により、HDG-GMGソルバにおけるメモリ使用量の削減と演算強度の向上を図ること。
- HDG離散化の不連続性を活用することで、行列ベクトル演算における高コストな同期バリアを排除すること。
- 特にIntel Xeon Phi Knights Landingを対象として、異種アーキテクチャにおける高いメモリ帯域幅利用を達成すること。
- 好都合なデータ局所性と計算強度のおかげで、高次スケームにおいても高い性能が達成可能であることを示すこと。
提案手法
- 明示的な行列格納を回避する行列フリー(アセンブリフリー)アプローチを採用し、メモリフットプリントを削減するとともに、演算強度を向上させる。
- HDG定式化を用いて静的縮退を実施し、グローバル系のサイズを縮小し、計算効率を向上させる。
- データ局所性と不連続な自由度を活用することで、同期バリアを回避する行列ベクトル乗算カーネルを設計する。
- 高いメモリ帯域幅利用を狙い、Intelの2世代目Xeon Phi(Knights Landing)を用いて異種加速を実装する。
- キャッシュ再利用を最大化するようにデータレイアウトとメモリアクセスパターンを最適化し、高次多項式次数においてピーク帯域幅の80%を達成する。
- 細粒度並列性と幾何的多重グリッドを組み合わせることで、多項式次数にかかわらず、理想の収束率0.2以下を維持する。
実験結果
リサーチクエスチョン
- RQ1行列フリーでバリアフリーなHDG-GMGソルバは、Xeon Phiのような異種アーキテクチャにおいて、高いメモリ帯域幅利用を達成できるか?
- RQ2HDG法におけるデータ局所性は、現代の多数コアアクセラレータ上でどのように性能に寄与するか?
- RQ3従来のCPUオンリーアプローチと比較して、Xeon Phiを用いることで、高次HDG-GMGソルバにどの程度の性能向上が見込めるか?
- RQ4提案手法において、多項式次数に応じて演算強度とメモリ帯域幅利用はどのように変化するか?
- RQ5静的縮退と行列フリーな演算を組み合わせることで、どれほどメモリ使用量を削減しつつ、収束率を維持できるか?
主な発見
- 提案された行列フリーでバリアフリーなHDG-GMGソルバは、Intel Xeon Phi Knights Landing上で高次多項式近似においてピークメモリ帯域幅の80%を達成している。
- 全テストされた多項式次数において、理想の収束率0.2以下が維持されており、多層グリッド性能が堅牢であることが示された。
- 行列アセンブリの排除のおかげで、行列フリーな定式化により、メモリ使用量が顕著に削減された。
- 高次スケームにおいて高い演算強度が達成されており、これはメモリバウンドアーキテクチャで性能を維持する上で極めて重要である。
- 多項式次数が低下するにつれて演算強度が低下するため性能が劣化するが、これは本手法が高次文脈において特に強力であることを示している。
- 行列ベクトル乗算ルーチンに同期バリアが存在しないため、Xeon Phiの多数コアアーキテクチャを効率的に活用できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。