Skip to main content
QUICK REVIEW

[論文レビュー] Numerical Study of Geometric Multigrid Methods on CPU--GPU Heterogeneous Computers

Chunsheng Feng, Shi Shu|arXiv (Cornell University)|Aug 21, 2012
Advanced Numerical Methods in Computational Mathematics参考文献 28被引用数 6
ひとこと要約

本論文は、CPU–GPU非均質アーキテクチャ上における幾何的多重グリッド(GMG)法の数値的検討を提示しており、GPU上で最適化されたFMGソルバが2次元ではCPUオンリーモードのOpenMP実装と比較して最大11倍、3次元では10倍の高速化を達成することを示している。1600万未知数の問題に対しては、2次元で33%、3次元で23%の高速化を達成し、cuFFTライブラリを上回っている。また、エネルギー効率およびコスト効率の面でも優れている。

ABSTRACT

The geometric multigrid method (GMG) is one of the most efficient solving techniques for discrete algebraic systems arising from elliptic partial differential equations. GMG utilizes a hierarchy of grids or discretizations and reduces the error at a number of frequencies simultaneously. Graphics processing units (GPUs) have recently burst onto the scientific computing scene as a technology that has yielded substantial performance and energy-efficiency improvements. A central challenge in implementing GMG on GPUs, though, is that computational work on coarse levels cannot fully utilize the capacity of a GPU. In this work, we perform numerical studies of GMG on CPU--GPU heterogeneous computers. Furthermore, we compare our implementation with an efficient CPU implementation of GMG and with the most popular fast Poisson solver, Fast Fourier Transform, in the cuFFT library developed by NVIDIA.

研究の動機と目的

  • CPU–GPU非均質コンputingプラットフォーム上における幾何的多重グリッド(GMG)法の性能を評価すること。
  • 多重グリッドアルゴリズムにおける粗いグリッドレベルでのGPUリソースの未利用化という課題に対処すること。
  • ポisson方程式を解くための最先端のcuFFTライブラリと比較して、GPUアクセラレートされたFMGソルバの効率性を評価すること。
  • さまざまな問題サイズおよびグリッド解像度におけるGMGのスケーラビリティと性能を評価すること。
  • PDEソルバにおけるGPUベースのGMGの計算性能およびエネルギー消費量という観点からのコスト効率を特定すること。

提案手法

  • CUDAを用いてGPUオフロードを実装し、CPU–GPU非均質システム上に幾何的多重グリッド(GMG)ソルバを実装した。フル多重グリッド(FMG)サイクルを採用した。
  • ネストされたグリッドの階層を用いて、高周波数および低周波数の誤差を同時に低減し、多重グリッドのマルチレベルスムージング戦略を活用した。
  • スレッドのコalescingとCPUとGPU間のデータ転送を最小限に抑えることで、GPUメモリアクセスとカーネル起動を最適化した。
  • 全グリッドレベルで対称ガウス=ザイデル緩和法をスムージングに採用し、事前および事後緩和スイープ回数を変更した。
  • GPUアクセラレートされたFMGと高度に最適化されたCPUオンリーモードのOpenMP実装および高速ポアソンソルバ用のcuFFTライブラリを比較した。
  • 解の精度を保証するため、カーネル実行時間とL²ノルムにおける近似誤差を測定した。

実験結果

リサーチクエスチョン

  • RQ1GPUアクセラレートされた幾何的多重グリッド法は、非均質システム上における高度に最適化されたCPUオンリーモード実装と比較して、どのように性能を発揮するか?
  • RQ2粗いグリッド計算がGPU利用度に与える影響は何か?また、多重グリッドアルゴリズムにおいてその影響をどのように軽減できるか?
  • RQ3大規模なポアソン問題を2次元および3次元で解く場合、GPUアクセラレートされたFMGソルバはcuFFTライブラリを上回ることができるか?
  • RQ4どの問題サイズにおいてGPUアクセラレーションがCPUオンリーモードの計算よりも効率的になるか?
  • RQ5PDEソルバにおいて、GPUベースのGMGは現代のマルチコアCPUと比較して、エネルギー効率およびコスト効率に優れているか?

主な発見

  • GPUアクセラレートされたFMGソルバは、2次元で最大11倍、3次元で最大10倍の高速化をCPUオンリーモードのOpenMP実装で達成した。
  • 1600万未知数の問題に対しては、2次元でFMG(1,2)、3次元でFMG(3,3)が最適な収束レートを達成し、最小限の誤差を発生させた。
  • 同じ問題サイズと精度の下で、2次元ではcuFFTより33%速く、3次元では23%速かった。
  • 小規模な問題では、CPUとGPUのワークロードをバランスさせるハイブリッド計算(0 < Lθ < L)が最も利益をもたらした。
  • 並列性の欠如と繰り返しの粗いグリッドへのアクセスが原因で、GPUの利用度が制限され、ピーク浮動小数点性能が低下した。
  • 大規模なPDEソルバにおいて、GPUベースのGMGは現代のマルチコアCPUと比較して、エネルギー効率およびコスト効率に優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。