[論文レビュー] Domain Decomposition method on GPU cluster
本論文では、低コストGPUクラスタ上で、混合精度ネストドBiCGStabソルバに制限付き加法的 Schwarz(RAS)スプリーストレッサを適用することで、格子QCDシミュレーションにおける通信ボトルネックを軽減する手法を提案する。格子領域を分割し、8つのGPUに計算を分散させることで、非プレコンディショナー・ソルバーよりも2倍の性能向上を達成した。これは主に、高遅延のギガビットイーサーネット接続下でもGPU間通信のオーバーヘッドを低減することで実現された。
Pallalel GPGPU computing for lattice QCD simulations has a bottleneck on the GPU to GPU data communication due to the lack of the direct data exchanging facility. In this work we investigate the performance of quark solver using the restricted additive Schwarz (RAS) preconditioner on a low cost GPU cluster. We expect that the RAS preconditioner with appropriate domaindecomposition and task distribution reduces the communication bottleneck. The GPU cluster we constructed is composed of four PC boxes, two GPU cards are attached to each box, and we have eight GPU cards in total. The compute nodes are connected with rather slow but low cost Gigabit-Ethernet. We include the RAS preconditioner in the single-precision part of the mixedprecision nested-BiCGStab algorithm and the single-precision task is distributed to the multiple GPUs. The benchmarking is done with the O(a)-improved Wilson quark on a randomly generated gauge configuration with the size of $32^4$. We observe a factor two improvment on the solver performance with the RAS precoditioner compared to that without the preconditioner and find that the improvment mainly comes from the reduction of the communication bottleneck as we expected.
研究の動機と目的
- 低遅延のGPU間通信が、低速なインターコネクトを介して発生する多GPU格子QCDシミュレーションにおける性能ボトルネックを解消すること。
- 多GPU環境における通信オーバーヘッドを低減するために、制限付き加法的 Schwarz(RAS)プレコンディショナーの有効性を評価すること。
- ドメイン分割とGPU間のタスク配分を最適化し、遅延を最小限に抑え、ソルバー効率を最大化すること。
- 実際のGPUクラスタ上で、RASプレコンディショニングを施した混合精度ネストドBiCGStabソルバの性能をベンチマークすること。
提案手法
- 混合精度ネストドBiCGStabアルゴリズムの単精度フェーズにRASプレコンディショナーを適用し、収束を加速する。
- 格子を重複のない部分領域と重複のある部分領域に分割し、各GPU上で局所的にドメイン制限付き演算子を解く。
- 非重複領域のボリュームサイトへの更新を制限するR_{\Omega_i}投影演算子を用いて、データ通信を最小限に抑える。
- 重なりのあるドメイン分割(d=0,2,4)を用い、重なり層の数とドメイン反転ステップ数を変化させる。
- GPUクラスタは4台のPCから構成され、各PCに2つのGPUが搭載されており、ギガビットイーサーネットで接続されており、実用的な低コストHPC環境を模擬している。
- 性能は、O(a)-改質ウィルソンフェルミオンとガウスノイズ源を用いた32^4格子を用いて測定された。
実験結果
リサーチクエスチョン
- RQ1低コストクラスタ上の多GPU格子QCDソルバーにおいて、RASプレコンディショナーは通信ボトルネックを低減できるか?
- RQ2ドメインの重なり(d=0,2,4)は、ソルバー性能と通信オーバーヘッドにどのように影響するか?
- RQ3総ソルブ時間の最小化に最適なRASパラメータ(NRAS, N_dominv)の設定は何か?
- RQ4Dv演算回数の削減が、増加した通信および計算オーバーヘッドを補っても、測定可能な性能向上をもたらすか?
主な発見
- ドメインの重なりなし(d=0)のRASプレコンディショナーは、総ソルブ時間を53.305秒から27.977秒に短縮し、2倍の高速化を達成した。
- 通信時間は総実行時間の大部分を占めており、測定された双方向帯域幅は約300 MB/secであった。
- Dv演算回数が63%削減された(1,328回から484回に)d=2ケースでは、投影とドメイン反転によるオーバーヘッド増加のため、性能向上が得られなかった。
- d=4ケースではDv演算回数がわずかに減少したが、投影とドメイン反転のオーバーヘッドが高いため、性能向上は得られなかった。
- RASプレコンディショナーの利点は、演算回数の減少ではなく、通信量の削減によるものであり、通信時間こそが主なボトルネックであるためである。
- 最適な設定はNRAS=3およびN_dominv=5と判明し、d=0が最も優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。