Skip to main content
QUICK REVIEW

[論文レビュー] Efficient distributed matrix-free multigrid methods on locally refined meshes for FEM computations

Peter Münch, Heister, Timo|arXiv (Cornell University)|Mar 23, 2022
Advanced Numerical Methods in Computational Mathematics被引用数 4
ひとこと要約

本稿では、deal.II ライブラリを用いた局所的メッシュ・レフィニメントにおける有限要素計算に対して、行列非依存 multigrid 法の3つの手法—幾何学的局所スムージング、幾何学的グローバルコarsening、多項式グローバルコarsening—を提示し、比較している。グローバルコarseningは、細かいレベルでのより良い負荷バランスのおかげで、並列スケーラビリティに優れていることが示された。一方、局所スムージングは、わずかに高い反復回数であるものの、制約の適用コストが低いため、シングルスレッド環境で優れた性能を発揮する。

ABSTRACT

This work studies three multigrid variants for matrix-free finite-element computations on locally refined meshes: geometric local smoothing, geometric global coarsening, and polynomial global coarsening. We have integrated the algorithms into the same framework-the open-source finite-element library deal.II-, which allows us to make fair comparisons regarding their implementation complexity, computational efficiency, and parallel scalability as well as to compare the measurements with theoretically derived performance models. Serial simulations and parallel weak and strong scaling on up to 147,456 CPU cores on 3,072 compute nodes are presented. The results obtained indicate that global coarsening algorithms show a better parallel behavior for comparable smoothers due to the better load balance particularly on the expensive fine levels. In the serial case, the costs of applying hanging-node constraints might be significant, leading to advantages of local smoothing, even though the number of solver iterations needed is slightly higher.

研究の動機と目的

  • 局所的レフィニメントメッシュにおける行列非依存有限要素法の3つの multigrid 変種—幾何学的局所スムージング、幾何学的グローバルコarsening、多項式グローバルコarsening—を評価および比較すること。
  • 統一されたフレームワーク内で、これらの手法の実装の複雑さ、計算効率、並列スケーラビリティを評価すること。
  • ハングド・ノード制約を伴う行列非依存 FEM の文脈において、局所的およびグローバルコarsening戦略の性能のトレードオフを分析すること。
  • 最大 147,456 コアを用いた大規模なシングルスレッドおよび並列シミュレーションを用いて、理論的性能モデルと実測値の整合性を検証すること。
  • 広範な採用と再現可能性を促進するため、deal.II 有限要素ライブラリにオープンソースでプロダクション運用可能な実装を提供すること。

提案手法

  • 公平で直接的な比較を実現するため、すべての3つの multigrid 変種を同じオープンソースの有限要素ライブラリ(deal.II)内に実装する。
  • ノードレベルのパフォーマンスを最大化し、並列環境における通信コストを強調するために、行列非依存演算評価を用いる。
  • 局所スムージング(最も細かいレベルでのみスムージング)とグローバルコarsening(全レベルにわたるコarsening)を伴う幾何学的 multigrid、および低次の多項式を用いたグローバルコarseningによる多項式 multigrid を使用する。
  • 非一致メッシュレベル間の連続性を維持するため、ハングド・ノード制約を適用し、その計算コストに特に注意を払う。
  • 最大 147,456 コア(3,072 個のコンピュータノード)を用いた、シングルスレッドシミュレーションおよび並列の弱スケーリング・ストロングスケーリングテストを実施する。
  • 効率性とスケーラビリティを評価するために、ソルバーの反復回数、解への到達時間、1反復あたりのパフォーマンスを測定する。

実験結果

リサーチクエスチョン

  • RQ1局所的レフィニメントメッシュにおいて、幾何学的局所スムージング、幾何学的グローバルコarsening、多項式グローバルコarseningは、並列スケーラビリティおよび負荷バランスの観点からどのように比較されるか?
  • RQ2ハングド・ノード制約の適用が、シングルスレッドパフォーマンスに与える影響は何か? これは、局所スムージングをグローバルスムージングよりも好む要因となるか?
  • RQ3行列非依存演算子を用いた場合、3つの multigrid 変種は、計算効率および反復回数の観点でどのように性能を発揮するか?
  • RQ4大規模な並列シミュレーションにおいて、理論的性能モデルと実測値の一致度合いはどの程度か?
  • RQ5グローバルコarseningは、細かいレベルでの制約コストが高いため、局所スムージングよりも並列効率が優れていると言えるか?

主な発見

  • グローバルコarsening手法は、特に高価な細かいレベルでのより良い負荷バランスのおかげで、並列スケーラビリティに優れている。大規模な並列実行において、局所スムージングを上回る性能を発揮する。
  • シングルスレッド計算では、わずかに反復回数が多いものの、ハングド・ノード制約の適用オーバーヘッドが低いため、局所スムージングがより優れたパフォーマンス(解への到達時間の短さ)を達成する。
  • p = 4 および L = 10 の場合、768 プロセス(16 ノード)でグローバルコarseningの解への到達時間は 3.4e-1 秒であるのに対し、局所スムージングは 3.0e-1 秒であり、局所スムージングにわずかだが測定可能なシングルスレッドの利点があることが示された。
  • 24,576 プロセス(512 ノード)では、グローバルコarseningは、ハングド・ノード付近のセル重み要因が変化しても安定したパフォーマンスを維持し、p = 4 および L = 10 の場合、解への到達時間は約 1.0e-1 秒であった。
  • 多項式グローバルコarseningは、幾何学的グローバルコarseningと同等のパフォーマンスを示し、両者とも局所スムージングを上回る並列スケーリング性能を発揮した。特にコア数が多い場合に顕著であった。
  • p-multigridにおけるAMGを粗いグリッドソルバーとして用いた場合、反復回数が多く、解法に長い時間がかかることから、本研究で提示された multigrid 変種よりも効率が悪く、この文脈では不適切であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。