Skip to main content
QUICK REVIEW

[論文レビュー] A quantitative performance analysis for Stokes solvers at the extreme scale

Björn Gmeiner, Markus Huber|arXiv (Cornell University)|Nov 6, 2015
Advanced Numerical Methods in Computational Mathematics参考文献 19被引用数 3
ひとこと要約

本稿では、極大規模アーキテクチャ上で低次の四面体有限要素を用いたストークス系のための3つの並列反復解法の体系的性能分析を提示する。Uzawa型多重グリッド解法が最良の性能を示し、786,432スレッドで1.1×10¹³自由度の系を13分未塔で解いており、行列非依存実装と並列教科書的多重グリッド効率指標により、優れたスケーラビリティとメモリ効率を示している。

ABSTRACT

This article presents a systematic quantitative performance analysis for large finite element computations on extreme scale computing systems. Three parallel iterative solvers for the Stokes system, discretized by low order tetrahedral elements, are compared with respect to their numerical efficiency and their scalability running on up to $786\,432$ parallel threads. A genuine multigrid method for the saddle point system using an Uzawa-type smoother provides the best overall performance with respect to memory consumption and time-to-solution. The largest system solved on a Blue Gene/Q system has more than ten trillion ($1.1 \cdot 10 ^{13}$) unknowns and requires about 13 minutes compute time. Despite the matrix free and highly optimized implementation, the memory requirement for the solution vector and the auxiliary vectors is about 200 TByte. Brandt's notion of "textbook multigrid efficiency" is employed to study the algorithmic performance of iterative solvers. A recent extension of this paradigm to "parallel textbook multigrid efficiency" makes it possible to assess also the efficiency of parallel iterative solvers for a given hardware architecture in absolute terms. The efficiency of the method is demonstrated for simulating incompressible fluid flow in a pipe filled with spherical obstacles.

研究の動機と目的

  • 極大規模システムにおけるストークス系のための3つの並列反復解法の数値的効率性とスケーラビリティを評価すること。
  • 大規模有限要素問題における時間的解法速度とメモリ消費量の観点から、最も効率の良い解法を特定すること。
  • 教科書的多重グリッド効率の概念を並列アーキテクチャに拡張し、絶対的ハードウェア評価を可能にすること。
  • 現代のスーパーコンピュータで最大10¹³自由度のストークス問題を解く可能性を実証すること。
  • 異なる境界条件とメッシュ構成において、解法のロバストネスを検証すること。

提案手法

  • 本研究では、有限要素の柔軟性と幾何的多重グリッドの効率性を統合するため、階層的ハイブリッドグリッド(HHG)フレームワークを採用する。
  • 3つの解法を比較する:(i) 近似シュール補行列CG、(ii) 多重グリッド前処理付きMINRES、(iii) Uzawa型 smoother を用いた真の一度に全グリッドを処理する多重グリッド法。
  • Uzawa多重グリッド法は行列非依存実装を採用し、ス add-ポイント系のためのUzawa反復に基づく smoother を適用する。
  • 性能は、ブランドトの教科書的多重グリッド効率と、その並列教科書的多重グリッド効率への拡張を用いて定量評価する。
  • シミュレーションは、最大786,432の並列スレッドを有するBlue Gene/Qシステム上で実施され、10¹³以上の自由度を持つ系が解かれた。
  • 境界条件は、ノード基底関数に基づく質量保存型法線ベクトル定義を用いた点ごとの接線応力条件により実装される。

実験結果

リサーチクエスチョン

  • RQ13つの反復解法(シュール補行列CG、多重グリッド前処理付きMINRES、Uzawa多重グリッド)の中で、極大規模において時間的解法速度とメモリ効率の両面で最も優れた性能を示すのはどれか?
  • RQ2並列教科書的多重グリッド効率の概念は、一度に全グリッドを処理する多重グリッド解法にどのように拡張可能か?また、これによりハードウェアに配慮した性能評価にどのようなインサイトが得られるか?
  • RQ3スケーラブルで行列非依存の有限要素解法を用いて、ペタスケールシステム上で13分以内に解ける最大の問題サイズ(自由度)はどの程度か?
  • RQ4複雑な幾何形状(例えば球体の密集系)において、ノースリップ境界条件やフリースリップ境界条件を含むさまざまな境界条件に対して、解法はどの程度ロバストか?
  • RQ5メッシュの品質や要素の形状が、大規模シミュレーションにおける解法収束性と性能に与える影響は何か?

主な発見

  • Uzawa型多重グリッド解法が全体として最良の性能を示し、786,432スレッドで1.1×10¹³自由度の系を約13分で解いた。
  • 行列非依存かつ高度に最適化された実装にもかかわらず、解と補助ベクトルのメモリ要件は約200テラバイトに達した。
  • Uzawa多重グリッド法は優れたスケーラビリティとロバストネスを示し、ノースリップおよび球体障害物上のフリースリップ境界条件を含むさまざまな境界条件でも高い性能を維持した。
  • 教科書的多重グリッド効率を並列システムに拡張することで、現在の高性能アーキテクチャ上での解法の効率性を確認する絶対的評価が可能になった。
  • ラプラシアンとD作用素の両方の定式化において、解法は強力な収束性を示し、問題サイズの変化に伴う性能劣化は観察されなかった。
  • 標準のワークステーションでも、最大5×10⁸自由度の系が13分未満で解けたことから、本手法のあらゆるスケールにおける効率性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。