Skip to main content
QUICK REVIEW

[論文レビュー] Extreme-scale Multigrid Components within PETSc

Dave A. May, Patrick Sanan|arXiv (Cornell University)|Apr 25, 2016
Advanced Numerical Methods in Computational Mathematics参考文献 18被引用数 5
ひとこと要約

この論文では、極大規模幾何的多重グリッド法のスケーラブルな粗いレベルのソルバーを実現するための、PETSc内でのMPIランク集約コンponent「Telescope」を紹介する。MPIコミュニケータの粗い化により通信オーバーヘッドを低減することで、Telescopeは多重グリッド条件付きのスケーラビリティとパフォーマンスを向上させ、構造化メッシュを用いた数値実験により、強力スケーリングおよびハイブリッドCPU-GPUワークロードにおいて顕著な高速化が確認された。

ABSTRACT

Elliptic partial differential equations (PDEs) frequently arise in continuum descriptions of physical processes relevant to science and engineering. Multilevel preconditioners represent a family of scalable techniques for solving discrete PDEs of this type and thus are the method of choice for high-resolution simulations. The scalability and time-to-solution of massively parallel multilevel preconditioners can be adversely effected by using a coarse-level solver with sub-optimal algorithmic complexity. To maintain scalability, agglomeration techniques applied to the coarse level have been shown to be necessary. In this work, we present a new software component introduced within the Portable Extensible Toolkit for Scientific computation (PETSc) which permits agglomeration. We provide an overview of the design and implementation of this functionality, together with several use cases highlighting the benefits of agglomeration. Lastly, we demonstrate via numerical experiments employing geometric multigrid with structured meshes, the flexibility and performance gains possible using our MPI-rank agglomeration implementation.

研究の動機と目的

  • 粗いレベルのソルバーのスケーラビリティ制限を、非最適なアルゴリズム的複雑度のための解決を目的とする。
  • 粗いレベルでの通信および計算負荷を低減することで、大規模並列アーキテクチャ上で効率的かつスケーラブルな多重グリッド性能を実現することを目的とする。
  • 構造化および非構造化メッシュ階層をサポートする一般化された集約フレームワークをPETSc内に提供することを目的とする。
  • プロセスの粗い化による多重グリッド階層の最適化を通じて、大規模な楕円型PDEシミュレーションにおける時間対ソリューションを改善することを目的とする。
  • 柔軟で負荷分散が可能な粗いレベルの計算の分散を可能にすることで、ハイブリッドCPU-GPUワークロードおよび強力スケーリングの研究を支援することを目的とする。

提案手法

  • 粗いレベルでのMPIプロセス数を削減するため、MPIコミュニケータの粗い化(集約)を実行する新しいPETScコンponent「Telescope」を導入する。
  • メッシュ階層と計算ワークロードのバランスに基づいて、トップダウン戦略による集約を適用する。
  • 再離散化された作用素とマトリックスフリーのスムージングを用いる幾何的多重グリッドを採用し、すべてのレベルで効率を維持する。
  • DMDA(分散メッシュおよびデータアセンブリ)オブジェクトの再分割をサポートし、非構造化メッシュ用にDMPlexへの拡張を想定する。
  • 一時的なマトリックスをセットアップ段階で使用し、並べ替えと再配布を実行する。将来的にはメモリ削減を目的とする。
  • MPIコミュニケータの階層的管理を可能にする、DMインタフェース拡張(DMRefinePartition)を提案する。

実験結果

リサーチクエスチョン

  • RQ1極大規模多重グリッドにおいて、粗いレベルのソルバーのパフォーマンスをどのように向上させれば、アルゴリズム的スケーラビリティを維持できるか?
  • RQ2MPIランク集約が幾何的多重グリッド条件付きの時間対ソリューションおよび通信オーバーヘッドに与える影響は何か?
  • RQ3集約を、PETSc内で構造化および非構造化メッシュ階層の両方をサポートする一般化できるか?
  • RQ4集約がハイブリッドCPU-GPU多重グリッドワークフローにおける負荷バランスおよびパフォーマンスに与える影響は何か?
  • RQ5ハードウェアおよびマトリックス特性に基づいて最適な集約選択をガイドするパフォーマンスモデルは何か?

主な発見

  • Telescopeは、MPIコミュニケータの粗い化により、粗いレベルでの通信および計算負荷を低減することで、スケーラブルな粗いレベルのソルバーを実現する。
  • 構造化メッシュと幾何的多重グリッドを用いた数値実験により、強力スケーリングの研究で顕著なパフォーマンス向上が確認された。
  • 集約アプローチは、CPUとGPUを組み合わせたハイブリッドスムージングをサポートし、異種環境における時間対ソリューションの改善に寄与する。
  • アルゴリズム的スケーラビリティを維持し、極めて大きな問題サイズでもO(n)の時間対ソリューションを実現する。
  • Telescopeの設計は汎用的であり、将来的にDMPlexおよびPETSc内の他のDM実装への拡張を可能にする。
  • ネットワーク遅延、メモリアクセス、マトリックス構造に基づく最適な集約選択のパフォーマンスモデルは、今後の主要な方向性であると特定された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。