Skip to main content
QUICK REVIEW

[論文レビュー] A Massively Parallel Algebraic Multigrid Preconditioner based on Aggregation for Elliptic Problems with Heterogeneous Coefficients

Markus Blatt, Olaf Ippisch|arXiv (Cornell University)|Sep 5, 2012
Advanced Numerical Methods in Computational Mathematics参考文献 28被引用数 14
ひとこと要約

本稿では、異方的係数を有する楕円型PDEに対して、非滑らか化集約に基づく大規模並列代数的多重グリッド(AMG)プリコンディショナを提示する。強さ基準に基づくグリーディ集約アルゴリズムとピecewise定数補間を用い、Blue Gene/P上で262,144コアまで弱スケーラビリティを達成した。10^11以上の自由度を持つ問題を解く際、低メモリ使用量と高い時間効率を維持した。

ABSTRACT

This paper describes a massively parallel algebraic multigrid method based on non-smoothed aggregation. It is especially suited for solving heterogeneous elliptic problems as it uses a greedy heuristic algorithm for the aggregation that detects changes in the coefficients and prevents aggregation across them. Using decoupled aggregation on each process with data agglomeration onto fewer processes on the coarse level, it weakly scales well in terms of both total time to solution and time per iteration to nearly 300,000 cores. Because of simple piecewise constant interpolation between the levels, its memory consumption is low and allows solving problems with more than 100,000,000,000 degrees of freedom.

研究の動機と目的

  • 高変動係数を有する楕円型PDEのための、非常にスケーラブルでメモリ効率の良いAMGプリコンディショナの開発。
  • コアあたりのメモリが限られた現代のスーパーコンピュータ上で、大規模問題(10^11以上の自由度)を解けるようにすること。
  • ほぼ30万コアにわたり、解法時間と反復あたりの時間の両方で弱スケーリングを達成すること。
  • ピecewise定数補間を用い、滑らか化補間を避けることで、メモリフットプリントと演算子の複雑さを最小限に抑えること。
  • セットアップ段階のスケーラビリティのボトルネックを解消するため、分離された集約と粗いレベルでのデータアグロメレーションを採用すること。

提案手法

  • 高対比係数ジャンプを回避するように、接続強度基準に基づくグリーディ集約アルゴリズムを用いて集約を形成する。
  • ステンシルの拡大を防ぎ、メモリ使用量を削減するため、レベル間で単純なピecewise定数補間を用いた非滑らか化集約を採用する。
  • 通信を最小限に抑えるために、各プロセスごとに分離された集約を実行し、粗いレベルでデータアグロメレーションを適用することで、弱スケーリングを支援する。
  • データ分解と演算子適用の簡素化を図るため、非連続インデックス集合を用いた並列線形代数を実装する。
  • 幾何的情報を必要とせず、代数的行列グラフ上で幾何的 multigrid に類似した粗化を実施する。
  • 標準的なスムージング法(例: Gauss-Seidel)を用い、集約を通じて行列の階層を維持する。

実験結果

リサーチクエスチョン

  • RQ1非滑らか化集約AMG法は、異方的係数を有する楕円問題に対して、ほぼ30万コアまで弱スケーリングを達成できるか?
  • RQ2大規模問題を解く際、非滑らか化集約AMGのメモリ消費量は、古典的AMGと比べてどの程度か?
  • RQ310^11以上の自由度を持つ問題を解く際、解法時間の弱スケーリングはどの程度達成されるか?
  • RQ4ピecewise定数補間とグリーディ集約を用いることで、反復回数が増加しても収束のロバスト性が維持されるか?
  • RQ5高コア数かつコアあたりのメモリが限られた現代のHPCシステムでも、この手法は効果的にスケーリングできるか?

主な発見

  • 本手法は、IBM Blue Gene/P上で262,144コアまで弱スケーリングを達成し、5.12×10^11の自由度を持つ異方的拡散問題を解いた。
  • 解法時間は効率的にスケーリングされ、64コアから262,144コアにスケーリングした際、合計解法時間は約1.7倍にしか増加しなかった。
  • 問題の自由度が10^11を超える場合でも、64ラックのBlue Gene/Pを用いても、十分に低いメモリフットプリントを維持した。
  • 反復あたりの時間も良好にスケーリングされ、異方的問題では512コアで0.15秒から262,144コアで5.37秒にわずかに増加した。
  • セットアップ段階は、シーケンシャルなグラフ分割によるボトルネックであったが、合計解法時間は依然として良好にスケーリングされ、類似のハードウェア上での先行AMG実装を上回った。
  • マルチコアLinuxクラスタ上では、ポisson問題に対して512コアで27%の効率を達成し、メモリ帯域幅の制限にもかかわらず強スケーリングが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。