Skip to main content
QUICK REVIEW

[論文レビュー] Resilience for Exascale Enabled Multigrid Methods

Markus Huber, Björn Gmeiner|arXiv (Cornell University)|Jan 29, 2015
Parallel Computing and Optimization Techniques参考文献 25被引用数 5
ひとこと要約

本稿は、エクサスケールコンputィングにおける並列幾何的多重グリッドソルバに対して、障害を局所的なサブプロブレムをDirichlet境界条件で解くことで回復するアルゴリズムベースの故障耐性(ABFT)戦略を提案する。この手法は、最小限のI/Oオーバーヘッドでチェックポイント再起動と同等の収束性を達成し、局所的多重グリッド回復が滑らかさ処理やKrylovソルバーよりも精度および効率に優れることを示している。

ABSTRACT

With the increasing number of components and further miniaturization the mean time between faults in supercomputers will decrease. System level fault tolerance techniques are expensive and cost energy, since they are often based on redundancy. Also classical check-point-restart techniques reach their limits when the time for storing the system state to backup memory becomes excessive. Therefore, algorithm-based fault tolerance mechanisms can become an attractive alternative. This article investigates the solution process for elliptic partial differential equations that are discretized by finite elements. Faults that occur in the parallel geometric multigrid solver are studied in various model scenarios. In a standard domain partitioning approach, the impact of a failure of a core or a node will affect one or several subdomains. Different strategies are developed to compensate the effect of such a failure algorithmically. The recovery is achieved by solving a local subproblem with Dirichlet boundary conditions using local multigrid cycling algorithms. Additionally, we propose a superman strategy where extra compute power is employed to minimize the time of the recovery process.

研究の動機と目的

  • エクサスケールHPCシステムにおけるハードウェア障害の増加する課題に対処し、数百万のノードが存在するため障害確率が上昇する。
  • 頻繁な状態保存によるI/Oおよびエネルギーコストが高いため、従来のチェックポイント再起動技術に限界があることを克服する。
  • システムレベルの冗長性やチェックポイントに依存せずに、障害回復を可能にするアルゴリズムベースの故障耐性(ABFT)アプローチを開発する。
  • ノードまたはコアの障害後、解の遅延および計算オーバーヘッドを最小限に抑えつつ、収束を保証する。
  • 局所的多重グリッドサイクルが、幾何的多重グリッドソルバにおける障害回復において、滑らかさ処理やKrylov法よりも優れていることを実証する。

提案手法

  • 障害状況を、解の値がサブドメインで失われる並列幾何的多重グリッドソルバにおけるコアまたはノード障害としてモデル化する。
  • 局所的多重グリッドサイクル(V-、W-、F-サイクル)を用いて、影響を受けるサブドメインでDirichlet境界条件を課した局所的サブプロブレムを解くことで、失われた値を回復する。
  • 余分な計算リソースを活用して局所的回復を並列化することで高速化する「スーパーマン」戦略を導入する。
  • 回復効率を比較するため、必要な多重グリッドサイクル数に基づいて、完全なチェックポイント再起動(CCR)に対する「サイクルアドバンテージ(CCR)」指標を導入する。
  • 有限要素法によるポisson方程式の離散化を用いて、階層的ハイブリッド多重グリッド(HHG)フレームワーク内で回復戦略を実装および評価する。
  • 障害発生タイミングの違いを考慮し、さまざまなスムージング法(Gauss-Seidel、Jacobi)、PCG反復回数、多重グリッドサイクルにおける回復性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1チェックポイントに依存せずに、並列幾何的多重グリッドソルバにおけるノードまたはコア障害から、局所的多重グリッドサイクルを用いて効果的に回復可能か?
  • RQ2障害発生タイミング(解法プロセスの初期段階 vs. 後段階)が、必要な回復作業量および収束速度に与える影響は?
  • RQ3滑らかさ処理、PCG、多重グリッドサイクルといった異なる回復戦略の相対的性能は、チェックポイント再起動と同等の精度に到達するか?
  • RQ4「スーパーマン」戦略は、追加の並列性を活用することで、回復時間を顕著に短縮できるか?
  • RQ5サイクルアドバンテージ指標は、完全なチェックポイント再起動と比較して、回復戦略の効率をどのように定量化できるか?

主な発見

  • 5反復後における障害発生時、4回のV-サイクル、3回のW-サイクル、または3回のF-サイクルで条件数(κ)が4.164に達し、完全なチェックポイント再起動(CCR)戦略と同等の精度を達成する。
  • 7反復後における障害発生時、κ ≈ 6.445に達するには5回のW-またはF-サイクルが必要であり、CCR結果と一致する。一方、スムージング法およびPCG戦略は僅かな改善にとどまる。
  • 11反復後における障害発生時、CCR性能(κ ≈ 10.999)に到達するには5回を超えるW-またはF-サイクルが必要であり、障害検出の遅延に伴い回復コストが増加することが示された。
  • W-サイクルとF-サイクルはほぼ同等の回復性能を示すが、F-サイクルは計算コストが低いため好ましい。
  • スムージング法およびPCGベースの回復戦略は、ベースライン手法に比べて僅かな改善にとどまり、多重グリッドサイクルの精度には及ばない。
  • CCR指標により、多重グリッドサイクルがI/Oおよび計算オーバーヘッドを最小限に抑えつつ、CCRに類似した精度を達成できる唯一の回復手法であることが確認され、エクサスケールのレジリエンスに最適であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。