Skip to main content
QUICK REVIEW

[論文レビュー] Resilience for Multigrid Software at the Extreme Scale

Markus Huber, Björn Gmeiner|arXiv (Cornell University)|Jun 20, 2015
Parallel Computing and Optimization Techniques参考文献 47被引用数 6
ひとこと要約

本論文は、ハードウェア障害に耐性を持つ幾何学的多重グリッドソルバーを、極限規模HPCシステム向けに提案する。この手法は、界面値の冗長な保存と非同期的な局所的多重グリッド回復を用いて、ハード障害を補償する。強力な「スーパーマン」計算リソースを活用して局所的回復を高速化することで、時間的遅延を一切発生させずに障害を完全に補償し、ペタスケールシステムにおいて優れた並列性能を達成する。

ABSTRACT

Fault tolerant algorithms for the numerical approximation of elliptic partial differential equations on modern supercomputers play a more and more important role in the future design of exa-scale enabled iterative solvers. Here, we combine domain partitioning with highly scalable geometric multigrid schemes to obtain fast and fault-robust solvers in three dimensions. The recovery strategy is based on a hierarchical hybrid concept where the values on lower dimensional primitives such as faces are stored redundantly and thus can be recovered easily in case of a failure. The lost volume unknowns in the faulty region are re-computed approximately with multigrid cycles by solving a local Dirichlet problem on the faulty subdomain. Different strategies are compared and evaluated with respect to performance, computational cost, and speed up. Especially effective are strategies in which the local recovery in the faulty region is executed in parallel with global solves and when the local recovery is additionally accelerated. This results in an asynchronous multigrid iteration that can fully compensate faults. Excellent parallel performance on a current peta-scale system is demonstrated.

研究の動機と目的

  • 巨大並列化に伴い故障確率が上昇する極限規模HPCシステム向けに、故障耐性を持つ多重グリッドソルバーを設計すること。
  • 分散メモリシステムにおけるハード障害発生時、反復的ソルバーの遅延と計算オーバーヘッドを最小限に抑えること。
  • 高価なチェックポイント技術に依存せずに、効率的な局所的回復により障害を完全に補償できること。
  • グローバルな多重グリッドサイクルと非同期的な回復を統合し、スケーラビリティと性能を維持すること。
  • 10^11個の未知数を含む大規模シミュレーションを含む、実際のペタスケールシステム上で手法を検証すること。

提案手法

  • ゴーストノードを備えた領域分割を用い、障害回復のための冗長値を低次元の界面(例:面)にのみ保存する。
  • 階層的ハイブリッド回復戦略を実装し、失われた体積未知数を、故障したサブドメイン上でディリクレ問題を解く局所的多重グリッドサイクルにより再構築する。
  • 故障サブドメインに計算リソースを過剰に割り当てることで「スーパーマン」戦略を採用し、局所的回復を高速化し、時間的遅延を完全に解消する。
  • 健全なサブドメインと故障したサブドメインで独立して計算が可能となる非同期的な方法で、局所的回復とグローバルな多重グリッド反復を統合する。
  • 境界条件を近似的に与えるために、ディリクレ=ノイマンまたはディリクレ=ディリクレの回復戦略を用いて局所的サブ問題を解く。
  • 回復の効率を最適化するため、局所的反復回数(n_I)とスーパーマンパワー(η_super)を調整し、通信や計算の過剰な増加を避ける。

実験結果

リサーチクエスチョン

  • RQ1極限規模において、最小限の計算および通信オーバーヘッドで多重グリッドソルバーの故障耐性を実現できるか?
  • RQ2局所的回復がどれほど効率的であれば、時間的遅延を増加させることなく障害を完全に補償できるか?
  • RQ3障害発生時、局所的回復の努力とグローバルな多重グリッド収束の間に最適なバランスは何か?
  • RQ4スーパーマン加速による非同期的局所的回復は、反復的ソルバーにおける障害の性能ペナルティを完全に解消できるか?
  • RQ5障害状態下で、より優れたパフォーマンスと耐障害性を示すのは、ディリクレ=ディリクレ戦略か、ディリクレ=ノイマン戦略か?

主な発見

  • ディリクル=ノイマン回復戦略は、障害回復中の同期化と収束制御がより良好であるため、ディリクル=ディリクル戦略を上回る性能を示す。
  • 最適なスーパーマンパワー(η_super = 4)と n_I = 2 または 3 を採用した場合、回復時間は回復なしの場合と比較して最大80%短縮される。
  • 5回または9回目の反復後に障害が発生した弱スケーリングにおいて、追加時間コストは元の時間の47.8%~55.7%から、769³グリッドサイズではわずか4.22秒にまで低減された。
  • 局所的回復が過剰並列化によって加速されれば、障害の完全な補償が可能となり、時間的遅延の増加が生じない。
  • 本手法はペタスケールシステムにおいて優れた並列性能を維持し、10^11個の未知数にまでスケーラビリティを示した。
  • n_I を、n_F ≈ n_I + k_F - 2 となるように選べば、局所的収束と通信遅延のバランスが最適化され、回復オーバーヘッドが最小化される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。