Skip to main content
QUICK REVIEW

[論文レビュー] Scalable and Fault Tolerant Computation with the Sparse Grid Combination Technique

Brendan Harding, Markus Hegland|arXiv (Cornell University)|Apr 10, 2014
Distributed systems and fault tolerance参考文献 13被引用数 3
ひとこと要約

本稿では、スケーラブルなハイパフォーマンスコンピューティングを実現するため、疎グリッド結合手法のフォールトトレラント拡張を提案している。これにより、最小限の回復オーバーヘッドで耐障害的かつ大規模並列処理が可能になる。組み合わせ係数の一般化とアルゴリズムベースのフォールトトレラランスを用いることで、回復時間を短縮しつつ、精度の損失は最小限に抑えられる。3次元移流PDEシミュレーションにおいて頻繁な障害が発生する状況では、従来のチェックポイントリスタート法を上回る性能を発揮する。

ABSTRACT

This paper continues to develop a fault tolerant extension of the sparse grid combination technique recently proposed in [B. Harding and M. Hegland, ANZIAM J., 54 (CTAC2012), pp. C394-C411]. The approach is novel for two reasons, first it provides several levels in which one can exploit parallelism leading towards massively parallel implementations, and second, it provides algorithm-based fault tolerance so that solutions can still be recovered if failures occur during computation. We present a generalisation of the combination technique from which the fault tolerant algorithm is a consequence. Using a model for the time between faults on each node of a high performance computer we provide bounds on the expected error for interpolation with this algorithm. Numerical experiments on the scalar advection PDE demonstrate that the algorithm is resilient to faults on a real application. It is observed that the trade-off of recovery time to decreased accuracy of the solution is suitably small. A comparison with traditional checkpoint-restart methods applied to the combination technique show that our approach is highly scalable with respect to the number of faults.

研究の動機と目的

  • エクサスケールコンピューティングにおける実行時障害の課題に対処すること。特に、高い障害率と長いチェックポイント時間のため、従来のチェックポイントリスタート手法が非現実的になる状況を想定する。
  • 大規模システム上で耐障害的かつスケーラブルな計算を可能にする、疎グリッド結合手法のフォールトトレラント版を開発すること。
  • 複数の障害状況下でも、回復時間と計算オーバーヘッドを最小限に抑えつつ、妥当な解の精度を維持すること。
  • 3次元スカラー移流PDEにシミュレートされた障害を適用した数値実験を通じて、スケーラビリティと耐障害性を実証すること。

提案手法

  • ノード障害後に再計算可能な動的組み合わせ係数の一般化により、完全な再実行なしにフォールトトレラント性を実現する、疎グリッド結合手法の拡張。
  • 確率的障害モデルを用いて、ノード障害発生時の補間解における期待誤差を推定し、精度損失の数学的上限を提供する。
  • MPIとOpenMPを用いた多層構造の並列アーキテクチャを実装し、分散ノード全体にわたるタスク、データ、コンponentレベルの並列性を活用する。
  • アルゴリズムベースのフォールトトレラランス(ABFT)を適用し、障害後の解再構築においてわずかで境界付きの誤差を許容することで、完全なチェックポイントを回避する。
  • 計算の最終段階でのみ、コンポーネントグリッド解の結合を1回だけ実行することで、通信オーバーヘッドを低減し、スケーラビリティを向上させる。
  • 3次元移流PDEソルバーにおいてシミュレートされた障害を用いて、局所的およびグローバルなチェックポイントと比較して回復性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1疎グリッド結合手法をどのように一般化すれば、計算効率を維持したままフォールトトレラント性を実現できるか?
  • RQ2計算中に障害が発生した場合、解における期待誤差はどの程度であり、数学的に境界を定められるか?
  • RQ3複数の障害が発生する状況下で、提案手法のアルゴリズムベースのフォールトトレラランスは、従来のチェックポイントリスタート法と比較して回復時間とスケーラビリティにおいてどのように差をつけるか?
  • RQ4障害の頻度と分布が、並列HPC環境における解の精度と性能に与える影響は何か?

主な発見

  • 提案手法は、特に高い障害率下で、チェックポイントリスタート法と比較して回復時間を顕著に短縮する。
  • 解の期待誤差は非常に小さく、複数回のシミュレートされた障害後でも精度にほとんど影響しない。
  • 障害数の増加に伴ってもスケーリングが良好であり、数回の障害後には、局所的およびグローバルなチェックポイント法を上回る性能を示す。
  • 複数回の障害が発生した場合、フォールトトレラント手法のオーバーヘッドは、回復コストに比べて無視できるほど小さくなる。
  • 障害が発生しない状況では、最大60スレッドまでで線形スケーリングに近いスピードアップが達成されている。
  • 実際の3次元移流PDEアプリケーションにおいて、数値実験により一貫した耐障害性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。