Skip to main content
QUICK REVIEW

[論文レビュー] Algorithmic Based Fault Tolerance Applied to High Performance Computing

George Bosilca, Rémi Delmas|ArXiv.org|Jun 19, 2008
Distributed systems and fault tolerance参考文献 1被引用数 20
ひとこと要約

本稿では、高性能コンputィング向けに、並列分散行列乗算(PDGEMM)に拡張された、スケーラブルなアルゴリズムベースの故障耐性(ABFT)技術を提案する。この技術により、プロセス障害およびビット反転エラーを実行時中に検出・是正可能であり、484プロセッサでわずか12%のオーバーヘッドで1.4 TFLOPSの性能を達成し、ピーク性能の65%を実現。プロセッサ数の増加に伴い故障耐性のオーバーヘッドも低下する。

ABSTRACT

We present a new approach to fault tolerance for High Performance Computing system. Our approach is based on a careful adaptation of the Algorithmic Based Fault Tolerance technique (Huang and Abraham, 1984) to the need of parallel distributed computation. We obtain a strongly scalable mechanism for fault tolerance. We can also detect and correct errors (bit-flip) on the fly of a computation. To assess the viability of our approach, we have developed a fault tolerant matrix-matrix multiplication subroutine and we propose some models to predict its running time. Our parallel fault-tolerant matrix-matrix multiplication scores 1.4 TFLOPS on 484 processors (cluster jacquard.nersc.gov) and returns a correct result while one process failure has happened. This represents 65% of the machine peak efficiency and less than 12% overhead with respect to the fastest failure-free implementation. We predict (and have observed) that, as we increase the processor count, the overhead of the fault tolerance drops significantly.

研究の動機と目的

  • 高故障率の大型HPCシステムにおいて、従来のチェックポイント方式に見られるスケーラビリティの制限を解消すること。
  • プロセッサ数の増加に伴っても性能を維持する故障耐性のある線形代数カーネルの開発。
  • 計算中にプロセス障害およびビット反転エラーを実行時中に検出・是正可能にする。
  • I/Oの高コストを回避するため、アルゴリズム的符号化と並列処理を活用して故障耐性のオーバーヘッドを最小限に抑える。
  • ScaLAPACKのような分散型メッセージパス方式環境におけるABFTの実用性を実証すること。

提案手法

  • ScaLAPACKのPDGEMMを用いて、並列分散メモリ環境で動作するように、HuangとAbrahamの元来のABFT手法を適応。
  • チェックサム方式(例:パリティベクトル)を用いて行列データを符号化し、計算中にエラー検出・是正を可能にする。
  • 符号化されたデータを処理するように行列乗算アルゴリズムを再設計し、再起動なしに故障検出・是正を実現。
  • 故障耐性カーネルをABFT BLASライブラリに統合し、実行時における透明なエラー回復を可能にする。
  • 異なるプロセッサ数における実行時間とオーバーヘッドを推定するため、2つのパラメータ(αとγ)を用いた予測性能モデルを構築。
  • 484プロセッサのクラスタを用いて、弱スケーリングおよび強スケーリングの実験を実施し、障害状況下での性能とオーバーヘッドを評価。

実験結果

リサーチクエスチョン

  • RQ1ABFTは、大規模で分散メモリ型HPCシステムに効果的に拡張可能であり、低オーバーヘッドで故障耐性を実現できるか?
  • RQ2固定問題サイズのもとで、プロセッサ数の増加に伴い、ABFTの故障耐性オーバーヘッドは減少するか?
  • RQ3提案手法は、行列乗算の実行中に、プロセス障害およびビット反転エラーをリアルタイムで検出・是正できるか?
  • RQ4弱スケーリングおよび強スケーリングの両状況下で、故障耐性PDGEMMの性能は、標準PBLAS PDGEMMと比べてどの程度か?
  • RQ52つのパラメータ(αとγ)を用いた単純なモデルで、故障耐性のオーバーヘッドをどの程度正確に予測できるか?

主な発見

  • 故障耐性PDGEMMは、484プロセッサ(クラスタ jacquard.nersc.gov)で1.4 TFLOPSを達成し、マシンのピーク性能の65%に相当。
  • 1つのプロセス障害が発生した場合でも、アルゴリズムは正しく結果を返し、実行時回復が有効に機能していることを示した。
  • 484プロセッサでの故障耐性オーバーヘッドは、最も高速な故障なし実装と比較して12%未満であった。
  • プロセッサ数の増加に伴い、故障耐性オーバーヘッドは顕著に低下し、強スケーリングでは484プロセッサで114.7%にまで低下した。
  • 2つのパラメータ(αとγ)を用いた性能モデルは、48回の実験において実験結果を数パーセントの誤差内に予測した。
  • 強スケーリング(固定問題サイズ)において、故障耐性のオーバーヘッドはプロセッサ数の増加に伴いゼロに収束し、本質的なスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。