[論文レビュー] Understanding Fault Scenarios and Impacts through Fault Injection Experiments in Cielo
本論文は、Cieloペタフラップ級Cray XEスーパーコンピュータ上で大規模な故障挿入実験を実施し、相互接続ネットワークおよびコンピューティングノードにおける故障から失敗への伝播を調査した。HPCArrowツールを用いて、リンク、ノード、ブレードにハードウェアレベルの故障を挿入し、プロアクティブなレジリエンス機構を可能にする重要な回復遅延およびネットワークデッドロックを特定した。得られた知見は、将来のCray XC(Aries)システムへも応用可能である。
We present a set of fault injection experiments performed on the ACES (LANL/SNL) Cray XE supercomputer Cielo. We use this experimental campaign to improve the understanding of failure causes and propagation that we observed in the field failure data analysis of NCSA's Blue Waters. We use the data collected from the logs and from network performance counter data 1) to characterize the fault-error-failure sequence and recovery mechanisms in the Gemini network and in the Cray compute nodes, 2) to understand the impact of failures on the system and the user applications at different scale, and 3) to identify and recreate fault scenarios that induce unrecoverable failures, in order to create new tests for system and application design. The faults were injected through special input commands to bring down network links, directional connections, nodes, and blades. We present extensions that will be needed to apply our methodologies of injection and analysis to the Cray XC (Aries) systems.
研究の動機と目的
- 大規模HPCシステム、特にネットワークおよびコンピューティングコンponentsにおける故障から失敗への伝播を理解すること。
- アプリケーションのレジリエンスに影響を及げる、特にネットワークデッドロックおよび長時間にわたる回復時間を含む、重要な故障シナリオを同定すること。
- 実際のスーパーコンピュータ上で体系的かつ繰り返し可能な故障実験を可能にするソフトウェアベースの故障挿入ツール(HPCArrow)の開発および検証すること。
- 故障検出および回復を改善するためのシステムおよびアプリケーションレベルのインストルメンテーションに関する実用的かつ実行可能な提言を提供すること。
- Cielo(Cray XE)から得られた知見を、メソドロジカルな一般化を通じて将来のCray XC(Aries)システムへと拡張すること。
提案手法
- 実際のペタフラップ規模のHPCシステムにおいて、リンク、ノード、ブレードといったハードウェアコンponentレベルに故障をハードウェア的に挿入できるソフトウェア実装故障挿入(SWIFI)ツール「HPCArrow」を開発した。
- ネットワークリンク、方向性接続、コンピューティングノード、ブレードにおける恒久的故障を対象とした、合計18件の制御された故障挿入実験を実施した。
- 故障から失敗への遷移および回復ダイナミクスを記録するために、ログおよびネットワークパフォーマンスカウンターを用いてシステム動作をモニタリングした。
- エラーログおよび回復タイムラインの分析を通じて、ネットワークデッドロックや長時間にわたる回復期間といった、重要な故障状態を同定した。
- ハードウェアエラーログに観察された異常を、重要なシステム状態を示す指標として活用し、リアルタイムでの通知を可能にした。
- Cray XC(Aries)システムにおける将来の故障挿入を支援するために、ネットワーク動作および回復メカニズムの類似性を同定し、メソドロジーを拡張した。
実験結果
リサーチクエスチョン
- RQ1大規模HPCシステムのGemini相互接続ネットワークおよびコンピューティングノードにおける、故障から失敗への主な伝播経路は何か?
- RQ2特にリンク障害およびノード障害を含むネットワーク関連の障害は、アプリケーション実行およびシステム回復時間にどのように影響を与えるか?
- RQ3ネットワークデッドロックのような、長時間にわたるまたは回復不能なシステム状態を引き起こす、重要な故障状態とは何か?
- RQ4システムおよびアプリケーションレベルのインストルメンテーションをどのように改善すれば、ネットワーク障害をリアルタイムで検出・対応できるか?
- RQ5Cray XE(Cielo)で得られた故障挿入のメソドロジーや知見は、Cray XC(Aries)システムへどの程度応用可能か?
主な発見
- HPCArrowは、Cieloの8,944ノードシステムに含まれる54リンク、2ノード、4ブレードに対して故障を挿入し、実世界の故障挿入において有効性を検証した。
- アプリケーションおよびシステムソフトウェアへのプロアクティブな通知を可能にするほど長時間にわたる回復期間を示すネットワークデッドロックが観測された。
- 実験中に収集されたハードウェアエラーログに含まれる異常は、重要なネットワーク状態をリアルタイムで示す指標として利用可能である。
- 特定の故障組み合わせ(例:連続するリンク障害)の回復時間が数分を超えることがあり、アプリケーションにとっての脆弱な期間が延長された。
- CieloのGeminiネットワークにおける故障から失敗への挙動および回復パターンは、Blue Watersで観測されたものと類似しており、知見の一般化が妥当であることを裏付けた。
- Cray XE(Gemini)とCray XC(Aries)間のネットワークアーキテクチャおよび回復メカニズムの類似性から、故障挿入メソドロジーが新しいシステムへも拡張可能であると示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。