Skip to main content
QUICK REVIEW

[論文レビュー] 'Mutual Watch-dog Networking': Distributed Awareness of Faults and Critical Events in Petascale/Exascale systems

Roberto Ammendola, A. Biagioni|arXiv (Cornell University)|Jul 1, 2013
Distributed systems and fault tolerance参考文献 6被引用数 3
ひとこと要約

本論文は、ペタスケールおよびエクサスケールシステム向けに、冗長で低速な診断ネットワークを介してリアルタイムでの故障検出と故障情報の伝播を可能にする分散型の故障認識フレームワーク「Mutual Watch-dog Networking」(LO|FA|MO)を提案する。ハードウェア監視、ウォッチドッグメカニズム、階層的故障シグナル伝達を組み合わせることで、早期の故障検出と耐障害性の高い応答を実現し、大規模かつ高複雑度のアーキテクチャにおけるシステム停止時間を短縮する。

ABSTRACT

Many tile systems require techniques to be applied to increase components resilience and control the FIT (Failures In Time) rate. When scaling to peta- exa-scale systems the FIT rate may become unacceptable due to component numerosity, requiring more systemic countermeasures. Thus, the ability to be fault aware, i.e. to detect and collect information about fault and critical events, is a necessary feature that large scale distributed architectures must provide in order to apply systemic fault tolerance techniques. In this context, the LO|FA|MO approach is a way to obtain systemic fault awareness, by implementing a mutual watchdog mechanism and guaranteeing fault detection in a no-single-point-of-failure fashion. This document contains specification and implementation details about this approach, in the shape of a technical report.

研究の動機と目的

  • ペタスケールおよびエクサスケールシステムにおける部品数の増加と高複雑度に起因する故障率の上昇に対処すること。
  • 深刻な障害を引き起こす前に故障を早期に検出・伝播させることで、システムの停止時間を短縮すること。
  • 動的電圧スケーリングやプロセス移行といったプロアクティブな緩和戦略と補完する故障認識インfra構築すること。
  • 主要データネットワークとは独立した冗長で低速な診断ネットワークを導入することで、部品故障率の高いシステムにおける故障耐性を確保すること。
  • 主なネットワークが故障した場合でも、故障に耐性を持つ補助ネットワークを用いて診断情報の伝達を可能にし、故障検出とシグナル伝達を実現すること。

提案手法

  • LO|FA|MOフレームワークは、DNP(Distributing Network Processor)とホストプロセッシング要素との間で相互ウォッチドッグメカニズムを用い、定期的なステータスチェックにより故障を検出する。
  • 主な3次元トロイダルネットワークが故障した場合でも故障情報を伝播できるように、専用で低速かつ高信頼性の診断ネットワーク(サービスネットワーク)を用いる。
  • ハードウェアモニタは、温度、電圧、電流、BERカウンタ、内部例外レジスタを監視し、リアルタイムで故障の兆候を検出する。
  • 故障状態はレジスタを通じてシグナル伝達される:DNPローカル/グローバルステータス、ホストウォッチドッグレジスタ、DNPウォッチドッグレジスタのフィールドが、障害を検出された隣接ノードを示す。
  • ホストフォールトマネージャは、定期的にDNPのステータスをチェックし、サービスネットワークを介して上位の監視ユニットに故障イベントを伝達する。
  • ホストまたはバスの故障が発生した場合、DNPはウォッチドッグタイムアウトを検出し、DNPウォッチドッグレジスタを通じて隣接ノードに通知することで、グローバルな故障認識を実現する。

実験結果

リサーチクエスチョン

  • RQ1ペタスケールおよびエクサスケールシステムに数十万の部品が存在する中で、故障認識をどのように効果的に分散化できるか?
  • RQ2主通信ネットワークが損傷した場合でも、信頼性の高い故障検出とシグナル伝達を実現するメカニズムは何か?
  • RQ3DNPとホストプロセッサ間の相互ウォッチドッグが、故障検出遅延の低減とシステムの耐障害性をどのように向上させるか?
  • RQ4低速で専用の診断ネットワークが、主ネットワークの故障時における故障認識の維持に果たす役割は何か?
  • RQ5故障情報はどのように階層的に伝達され、統合的なシステムレベルの応答を可能にするか?

主な発見

  • LO|FA|MOフレームワークは、例外レジスタの監視とステータスフラグの設定により、ルーティング論理エラーおよびRDMAエンジンの故障といったDNPコアの故障を検出可能である。
  • DNPが定期的なステータスレジスタの更新に失敗した場合、ホストによるウォッチドッグタイムアウト検出が発動され、コアのメルトダウン故障が検出される。
  • 温度および電圧のしきい値違反は、専用レジスタの監視とDNPローカル/グローバルステータスレジスタを介したシグナル伝達により検出される。
  • ホスト側の周辺機器の故障は、ホストローカルフォールトマネージャが検出し、ホストウォッチドッグレジスタを介して通信され、隣接するDNPが診断パケットを生成する。
  • 完全なホストのダウンまたはバス障害は、DNPがウォッチドッグタイムアウトを検出することで検知され、DNPウォッチドッグレジスタを介して故障が伝播し、グローバルな認識が達成される。
  • 主な3次元トロイダルネットワークが故障した場合でも、耐障害性が高く独立したサービスネットワークを活用することで、診断情報の配信が継続され、故障認識が維持される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。