Skip to main content
QUICK REVIEW

[論文レビュー] Holistic Approach for Fault-Tolerant Network-on-Chip based Many-Core Systems

Siavoosh Payandeh Azad, Behrad Niazmand|arXiv (Cornell University)|Jan 26, 2016
Interconnection Networks and Systems参考文献 22被引用数 8
ひとこと要約

本稿では、オンラインチェックヤーとマッパー/スケジューラユニット(MSU)を介して、一時的、間欠的、恒久的故障を検出・分類・応答するシステム健全性監視ユニット(SHMU)を用いて、NoCベースのマルチコアシステムにおける包括的かつ耐故障性の高いアーキテクチャを提案する。本システムは、故障パターンの予測に基づき事前にマッピングおよびスケジューリングの解決策を格納することで再構成遅延を低減し、動的故障状況における回復を著しく高速化する。

ABSTRACT

In this paper we describe a holistic approach for Fault-Tolerant Network-on-Chip (NoC) based many-core systems that incorporates a System Health Monitoring Unit (SHMU) which collects all the fault information from the system, classifies them and provides different solutions for different fault classes. A Mapper/Scheduler Unit (MSU) is used for online generation of different mapping and scheduling solutions based on the current fault configuration of the system. For detection of faults, we have leveraged concurrent online checkers, able to capture faults with low detection latency and providing the fault information for SHMU, which can be later used for the recovery process. The experimentation setup is performed in an open source tool, able to perform the mapping, scheduling and simulation of the system.

研究の動機と目的

  • 初期製造テストでは検出できないが、寿命中の故障(例:エレクトロムイグレーションや摩耗)が増加するマルチコアNoCシステムの脆弱性に対処する。
  • ハードウェアとシステムレベルのメカニズムを統合することで、既存の故障耐性アプローチの限界を克服し、包括的な故障管理を実現する。
  • 故障パターンの予測に基づき、事前に可能なマッピングおよびスケジューリング解決策を計算・格納することで、故障発生後の再構成遅延を低減する。
  • 統合された健全性監視と応答フレームワークを用いて、恒久的・間欠的・一時的故障に対する動的回復を可能にする。
  • 故障分類と予測を回復パイプラインに統合することで、故障管理ループを閉じる。

提案手法

  • 各NoCルータに並列で動作するオンラインチェックヤーを統合し、低遅延で故障を検出し、iJTAGチェーンを介してSHMUに報告する。
  • システム健全性監視ユニット(SHMU)を用いて、故障状態の包括的システム健全性マップ(SHM)を収集・分類・維持する。
  • マッパー/スケジューラユニット(MSU)を用いて、現在の故障設定とシステム制約に基づき、動的にタスクマッピングとスケジューリングを生成する。
  • 最も確率の高いマッピング(MPM)キャッシュを実装し、故障後の再構成時間を短縮する。
  • NoCDepend機構を適用して、ネットワークの到達不能領域に関するルータレベルのコンact知識を維持し、パケットの早期破棄と混雑回避を可能にする。
  • GUI対応の2次元・3次元NoCトポロジー、タスクグラフ、ルーティングアルゴリズム、故障シナリオをモデル化できるオープンソースのシミュレーションツール「Schedule and Depend」を活用する。

実験結果

リサーチクエスチョン

  • RQ1NoCベースのマルチコアシステムにおける一時的・間欠的・恒久的故障を包括的に処理できる、多層的で包括的な故障耐性フレームワークをどのように設計できるか?
  • RQ2故障発生後の再構成遅延に与える、事前に計算・キャッシュされた可能なマッピングおよびスケジューリング解決策の影響は何か?
  • RQ3iJTAG経由の並列故障検出とオンラインチェックヤーの統合により、故障検出遅延をどの程度低減できるか?
  • RQ4パケットの到達不能な宛先を早期に拒否できるNoCDepend機構により、ネットワーク混雑とルーティング危険性をどの程度低減できるか?
  • RQ5本手法は、遅延と適合性の観点から、既存の最先端の故障耐性アプローチと比較して、回復性能でどの程度優れているか?

主な発見

  • 提案されたシステムは、最も確率の高いマッピング(MPM)をキャッシュすることで再構成遅延を低減し、故障予測が一致する場合、$ T_{RL} = T_{fetch} + T_{Schd} + T_{ParExt} + T_{ParMap} $ 時間単位で回復を可能にする。
  • 最良ケースにおいて、事前に計算されたマッピングを再利用することで、再構成時間の有効な短縮が達成され、$ T_{MapAlg} - (T_{fetch} + T_{Schd}) $ の短縮が実現する。ここで $ T_{MapAlg} $ は新しいマッピングを計算する時間である。
  • 並列で動作するオンラインチェックヤーの使用により、低遅延での故障検出とiJTAG経由でのSHMUへの即時報告が可能となり、適切な故障分類が可能になる。
  • NoCDepend機構により、到達不能な宛先を持つパケットがネットワークに入ることを効果的に防ぎ、混雑とルーティング危険性が低減される。
  • オープンソースのシミュレーションツール「Schedule and Depend」は、多様なトポロジー、ルーティングアルゴリズム、タスクグラフ、ミックスドクリティカルティアプリケーションをサポートし、故障耐性フレームワークの包括的評価を可能にする。
  • 現在、故障分類と予測モジュールの統合により故障管理ループを閉じるための拡張が進行中であり、FPGAベースのエミュレーションを用いたハードウェア検証も進行中である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。