Skip to main content
QUICK REVIEW

[论文解读] Holistic Approach for Fault-Tolerant Network-on-Chip based Many-Core Systems

Siavoosh Payandeh Azad, Behrad Niazmand|arXiv (Cornell University)|Jan 26, 2016
Interconnection Networks and Systems参考文献 22被引用 8
一句话总结

本文提出了一种面向基于NoC的多核系统的整体容错架构,采用系统健康监控单元(SHMU)通过在线校验器和映射/调度单元(MSU)检测、分类并响应瞬态、间歇性和永久性故障。该系统通过基于预测故障模式预先存储映射与调度解决方案,显著降低了重新配置延迟,在动态故障场景下大幅加速恢复过程。

ABSTRACT

In this paper we describe a holistic approach for Fault-Tolerant Network-on-Chip (NoC) based many-core systems that incorporates a System Health Monitoring Unit (SHMU) which collects all the fault information from the system, classifies them and provides different solutions for different fault classes. A Mapper/Scheduler Unit (MSU) is used for online generation of different mapping and scheduling solutions based on the current fault configuration of the system. For detection of faults, we have leveraged concurrent online checkers, able to capture faults with low detection latency and providing the fault information for SHMU, which can be later used for the recovery process. The experimentation setup is performed in an open source tool, able to perform the mapping, scheduling and simulation of the system.

研究动机与目标

  • 解决尽管经过初始制造测试,基于NoC的多核系统仍因电迁移和老化等寿命故障而日益脆弱的问题。
  • 通过集成硬件与系统级机制,克服现有容错方法的局限性,实现全面的故障管理。
  • 通过基于预测故障模式预先计算并存储可行的映射与调度解决方案,降低故障后的重新配置延迟。
  • 通过统一的健康监控与响应框架,实现对永久性、间歇性和瞬态故障的动态恢复。
  • 通过将故障分类与预测集成到系统的恢复流程中,实现故障管理闭环。

提出的方法

  • 在每个NoC路由器中集成并发在线校验器,以低延迟检测故障,并通过iJTAG链路将结果报告给SHMU。
  • 采用系统健康监控单元(SHMU)收集、分类并维护整个系统中故障状态的全局系统健康图(SHM)。
  • 利用映射/调度单元(MSU)根据当前故障配置和系统约束动态生成新的任务映射与调度方案。
  • 实现最可能映射(MPM)缓存,以存储预先计算的映射与调度解决方案,从而减少故障后的重新配置时间。
  • 应用NoCDepend机制,使路由器能够以紧凑方式掌握不可达网络区域的知识,从而实现早期报文丢弃与拥塞避免。
  • 使用开源仿真工具“Schedule and Depend”建模二维/三维NoC拓扑、任务图、路由算法与故障场景,并支持图形用户界面。

实验结果

研究问题

  • RQ1如何设计一种整体的、多层的容错框架,以处理基于NoC的多核系统中的瞬态、间歇性和永久性故障?
  • RQ2预先计算并缓存可行的映射与调度解决方案对故障发生后系统重新配置延迟的影响如何?
  • RQ3通过iJTAG实现的在线故障检测与并发校验器的集成,在最小化故障检测延迟方面效果如何?
  • RQ4NoCDepend机制在多大程度上可通过实现早期报文拒绝来减少网络拥塞与路由风险?
  • RQ5与现有最先进的容错方法相比,该系统在恢复性能方面(延迟与适应性)表现如何?

主要发现

  • 所提出的系统通过缓存最可能映射(MPM),在故障预测匹配时,将重新配置延迟降低至$ T_{RL} = T_{fetch} + T_{Schd} + T_{ParExt} + T_{ParMap} $个时间单位内。
  • 在最佳情况下,通过复用预先计算的映射,系统实现更快恢复,有效重新配置时间减少$ T_{MapAlg} - (T_{fetch} + T_{Schd}) $,其中$ T_{MapAlg} $为计算新映射所需时间。
  • 采用并发在线校验器可实现低延迟故障检测,并通过iJTAG实时向SHMU报告,支持及时的故障分类。
  • NoCDepend机制有效防止目的地不可达的数据包进入网络,从而减少拥塞与路由风险。
  • 开源仿真工具“Schedule and Depend”支持多种拓扑、路由算法、任务图与混合关键性应用,可全面评估该容错框架。
  • 目前系统正通过集成故障分类与预测模块以实现故障管理闭环,FPGA原型验证正在开展中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。