[论文解读] Arithmetic-Intensity-Guided Fault Tolerance for Neural Network Inference on GPUs
本文提出了一种基于强度的自适应容错框架(intensity-guided ABFT),用于在GPU上进行神经网络推理,该框架根据每层的算术强度动态选择传统ABFT或线程级算法容错(ABFT)。通过利用带宽受限层中未充分利用的计算资源,该方法在多种模型上将执行时间开销降低了1.09–5.3倍,显著优于静态ABFT方法的效率。
Neural networks (NNs) are increasingly employed in safety-critical domains and in environments prone to unreliability (e.g., soft errors), such as on spacecraft. Therefore, it is critical to impart fault tolerance to NN inference. Algorithm-based fault tolerance (ABFT) is emerging as an efficient approach for fault tolerance in NNs. We propose an adaptive approach to ABFT for NN inference that exploits untapped opportunities in emerging deployment scenarios. GPUs have high compute-to-memory-bandwidth ratios, while NN layers have a wide range of arithmetic intensities. This leaves some layers compute bound and others memory-bandwidth bound, but current approaches to ABFT do not consider these differences. We first investigate ABFT schemes best suited for each of these scenarios. We then propose intensity-guided ABFT, an adaptive, arithmetic-intensity-guided approach that selects the most efficient ABFT scheme for each NN layer. Intensity-guided ABFT reduces execution-time overhead by 1.09--5.3$ imes$ across many NNs compared to traditional approaches to ABFT.
研究动机与目标
- 为应对在高空和空间环境中安全关键型神经网络部署中软错误日益增长的挑战。
- 解决现有ABFT方法效率低下的问题,这些方法假设所有线性层均为计算受限,忽略了现代GPU优化推理中的资源瓶颈。
- 通过引入线程级ABFT方案,利用带宽受限层中未充分利用的计算周期——这在低算术强度的神经网络层中很常见。
- 设计一种基于算术强度的自适应、逐层ABFT策略,以最小化执行时间开销,同时确保故障检测能力。
提出的方法
- 分析现代推理优化GPU的计算-内存带宽比(CMR),并识别出由于算术强度较低,许多神经网络层处于内存带宽受限状态。
- 提出一种线程级ABFT方案,在GPU线程级别执行校验和计算,消除线程间通信,并避免与带宽受限层竞争额外内存访问。
- 引入intensity-guided ABFT,一种自适应框架,根据算术强度将每个线性层分类为计算受限或带宽受限,并据此选择最高效的ABFT方案。
- 采用混合ABFT策略:对计算受限层使用传统ABFT,对带宽受限层使用线程级ABFT,两者均集成于同一推理流水线中。
- 使用浮点运算数与内存流量字节数的比值作为算术强度的度量标准,以指导方案选择。
- 在多种神经网络(如ResNet、EfficientNet、MobileNet)和不同GPU架构上评估该框架,测量执行时间开销和故障检测覆盖率。
实验结果
研究问题
- RQ1能否在GPU上的带宽受限神经网络层中利用未充分利用的计算资源,实现高效冗余执行以实现容错?
- RQ2ABFT方案选择(传统方案 vs. 线程级方案)对不同算术强度层的执行时间开销有何影响?
- RQ3基于算术强度的自适应ABFT方案选择是否能在性能和故障覆盖方面优于静态的、一刀切的ABFT方法?
- RQ4在线性带宽受限场景下,线程级ABFT相比传统ABFT在不引入额外内存流量的前提下,能将开销降低多少?
主要发现
- 与传统ABFT方法相比,intensity-guided ABFT在多种神经网络上将执行时间开销降低了1.09–5.3倍。
- 所提出的线程级ABFT方案实现了零额外内存流量的故障检测,使其特别适合带宽受限层。
- 该框架成功利用算术强度作为指导,识别并分类各层为计算受限或带宽受限,从而实现在每层上最优的ABFT方案选择。
- 带宽受限层(在现代高效神经网络架构中很常见)为冗余计算提供了尚未开发的机会,且性能损失极小。
- 自适应选择策略在混合工作负载(具有不同层特征)中优于静态ABFT和复制方法。
- 该方法具有可扩展性,不仅适用于神经网络,还可保护通用矩阵乘法,适用于更广泛的HPC工作负载,目标为GPU加速器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。