Skip to main content
QUICK REVIEW

[论文解读] Towards a Safety Case for Hardware Fault Tolerance in Convolutional Neural Networks Using Activation Range Supervision

Florian Geißler, Syed Qutub|arXiv (Cornell University)|Aug 16, 2021
Adversarial Robustness in Machine Learning参考文献 24被引用 5
一句话总结

本文通过Clipper和Backflip范围限制层提出激活范围监督,以增强CNN在硬件故障容忍方面的性能,检测并缓解由位翻转引起的软错误,召回率超过99%。实验表明,这些技术将关键的隐性数据损坏(SDC)率降低了38倍以上,并保持了较低的误分类严重性,显著提升了在MIOVision数据集上使用ResNet-50的自动驾驶感知系统的安全性。

ABSTRACT

Convolutional neural networks (CNNs) have become an established part of numerous safety-critical computer vision applications, including human robot interactions and automated driving. Real-world implementations will need to guarantee their robustness against hardware soft errors corrupting the underlying platform memory. Based on the previously observed efficacy of activation clipping techniques, we build a prototypical safety case for classifier CNNs by demonstrating that range supervision represents a highly reliable fault detector and mitigator with respect to relevant bit flips, adopting an eight-exponent floating point data representation. We further explore novel, non-uniform range restriction methods that effectively suppress the probability of silent data corruptions and uncorrectable errors. As a safety-relevant end-to-end use case, we showcase the benefit of our approach in a vehicle classification scenario, using ResNet-50 and the traffic camera data set MIOVision. The quantitative evidence provided in this work can be leveraged to inspire further and possibly more complex CNN safety arguments.

研究动机与目标

  • 为自动驾驶等安全关键应用中的CNN构建安全论证,应对硬件软错误带来的风险。
  • 评估激活范围监督是否能有效检测并缓解由网络权重和神经元状态中位翻转引起的隐性数据损坏(SDC)。
  • 利用基于聚类的混淆模型量化SDC事件的严重性,区分安全关键与非关键的误分类。
  • 比较不同范围限制技术(如Clipper、Backflip等)在真实故障注入环境下降低SDC和不可纠正错误率的效能。
  • 证明范围监督可保持特征图的拓扑结构,从而最小化误分类至危险或高严重性类别风险。

提出的方法

  • 作者在每个卷积层后实现范围限制层(Ranger),以监控并约束激活值在基于预注入推理运行得出的预定义范围内。
  • 使用8指数浮点表示法,对网络权重和神经元状态注入单个或多个位翻转(位0–8),以模拟软错误。
  • 该方法利用从干净推理运行中提取的区间阈值检测超出边界的激活,通过裁剪或反向流机制(如Clipper、Backflip)触发纠正。
  • 应用概率安全模型,其中风险计算为加权的SDC概率之和,严重性由混淆簇定义(例如,“行人”误判为“背景”属于关键情况)。
  • 该方法利用现有、无需重新训练的轻量级监控机制——避免功能冗余或重新训练——适用于实时部署。
  • 评估基于ResNet-50在MIOVision数据集上进行,故障注入涵盖1个和10个故障,测量SDC、DUE(NaN/Inf)和关键混淆率。

实验结果

研究问题

  • RQ1激活范围监督能否有效检测CNN中由硬件软错误引起的隐性数据损坏(SDC)?
  • RQ2不同范围限制技术(如Clipper、Backflip等)在降低SDC和不可纠正错误(DUE)率方面的表现如何比较?
  • RQ3范围监督在多大程度上降低了安全关键误分类(如将行人误判为背景)的概率?
  • RQ4范围监督是否保持了特征图的拓扑结构,从而最小化严重误分类的风险?
  • RQ5在真实故障注入条件下,与未受保护的模型相比,受范围保护的CNN中SDC和DUE的残余风险是多少?

主要发现

  • Clipper和Backflip范围限制技术对SDC诱导故障的检测召回率超过99%,显著优于其他方法。
  • 采用Clipper或Backflip后,残余SDC率降低了38倍以上,权重和神经元故障的SDC率均降至≤0.01。
  • 在保护状态下,关键SDC占总SDC的比例不超过0.41(权重故障)和0.78(神经元故障),表明平均严重性未增加,通常还出现降低。
  • 对于神经元故障,最常见的安全关键混淆(从“行人”到“背景”)在使用Clipper或Backflip时被抑制超过91%,显著降低了其对总SDC事件的贡献。
  • 在保护状态下,10个权重故障的平均DUE率降至<0.03,10个神经元故障的DUE率降至<0.05,而未受保护模型中分别为0.11和0.17。
  • 整体风险(即加权的SDC概率及其严重性之和)在采用Clipper或Backflip时可忽略不计,证实了安全性显著提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。