Skip to main content
QUICK REVIEW

[论文解读] Aegis: Mitigating Targeted Bit-flip Attacks against Deep Neural Networks

Jialai Wang, Ziyuan Zhang|arXiv (Cornell University)|Feb 27, 2023
Adversarial Robustness in Machine Learning被引用 7
一句话总结

Aegis 是一种针对量化深度神经网络中定向位翻转攻击(BFAs)的新防御机制,通过结合动态退出机制与内部分类器(ICs),在每次推理时随机选择早期退出层,从而扰乱攻击者的攻击规划。该方法在多个数据集和模型上将定向攻击成功率降低了5–10倍,显著优于现有防御方案。

ABSTRACT

Bit-flip attacks (BFAs) have attracted substantial attention recently, in which an adversary could tamper with a small number of model parameter bits to break the integrity of DNNs. To mitigate such threats, a batch of defense methods are proposed, focusing on the untargeted scenarios. Unfortunately, they either require extra trustworthy applications or make models more vulnerable to targeted BFAs. Countermeasures against targeted BFAs, stealthier and more purposeful by nature, are far from well established. In this work, we propose Aegis, a novel defense method to mitigate targeted BFAs. The core observation is that existing targeted attacks focus on flipping critical bits in certain important layers. Thus, we design a dynamic-exit mechanism to attach extra internal classifiers (ICs) to hidden layers. This mechanism enables input samples to early-exit from different layers, which effectively upsets the adversary's attack plans. Moreover, the dynamic-exit mechanism randomly selects ICs for predictions during each inference to significantly increase the attack cost for the adaptive attacks where all defense mechanisms are transparent to the adversary. We further propose a robustness training strategy to adapt ICs to the attack scenarios by simulating BFAs during the IC training phase, to increase model robustness. Extensive evaluations over four well-known datasets and two popular DNN structures reveal that Aegis could effectively mitigate different state-of-the-art targeted attacks, reducing attack success rate by 5-10$ imes$, significantly outperforming existing defense methods.

研究动机与目标

  • 应对日益增长的定向位翻转攻击(BFAs)威胁,此类攻击通过操纵特定模型参数来误导预测结果,同时保持整体模型准确性。
  • 克服现有防御方案的局限性,这些方案要么需要可信的监控基础设施,要么在面对定向攻击时失效。
  • 开发一种轻量级、非侵入式防御机制,提高定向 BFAs 的成本与复杂度,同时不损害模型性能。
  • 确保对非自适应攻击者和已知晓防御机制的自适应攻击者均具备鲁棒性。
  • 在真实攻击约束条件下,于多样化数据集与 DNN 架构上验证其有效性。

提出的方法

  • 引入一种动态退出机制,在 DNN 的多个隐藏层上附加内部分类器(ICs),实现早期预测,并在每次推理中随机选择退出层。
  • 对每个输入样本随机选择 IC,以隐藏攻击者对实际使用层的预测能力,从而破坏定向位翻转策略。
  • 设计一种鲁棒性训练(ROB)策略,在 IC 训练过程中模拟位翻转攻击,以提升对参数篡改的抗性。
  • 采用 DESDN(动态退出结构化 DNN)架构,集成 ICs 而不改变主模型的推理路径,且显著降低延迟增加。
  • 利用量化模型约束(如 8 位权重)限制可能的位翻转范围,增加成功攻击所需翻转的位数。
  • 在非自适应与自适应攻击场景下评估该防御,包括允许翻转最多 500 个位的强大对手。

实验结果

研究问题

  • RQ1一种通过随机化 DNN 中早期退出层的防御机制,能否有效扰乱定向位翻转攻击?
  • RQ2对内部分类器进行鲁棒训练,在多大程度上可提升其对位翻转篡改的抵抗能力?
  • RQ3Aegis 在面对已知晓防御机制并能定制其位翻转策略的自适应攻击者时表现如何?
  • RQ4Aegis 是否能在显著增加成功实施定向 BFA 所需位数的同时,仍保持高模型准确性?
  • RQ5Aegis 是否能有效应用于现实世界中商业部署的 DNN,且性能开销极小?

主要发现

  • Aegis 在四个基准数据集(CIFAR-10、CIFAR-100、SVHN、ImageNet)和两种 DNN 架构(ResNet-18、VGG-16)上,将定向位翻转攻击的成功率(ASR)降低了 5–10 倍。
  • 在非自适应攻击下,翻转 24 个位(如 DeepHammer 所示),Aegis 将 ASR 从 77.8% 降低至 2.0%,展现出强大鲁棒性。
  • 即使面对允许翻转 500 个位的极强对手(虽不现实但具启发性),Aegis 依然有效,表明攻击成本被显著放大。
  • 该防御显著增加了成功操纵所需翻转的位数,使实际攻击在可行性上变得不可行。
  • Aegis 优于现有完整性验证与模型增强类防御,尤其在攻击者具备自适应能力且知晓防御机制时表现更优。
  • 大量消融实验确认,动态退出机制与鲁棒训练(ROB)均为防御有效性的关键组成部分。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。