Skip to main content
QUICK REVIEW

[论文解读] HaS-Nets: A Heal and Select Mechanism to Defend DNNs Against Backdoor Attacks for Data Collection Scenarios

Hassan Ali, ‪Surya Nepal‬|arXiv (Cornell University)|Dec 14, 2020
Adversarial Robustness in Machine Learning参考文献 17被引用 14
一句话总结

本文提出 HaS-Nets,一种新颖的防御机制,通过结合修复与选择性微调,在数据收集场景中保护深度神经网络免受后门攻击。通过迭代地使用少量可信修复数据集(全数据的2–15%)对模型进行修复,并过滤不一致的训练样本,HaS-Nets 在多种数据集和网络架构上将攻击成功率(ASR)从超过90%降低至15%以下,优于现有最先进的防御方法,可抵御多种攻击变体。

ABSTRACT

We have witnessed the continuing arms race between backdoor attacks and the corresponding defense strategies on Deep Neural Networks (DNNs). Most state-of-the-art defenses rely on the statistical sanitization of the "inputs" or "latent DNN representations" to capture trojan behaviour. In this paper, we first challenge the robustness of such recently reported defenses by introducing a novel variant of targeted backdoor attack, called "low-confidence backdoor attack". We also propose a novel defense technique, called "HaS-Nets". "Low-confidence backdoor attack" exploits the confidence labels assigned to poisoned training samples by giving low values to hide their presence from the defender, both during training and inference. We evaluate the attack against four state-of-the-art defense methods, viz., STRIP, Gradient-Shaping, Februus and ULP-defense, and achieve Attack Success Rate (ASR) of 99%, 63.73%, 91.2% and 80%, respectively. We next present "HaS-Nets" to resist backdoor insertion in the network during training, using a reasonably small healing dataset, approximately 2% to 15% of full training data, to heal the network at each iteration. We evaluate it for different datasets - Fashion-MNIST, CIFAR-10, Consumer Complaint and Urban Sound - and network architectures - MLPs, 2D-CNNs, 1D-CNNs. Our experiments show that "HaS-Nets" can decrease ASRs from over 90% to less than 15%, independent of the dataset, attack configuration and network architecture.

研究动机与目标

  • 通过引入一种新型的低置信度后门攻击,挑战现有后门防御的鲁棒性,该攻击可规避统计净化检测。
  • 针对现有防御方法依赖大量干净数据的局限性,提出一种仅需全训练集2–15%数据即可有效运行的方法。
  • 开发一种通用的、与网络架构无关的防御机制,能够抵御多种后门攻击变体,包括不可见后门攻击和标签一致攻击。
  • 在极端条件下评估该防御机制,例如对100%训练数据进行污染(全后门攻击),以验证其可扩展性与鲁棒性。

提出的方法

  • 提出一种使用分布式标签(如 [0.2, 0.4, 0.2, 0.2])而非独热编码标签的低置信度后门攻击,以降低污染梯度并隐藏于统计检测器之下。
  • 引入两种攻击变体:$\epsilon$-Attack 用于规避基于统计特征的防御方法,$\epsilon^2$-Attack 则利用双触发器和并集触发器以规避基于热力图的检测方法(如 Februus)。
  • 提出 HaS-Nets,一种修复与选择机制,通过在小规模修复数据集上迭代微调深度神经网络,同时过滤掉在多次前向传播中预测不一致的训练样本。
  • 采用基于一致性的选择标准:在多次前向传播中预测方差较高的样本将被移除,假设其为污染样本。
  • 在训练过程中迭代应用修复过程,逐步清除污染样本,恢复模型的准确率与鲁棒性。
  • 使用小规模修复数据集(全数据的2–15%)引导修复过程,使该方法在真实世界数据收集场景中具备实用性。

实验结果

研究问题

  • RQ1使用分布式标签的低置信度后门攻击是否能够规避最先进的统计与基于梯度的防御?
  • RQ2$\epsilon^2$-Attack 在利用双触发器与并集触发器方面,对 Februus 等基于热力图的防御机制是否具有有效规避能力?
  • RQ3当仅有少量干净修复数据可用时,HaS-Nets 是否能有效防御后门攻击?
  • RQ4HaS-Nets 对使用不可察觉噪声作为触发器的不可见后门攻击是否具备强鲁棒性?
  • RQ5HaS-Nets 是否能抵抗不改变标签但操纵潜在表征的标签一致后门攻击?

主要发现

  • $\epsilon$-Attack 在 STRIP 上实现了 99% 的攻击成功率(ASR),在 Gradient-Shaping 上为 63.73%,在 ULP-defense 上为 91.2%,在 Februus 上为 80%,表明现有防御机制存在显著脆弱性。
  • $\epsilon^2$-Attack 有效规避了 Februus 检测,通过双触发机制隐藏第二个触发器,实现 ASR 超过 80%。
  • HaS-Nets 在所有评估数据集(Fashion-MNIST、CIFAR-10、Consumer Complaint、Urban Sound)和网络架构(MLP、2D-CNN、1D-CNN)上,将 ASR 从超过90%降低至15%以下。
  • 对于不可见后门攻击,HaS-Nets 将未受保护模型中超过90%的 ASR 降低至12%以下,显示出对不可察觉触发器的强大抵抗能力。
  • 在标签一致攻击中,HaS-Nets 将 ASR 降低至 11%(Fashion-MNIST)和 12%(CIFAR-10)(当 $\epsilon=1.0$ 时),并在 $\epsilon=0.4$ 时完全阻止了后门的插入。
  • 即使在全后门攻击(100%训练数据被污染)的极端条件下,HaS-Nets 仍表现出有效性,维持了高测试准确率与低 ASR。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。