Skip to main content
QUICK REVIEW

[论文解读] Training with More Confidence: Mitigating Injected and Natural Backdoors During Training

Zhenting Wang, Hailun Ding|arXiv (Cornell University)|Feb 13, 2022
Adversarial Robustness in Machine Learning被引用 12
一句话总结

本文提出 NONE,一种新型训练方法,通过检测并消除由分段线性激活函数引起的超平面决策区域,有效缓解了深度神经网络中的注入式和自然后门攻击。通过在训练过程中识别并抑制形成此类超平面的神经元,NONE 在标准投毒攻击下将攻击成功率(ASR)降低 54.83 倍,在自然后门攻击下降低 1.75 倍,优于五组数据集和多种攻击类型下的现有防御方法。

ABSTRACT

The backdoor or Trojan attack is a severe threat to deep neural networks (DNNs). Researchers find that DNNs trained on benign data and settings can also learn backdoor behaviors, which is known as the natural backdoor. Existing works on anti-backdoor learning are based on weak observations that the backdoor and benign behaviors can differentiate during training. An adaptive attack with slow poisoning can bypass such defenses. Moreover, these methods cannot defend natural backdoors. We found the fundamental differences between backdoor-related neurons and benign neurons: backdoor-related neurons form a hyperplane as the classification surface across input domains of all affected labels. By further analyzing the training process and model architectures, we found that piece-wise linear functions cause this hyperplane surface. In this paper, we design a novel training method that forces the training to avoid generating such hyperplanes and thus remove the injected backdoors. Our extensive experiments on five datasets against five state-of-the-art attacks and also benign training show that our method can outperform existing state-of-the-art defenses. On average, the ASR (attack success rate) of the models trained with NONE is 54.83 times lower than undefended models under standard poisoning backdoor attack and 1.75 times lower under the natural backdoor attack. Our code is available at https://github.com/RU-System-Software-and-Security/NONE.

研究动机与目标

  • 为应对深度神经网络中同时存在的注入式与自然后门攻击这一关键威胁,而现有防御方法无法同时缓解此类威胁。
  • 识别 DNN 中由后门引发的超平面决策区域的根本原因,特别是与分段线性激活函数(如 ReLU)的关联。
  • 设计一种训练时防御机制,主动防止此类超平面的形成,且无需依赖推理后分析或模型微调。
  • 确保对自适应攻击和实际部署场景(包括联邦学习与迁移学习)的鲁棒性。

提出的方法

  • 该方法通过检测在所有受影响类别中均形成输入空间中超平面的神经元,识别与后门相关的神经元,该区域对应于木马触发器区域。
  • 利用分段线性激活函数(如 ReLU)的特性:当权重和偏置将神经元输入限制于单一子函数时,可诱导出线性决策边界。
  • 在训练过程中,NONE 监控激活值,并抑制那些在多种输入下其预激活值始终落入单一线性区域的神经元。
  • 该防御采用基于置信度的剪枝机制,移除对超平面决策区域有贡献的神经元,从而消除木马的分类表面。
  • 其可无缝集成至标准训练流程,无需访问干净数据或模型微调,实现实时缓解。
  • 通过基于激活的中毒样本识别与超平面检测对方法进行评估,在识别恶意神经元方面实现了超过 98% 的精确率与召回率。

实验结果

研究问题

  • RQ1为何 DNN 即使在无显式数据投毒的情况下,仍会发展出与后门触发器对应的超平面决策区域?
  • RQ2分段线性激活函数如何导致输入空间中此类超平面区域的形成?
  • RQ3能否设计一种训练时防御机制,在模型学习后门行为之前检测并消除这些超平面区域?
  • RQ4此类防御是否能有效缓解注入式与自然发生的后门攻击,而无需依赖数据过滤或训练后分析?
  • RQ5该防御在包括联邦学习与迁移学习在内的多种训练设置下是否具备良好的泛化能力?

主要发现

  • 在五组数据集上,NONE 在标准数据投毒攻击下相比未受保护模型将攻击成功率(ASR)降低 54.83 倍。
  • 在自然后门场景下,NONE 相比未受保护模型将 ASR 降低 1.75 倍,证明其对无意木马的有效性。
  • 在多个模型(NiN、VGG16、ResNet18)和攻击类型(包括 BadNets 和标签一致性攻击)下,识别中毒样本的精确率与召回率均超过 98%。
  • 在包含 10 名参与者的联邦学习设置中(4 名恶意参与者),NONE 将 ASR 降低 31.16 倍,同时在 MNIST 上保持 98.60% 的测试准确率,在 CIFAR-10 上保持 78.67% 的测试准确率。
  • 在迁移学习设置中,NONE 仅使准确率比未受保护模型降低 2.00%,同时将 ASR 降低至 4.00%。
  • 即使面对缓慢投毒的自适应攻击,该防御依然有效,因其针对的是结构成因(超平面形成),而非依赖训练过程中的行为差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。