Skip to main content
QUICK REVIEW

[论文解读] Defense against Backdoor Attacks via Identifying and Purifying Bad Neurons

Mingyuan Fan, Yang Liu|arXiv (Cornell University)|Aug 13, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

该论文提出WIPER,一种新颖的后门防御方法,通过一种新度量标准——良性显著性(BS),识别并净化坏神经元。BS利用一阶梯度更好地捕捉神经元间的连接关系。此外,该方法引入自适应正则化(AR)进行微调,相比标准方法,能实现更快、更稳定的净化过程,在仅1%干净数据比例下,实现超过90%的ASR降低,且准确率下降不足3.5%。

ABSTRACT

The opacity of neural networks leads their vulnerability to backdoor attacks, where hidden attention of infected neurons is triggered to override normal predictions to the attacker-chosen ones. In this paper, we propose a novel backdoor defense method to mark and purify the infected neurons in the backdoored neural networks. Specifically, we first define a new metric, called benign salience. By combining the first-order gradient to retain the connections between neurons, benign salience can identify the infected neurons with higher accuracy than the commonly used metric in backdoor defense. Then, a new Adaptive Regularization (AR) mechanism is proposed to assist in purifying these identified infected neurons via fine-tuning. Due to the ability to adapt to different magnitudes of parameters, AR can provide faster and more stable convergence than the common regularization mechanism in neuron purifying. Extensive experimental results demonstrate that our method can erase the backdoor in neural networks with negligible performance degradation.

研究动机与目标

  • 为解决现有后门防御方法依赖激活幅度(AM)评估神经元重要性所存在的局限性,此类方法常因忽略神经元间连接关系,错误地将正常神经元识别为坏神经元。
  • 克服现有防御方法中因无差别剪枝神经元(尤其是参与正常预测路径的神经元)导致的性能下降问题。
  • 开发一种更准确、更稳定的坏神经元识别与净化方法,在有效消除后门触发信号的同时,最大限度保留模型准确率。
  • 提出一种新型正则化机制,根据参数大小自适应调整,提升微调过程中的收敛速度与有效性。

提出的方法

  • 提出良性显著性(BS),一种新度量标准,结合一阶梯度与神经元激活,用于评估神经元重要性,相比标准激活幅度(AM)能更优地检测受后门感染的神经元。
  • 利用BS识别‘坏神经元’——即对触发信号高度关注但对正常特征相关性较低的神经元,同时保留基于梯度的神经元连接信息。
  • 提出自适应正则化(AR),一种分段正则化策略,根据参数大小动态调整惩罚强度,以加速并稳定微调过程中的净化。
  • 在识别坏神经元后,采用AR进行微调以实现净化,而非直接剪枝,从而在有效抑制后门行为的同时减少性能损失。
  • 将基于BS的识别与基于AR的微调整合为统一的防御框架WIPER,实现后门消除与模型准确率之间的良好平衡。

实验结果

研究问题

  • RQ1良性显著性(BS)是否能通过保留神经元间连接关系,在识别受后门感染的神经元方面优于激活幅度(AM)?
  • RQ2与标准正则化相比,自适应正则化(AR)是否能提升微调过程中神经元净化的收敛速度与稳定性?
  • RQ3与基于剪枝的防御方法相比,采用AR的微调净化是否能在保持更高模型准确率的同时实现更优的后门消除效果?
  • RQ4在低数据场景下(如仅1%干净数据比例),WIPER的防御性能如何变化?

主要发现

  • 即使在仅1%训练数据为干净数据的极端低数据条件下,WIPER仍能实现超过90%的ASR降低,且准确率下降不足3.5%,显著优于现有最先进方法。
  • 使用良性显著性(BS)进行神经元识别,相比激活幅度(AM),能更准确地检测坏神经元,降低对正常神经元的过度剪枝风险。
  • 自适应正则化(AR)在微调过程中实现更快、更稳定的收敛,相比标准正则化,能更有效地抑制后门行为。
  • 将精细剪枝替换为基于AR的净化方法,可使模型准确率最高提升2.8个百分点(例如,从81.85%提升至84.67%),同时将ASR从16.50%降低至4.68%(在TrojanNN攻击下)。
  • 该方法在不同网络架构中均保持强劲性能,即使在净化深层网络层时,也仅造成极小的准确率下降,而传统方法在深层网络中常出现性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。