[论文解读] Poison as a Cure: Detecting & Neutralizing Variable-Sized Backdoor Attacks in Deep Neural Networks
本文提出了一种新型防御方法,用于抵御深度神经网络中的可变尺寸后门攻击,且无需事先知晓污染目标/基础类别、污染比例或干净验证集。该方法从输入梯度中提取污染信号,利用这些信号以理论保证检测并过滤污染样本,并通过使用增强数据重新训练和重新标记来中和后门,在CIFAR-10上多种攻击场景下实现了高准确率恢复。
Deep learning models have recently shown to be vulnerable to backdoor poisoning, an insidious attack where the victim model predicts clean images correctly but classifies the same images as the target class when a trigger poison pattern is added. This poison pattern can be embedded in the training dataset by the adversary. Existing defenses are effective under certain conditions such as a small size of the poison pattern, knowledge about the ratio of poisoned training samples or when a validated clean dataset is available. Since a defender may not have such prior knowledge or resources, we propose a defense against backdoor poisoning that is effective even when those prerequisites are not met. It is made up of several parts: one to extract a backdoor poison signal, detect poison target and base classes, and filter out poisoned from clean samples with proven guarantees. The final part of our defense involves retraining the poisoned model on a dataset augmented with the extracted poison signal and corrective relabeling of poisoned samples to neutralize the backdoor. Our approach has shown to be effective in defending against backdoor attacks that use both small and large-sized poison patterns on nine different target-base class pairs from the CIFAR10 dataset.
研究动机与目标
- 解决在缺乏关键先验知识(如污染目标/基础类别、污染比例或干净验证集)的情况下,防御后门污染攻击的挑战。
- 开发一种对后门攻击中大小污染模式(无论大小)均有效的防御框架。
- 基于输入梯度与提取的污染信号之间的相似性,利用理论保证实现对污染样本的可靠检测与过滤。
- 通过使用合成污染增强数据重新训练并纠正污染样本的标签,中和后门。
- 在CIFAR-10上对不同目标-基础类别对、不同污染尺寸与比例进行全面评估。
提出的方法
- 利用假设(即污染样本会引发独特的梯度模式),从模型第一层的输入梯度(即损失关于输入的梯度)中提取污染信号。
- 利用提取的污染信号,计算测试样本输入梯度与污染信号之间的相似度得分,从而在理论上保证将污染样本与干净样本分离。
- 通过分析与污染信号高度相似样本的标签分布,检测污染目标类别与基础类别。
- 通过将与污染信号高度相似的所有样本重新标记为基础类别,并将提取的污染信号加入训练数据,以中和后门。
- 在过滤并重新标记后的数据集上重新训练模型,以恢复鲁棒性并恢复干净准确率。
- 将该防御方法应用于CIFAR-10上九组目标-基础类别对中的大尺寸(叠加式)与小尺寸(点状)污染模式。
实验结果
研究问题
- RQ1当缺乏对污染目标类别、基础类别或污染比例的先验知识时,能否实现有效的后门防御?
- RQ2输入梯度是否可被可靠地用于提取污染信号,从而实现对污染样本的检测与过滤,并具备理论保证?
- RQ3所提出的防御方法在检测准确率与模型恢复方面,对大尺寸与小尺寸后门攻击的有效性如何?
- RQ4通过使用污染增强数据重新训练并重新标记,能否成功中和后门并恢复干净准确率?
- RQ5该防御方法在不同目标-基础类别对及不同污染比例下是否保持高性能?
主要发现
- 对于大尺寸叠加式攻击,该防御在检测污染样本时实现了99.7%的特异性与96.0%的敏感性;对于点状攻击,分别达到99.6%与99.0%。
- 在5%污染比例的全尺寸叠加式攻击下,中和后模型平均恢复了94.5%的干净准确率(从95.1%恢复)与80%的污染基础类别准确率(从11.9%恢复)。
- 在5%污染比例的点状攻击下,中和后模型实现了94.9%的干净准确率与90%的污染基础类别准确率,分别从基线的95.3%与0.8%恢复。
- 该方法在CIFAR-10上测试的全部九组目标-基础类别对中成功中和了后门,证明了其在多样化攻击配置下的鲁棒性。
- 即使在10%污染比例下,该防御仍保持高性能:在VGG模型上,全尺寸叠加式攻击下中和后实现了92.6%的干净准确率与94.8%的污染准确率。
- 基于梯度相似性的过滤步骤建立了理论保证,确保污染样本与干净样本的可靠分离。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。