[论文解读] Don't Trigger Me! A Triggerless Backdoor Attack Against Deep Neural Networks
本文提出了首个无需触发器的后门攻击方法,针对深度神经网络,攻击者利用推理过程中的丢弃(dropout)机制激活后门,而无需修改输入数据。通过将特定目标神经元与恶意标签关联,该攻击在MNIST和CIFAR-10数据集上实现了100%的成功率,且模型性能下降不足0.2%,从而绕过了基于触发器的防御机制。
Backdoor attack against deep neural networks is currently being profoundly investigated due to its severe security consequences. Current state-of-the-art backdoor attacks require the adversary to modify the input, usually by adding a trigger to it, for the target model to activate the backdoor. This added trigger not only increases the difficulty of launching the backdoor attack in the physical world, but also can be easily detected by multiple defense mechanisms. In this paper, we present the first triggerless backdoor attack against deep neural networks, where the adversary does not need to modify the input for triggering the backdoor. Our attack is based on the dropout technique. Concretely, we associate a set of target neurons that are dropped out during model training with the target label. In the prediction phase, the model will output the target label when the target neurons are dropped again, i.e., the backdoor attack is launched. This triggerless feature of our attack makes it practical in the physical world. Extensive experiments show that our triggerless backdoor attack achieves a perfect attack success rate with a negligible damage to the model's utility.
研究动机与目标
- 为解决基于触发器的后门攻击存在的可检测性与在真实世界中部署不切实际的问题。
- 开发一种无需修改输入数据的后门机制,以实现在现实场景中更隐蔽的攻击。
- 通过完全消除触发器,绕过依赖于触发器检测的现有防御机制。
- 证明通过神经元丢弃实现的模型级后门可实现高攻击成功率,同时保持极低的性能退化。
提出的方法
- 该攻击将训练过程中选定的一组目标神经元与特定目标标签关联。
- 在推理阶段,当这些目标神经元被随机丢弃时,模型即触发后门,使用较低的丢弃率(例如0.1%)以保持隐蔽性。
- 该攻击具有概率性:成功与否取决于预测过程中神经元的随机丢弃,而非确定性的输入模式。
- 攻击者可通过调节丢弃率控制后门激活的概率,实现对攻击频率的可调控制。
- 该方法在模型训练阶段通过修改前向传播过程实现,使目标标签的预测依赖于目标神经元的激活状态。
- 该攻击不修改输入数据,因此无法通过输入触发分析或视觉检查被检测到。
实验结果
研究问题
- RQ1能否构建一种不依赖输入级触发器的后门攻击,从而规避现有防御机制的检测?
- RQ2一种基于模型内部行为(如神经元丢弃)而非输入模式激活的后门机制,其有效性如何?
- RQ3该攻击对模型性能的影响程度如何?是否能在干净输入上保持高准确率?
- RQ4是否可通过超参数(如丢弃率)调节攻击的激活频率?
- RQ5目标层的选择及目标神经元数量对攻击成功率与一致性的影响如何?
主要发现
- 无触发器后门攻击在MNIST和CIFAR-10数据集上实现了100%的攻击成功率,模型性能仅下降0.2%。
- 随着目标神经元数量增加,标签一致性显著提升——使用50个神经元时可达约70%,而仅使用1个神经元时约为35%。
- 较低的丢弃率(如0.1%)可减少性能损失并提高标签一致性,尽管这会增加触发攻击所需的查询次数。
- 选择倒数第二层作为目标层,相比早期层,能获得更高的标签一致性和攻击成功率。
- 后验相似性在不同配置下保持稳定,即使在高丢弃率下,其下降也小于0.01%。
- 由于不存在输入触发器,该攻击可完全规避基于触发器的防御机制,因此在真实世界部署中具有高度隐蔽性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。