Skip to main content
QUICK REVIEW

[论文解读] Random Noise Defense Against Query-Based Black-Box Attacks

Zeyu Qin, Yanbo Fan|arXiv (Cornell University)|Apr 23, 2021
Adversarial Robustness in Machine Learning参考文献 50被引用 7
一句话总结

本文提出随机噪声防御(RND),一种轻量级、即插即用的防御方法,在推理时添加高斯噪声以干扰基于查询的黑盒攻击。理论分析表明,防御效果取决于RND与攻击者引入的噪声之间的噪声幅度比,其中RND-GF——即结合高斯数据增强微调的RND——在保持干净准确率的同时,相比仅使用对抗训练,将鲁棒准确率提升了高达23.1%。

ABSTRACT

The query-based black-box attacks have raised serious threats to machine learning models in many real applications. In this work, we study a lightweight defense method, dubbed Random Noise Defense (RND), which adds proper Gaussian noise to each query. We conduct the theoretical analysis about the effectiveness of RND against query-based black-box attacks and the corresponding adaptive attacks. Our theoretical results reveal that the defense performance of RND is determined by the magnitude ratio between the noise induced by RND and the noise added by the attackers for gradient estimation or local search. The large magnitude ratio leads to the stronger defense performance of RND, and it's also critical for mitigating adaptive attacks. Based on our analysis, we further propose to combine RND with a plausible Gaussian augmentation Fine-tuning (RND-GF). It enables RND to add larger noise to each query while maintaining the clean accuracy to obtain a better trade-off between clean accuracy and defense performance. Additionally, RND can be flexibly combined with the existing defense methods to further boost the adversarial robustness, such as adversarial training (AT). Extensive experiments on CIFAR-10 and ImageNet verify our theoretical findings and the effectiveness of RND and RND-GF.

研究动机与目标

  • 开发一种轻量级、高效的防御方法,以应对基于查询的黑盒攻击,且不降低干净准确率。
  • 理论上分析随机噪声防御(RND)对标准和自适应基于查询攻击的有效性。
  • 通过允许更大噪声注入而不造成性能下降,解决鲁棒性与干净准确率之间的权衡。
  • 设计一种即插即用的防御方法,可与现有方法(如对抗训练)结合,进一步提升鲁棒性。
  • 通过实证验证理论发现,并在CIFAR-10和ImageNet上展示RND与RND-GF的优越性。

提出的方法

  • RND在推理时注入高斯噪声,以干扰基于查询攻击中的梯度估计和随机搜索。
  • 防御效果在理论上与RND噪声和攻击者噪声在梯度估计或搜索中的幅度比相关。
  • RND-GF将RND与轻量级高斯数据增强微调相结合,允许更大噪声注入,同时保持干净准确率。
  • 理论分析证实,即使在自适应攻击(如EOT)中,当噪声幅度比足够大时,RND仍能有效限制其规避。
  • RND被设计为即插即用,可无缝集成到现有防御方法(如对抗训练,AT)中。
  • 实验在CIFAR-10和ImageNet上评估了RND与RND-GF,采用多种最先进的基于查询攻击,包括Square、Bandit和SimBA。

实验结果

研究问题

  • RQ1RND引入的噪声与攻击者引入的噪声之间的幅度比如何影响防御性能?
  • RQ2RND能否有效缓解自适应攻击(如扰动期望法EOT)?
  • RQ3RND能否与现有防御方法(如对抗训练)结合,以进一步提升鲁棒性?
  • RQ4与标准RND相比,RND-GF是否能在干净准确率与对抗鲁棒性之间实现更优权衡?
  • RQ5RND在应对多样化基于查询的攻击策略(包括基于得分和基于搜索的方法)时表现如何?

主要发现

  • 在CIFAR-10和ImageNet上,当与AT结合时,RND相比仅使用对抗训练,鲁棒准确率最高提升23.1%。
  • RND-GF在保持高干净准确率(如CIFAR-10上达71.15%)的同时,显著提升了防御性能,尤其在ZO和基于搜索的攻击中表现突出。
  • 在Square攻击下,RND-AT在CIFAR-10上相比AT单独使用,鲁棒准确率提升23.1%,在ImageNet上提升22.7%。
  • RND降低了Bandit、SimBA和ECO攻击的成功率,并增加了所需查询次数,表明对自适应策略具有强抵抗能力。
  • 理论预测中指出,较大的噪声幅度比可增强防御效果,该预测通过实证得到验证,且RND-GF实现了更大噪声注入而无准确率下降。
  • RND在多种攻击类型中均表现有效,即使与其他防御方法结合,仍保持鲁棒性,证实了其即插即用特性与通用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。