[论文解读] Improving Black-box Adversarial Attacks with a Transfer-based Prior
论文提出 P-RGF,一种先验引导的随机无梯度方法,将基于转移的代理梯度与查询反馈结合起来,以实现更高效的黑盒对抗攻击。它推导了一个最优耦合系数,用以加权代理梯度,并在多种模型与防御下展示了更高的攻击成功率和更少的查询次数。
We consider the black-box adversarial setting, where the adversary has to generate adversarial perturbations without access to the target models to compute gradients. Previous methods tried to approximate the gradient either by using a transfer gradient of a surrogate white-box model, or based on the query feedback. However, these methods often suffer from low attack success rates or poor query efficiency since it is non-trivial to estimate the gradient in a high-dimensional space with limited information. To address these problems, we propose a prior-guided random gradient-free (P-RGF) method to improve black-box adversarial attacks, which takes the advantage of a transfer-based prior and the query information simultaneously. The transfer-based prior given by the gradient of a surrogate model is appropriately integrated into our algorithm by an optimal coefficient derived by a theoretical analysis. Extensive experiments demonstrate that our method requires much fewer queries to attack black-box models with higher success rates compared with the alternative state-of-the-art methods.
研究动机与目标
- 激励并解决黑盒对抗攻击在信息有限时的效率问题(梯度估计)。
- 利用来自代理白盒模型的基于转移的先验,以改进梯度估计。
- 推导出一个最优系数,将转移梯度与随机无梯度估计融合。
- 证明将先验与查询反馈结合可获得更高的攻击成功率和更低的查询量。
- 在 ImageNet 上展示对普通模型和防御模型的鲁棒性。
提出的方法
- 提出先验引导的随机无梯度法(P-RGF),其通过将随机梯度方向偏向来自代理模型的转移梯度进行偏置。
- 将梯度估计损失建模为真实梯度与一个缩放估计量之间可达到的最小平方距离,优化尺度 b。
- 推导出一个最优混合参数 λ*,它对采样分布 C 的权重为 C = λ v v^T + ((1−λ)/(D−1))(I−v v^T) ,使转移梯度 v 生效。
- 给出 λ* 的闭式解,作为转移梯度与真实梯度之间余弯相似度 α 与查询预算 q(以及维度 D)的函数。
- 提供一种实用程序,用于通过有限差分估计 α,并据此对 q 次查询采样偏置方向 u_i。
- 将 P-RGF 扩展为包含一个数据相关先验,通过引入子空间投影 V,并推导相应的 λ*(A^2 作为投影梯度功率)。
- 通过 ImageNet 的 Inception-v3 代理,在 ℓ2 范数攻击下,与 NES、Bandits、AutoZoom 及标准 RGF 进行对比来展示该方法。
实验结果
研究问题
- RQ1能否通过最优加权的基于转移的先验,在黑盒攻击中改进梯度估计?
- RQ2如何计算最优耦合系数 λ*,以在代理引导和随机探索之间取得平衡?
- RQ3结合数据相关先验是否能进一步在保持高攻击成功率的同时减少查询量?
- RQ4P-RGF 的增益在对抗不同目标模型和防御机制时是否具有一致性?
主要发现
- P-RGF 在 Inception-v3、VGG-16 和 ResNet-50 上的 ℓ2 攻击中,达到更高的攻击成功率并且比最新方法需要更少的查询。
- 最优的 λ* 随余弦相似度 α 提高而随查询次数 q 增加而下降,确认何时应更多依赖转移先验。
- 使用自适应的 λ* 效果优于固定 λ 值,亦优于单独的转移梯度或均匀随机梯度估计。
- 引入与转移先验正交的数据相关先验(D)可进一步提升性能,在平均查询量上实现额外下降。
- 在如JPEG压缩、随机化和导向去噪等防御下,P-RGF(有无数据先验)比基线获得更高的 ASR 与更低的查询次数。
- 方法显示出较强的梯度估计效率,结果表明在优化早期对代理梯度的自适应偏置最有利,后期通过改进梯度估计仍有帮助。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。