[论文解读] Sparse-RS: a versatile framework for query-efficient sparse black-box adversarial attacks
Sparse-RS 是一种基于随机搜索的查询高效、黑盒对抗攻击框架,实现了稀疏攻击(l₀有界扰动、对抗性补丁和对抗性帧)的最先进性能,且无需使用替代模型。它在 MNIST、CIFAR-10 和 ImageNet 上均优于黑盒和白盒攻击方法,在 20×20 补丁和 2 像素宽帧等具有挑战性的场景下仍能实现高成功率。
We propose a versatile framework based on random search, Sparse-RS, for score-based sparse targeted and untargeted attacks in the black-box setting. Sparse-RS does not rely on substitute models and achieves state-of-the-art success rate and query efficiency for multiple sparse attack models: $l_0$-bounded perturbations, adversarial patches, and adversarial frames. The $l_0$-version of untargeted Sparse-RS outperforms all black-box and even all white-box attacks for different models on MNIST, CIFAR-10, and ImageNet. Moreover, our untargeted Sparse-RS achieves very high success rates even for the challenging settings of $20 imes20$ adversarial patches and $2$-pixel wide adversarial frames for $224 imes224$ images. Finally, we show that Sparse-RS can be applied to generate targeted universal adversarial patches where it significantly outperforms the existing approaches. The code of our framework is available at https://github.com/fra31/sparse-rs.
研究动机与目标
- 解决针对 l₀-扰动、对抗性补丁和帧等稀疏威胁模型缺乏高效、查询有效黑盒攻击的问题。
- 开发一种仅依赖分类器得分(无需梯度或模型权重)的框架,实现实际的黑盒攻击。
- 在高维和组合约束设置下,提升现有黑盒方法的成功率和查询效率。
- 实现高性能的目标导向通用对抗性补丁生成,优于先前方法。
- 提供一个统一、灵活的框架,适用于多种稀疏攻击类型,且不依赖替代模型。
提出的方法
- 通过随机搜索实现零阶优化,以在组合约束下探索稀疏扰动空间。
- 设计专用采样分布,优先选择高影响力、稀疏的扰动(例如高效选择像素位置或补丁位置)。
- 引入两阶段更新策略:以 1:4 的比例交替更新位置和补丁内容(补丁更新更频繁),以提升收敛性。
- 在优化过程中采用单通道更新,在初始位置收敛后细化补丁内容,从而提高成功率。
- 采用混合初始化策略,结合方形补丁和随机采样,以改善早期探索并避免局部极小值。
- 应用基于得分的优化,仅访问分类器置信度得分,实现无需梯度计算的完整黑盒操作。
实验结果
研究问题
- RQ1随机搜索能否被有效适配,以在黑盒稀疏对抗攻击中实现高查询效率和高成功率?
- RQ2与现有黑盒和白盒攻击相比,所提出的 Sparse-RS 框架在 l₀-扰动上的成功率和查询成本表现如何?
- RQ3Sparse-RS 能否以极少查询生成高质量的对抗性补丁和帧,尤其在具有挑战性的物理世界设置中?
- RQ4该框架在生成目标导向通用对抗性补丁方面是否优于现有方法?
- RQ5位置与补丁内容之间不同更新比例对攻击性能和稳定性有何影响?
主要发现
- Sparse-RS 的 l₀-通用版本在 MNIST、CIFAR-10 和 ImageNet 上均达到最先进成功率,优于所有先前的黑盒甚至白盒攻击方法。
- 在 ImageNet 上的 20×20 对抗性补丁上,Sparse-RS 在 ResNet 上仅用 2,160 ± 44 次中位数查询即实现了 87.8% ± 0.7% 的成功率。
- 在 2 像素宽的对抗性帧上,Sparse-RS 仅用 2,808 ± 89 次中位数查询即实现了 79.5% ± 1.4% 的成功率,显著优于先前方法。
- Patch-RS 是 Sparse-RS 的变体,采用优化的初始化和更新策略,在 20×20 补丁上以 2,160 次中位数查询实现 87.8% 的成功率,优于 TPA 和基于 PGD 的基线方法。
- 1:4 的位置与补丁更新比例表现最佳,且 Patch-RS 在不同更新比例下均保持高鲁棒性,证明了算法的稳定性。
- Sparse-RS 能够实现目标导向的通用补丁攻击,成功率显著高于现有方法,验证了其在复杂攻击场景中的多功能性和有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。