[论文解读] Decision-based Universal Adversarial Attack
本文提出 DUAttack,一种基于决策的通用对抗攻击方法,仅使用模型的 top-1 输出标签生成单一的条纹状扰动,无需模型架构或梯度信息,在不依赖模型访问的情况下,实现了在不同模型和任务间卓越的迁移能力。该方法在白盒和真实世界黑盒设置下(包括 Microsoft Azure 平台)均优于基于迁移和查询的攻击方法,并对多种防御机制具有鲁棒性。
A single perturbation can pose the most natural images to be misclassified by classifiers. In black-box setting, current universal adversarial attack methods utilize substitute models to generate the perturbation, then apply the perturbation to the attacked model. However, this transfer often produces inferior results. In this study, we directly work in the black-box setting to generate the universal adversarial perturbation. Besides, we aim to design an adversary generating a single perturbation having texture like stripes based on orthogonal matrix, as the top convolutional layers are sensitive to stripes. To this end, we propose an efficient Decision-based Universal Attack (DUAttack). With few data, the proposed adversary computes the perturbation based solely on the final inferred labels, but good transferability has been realized not only across models but also span different vision tasks. The effectiveness of DUAttack is validated through comparisons with other state-of-the-art attacks. The efficiency of DUAttack is also demonstrated on real world settings including the Microsoft Azure. In addition, several representative defense methods are struggling with DUAttack, indicating the practicability of the proposed method.
研究动机与目标
- 开发一种仅在黑盒环境下运行、对模型输出访问极少的通用对抗攻击方法。
- 生成一种具有条纹状纹理、与图像无关的单一扰动,以利用早期卷积层对这类模式的敏感性。
- 在不依赖梯度或替代模型信息的前提下,提升通用扰动在不同模型和视觉任务间的迁移能力。
- 评估该攻击对常见防御机制(如对抗训练和输入预处理)的鲁棒性。
- 在真实世界部署平台(如 Microsoft Azure)上验证其有效性,其中模型架构未知。
提出的方法
- 该方法仅使用目标模型的 top-1 预测类别标签生成通用扰动,避免访问梯度或模型架构信息。
- 通过基于决策反馈的迭代优化,采样预定义的正交矩阵作为更新方向,以塑造扰动形态。
- 通过利用早期卷积层对条纹状模式的敏感性,设计出具有条纹状纹理的扰动。
- 算法在更新扰动向量与根据先前成功误分类信号优化其方向之间交替进行。
- 采用步长 0.2 和迭代次数 1000,以平衡收敛速度与扰动强度。
- 该方法可直接应用于真实世界模型(如 Microsoft Azure 在线服务),而无需事先了解模型内部结构。
实验结果
研究问题
- RQ1能否仅使用 top-1 标签反馈构建通用对抗攻击,而无需访问梯度或模型架构?
- RQ2通用扰动中的条纹状纹理是否能增强其在不同模型和任务间的迁移能力?
- RQ3在真实世界黑盒环境中,所提出的基于决策的通用攻击与基于迁移和查询的攻击相比表现如何?
- RQ4所提出的攻击能否绕过常见的防御机制(如对抗训练和输入预处理)?
- RQ5在多样化模型和任务中实现高欺骗率所需的最小扰动大小是多少?
主要发现
- 在 Microsoft Azure 的 MNIST 模型上,DUAttack 在非目标攻击设置下实现了 83.08% 的欺骗率,优于 PGD(67.41%)和 UAP(56.24%),尽管 PGD 是白盒方法。
- 在目标攻击中,DUAttack 在 Azure 上实现了 40.47% 的欺骗率,超过 SimBA(46.56%)和 PGD(23.74%),表明其在黑盒环境下的优越性能。
- 该攻击在不同模型和任务间保持了强大的迁移能力,即使扰动在某一模型上计算并在另一模型上应用,仍能取得高成功率。
- 对抗训练(AT)和总变差最小化(TVM)等防御机制部分有效,但当扰动范数达到 16 时,模型准确率降至约 20%,表明模型严重退化。
- 该方法对空间平滑(SS)和 JPEG 压缩(JC)等输入级防御仍具鲁棒性,表现出对输入级防御的抗性。
- 实验结果证实,扰动中的条纹状纹理显著提升了其泛化能力和攻击成功率,相较于基于随机噪声的扰动具有明显优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。