[论文解读] On the Design of Black-box Adversarial Examples by Leveraging Gradient-free Optimization and Operator Splitting Method
本文提出一种基于ADMM结合零阶(ZO)优化与贝叶斯优化(BO)的通用黑盒对抗攻击框架,可在多种失真度量和威胁模型下实现高效、鲁棒的攻击。该方法在MNIST、CIFAR-10和ImageNet上实现了最先进的查询效率——查询次数最高减少99.2%,同时保持了高攻击成功率。
Robust machine learning is currently one of the most prominent topics which could potentially help shaping a future of advanced AI platforms that not only perform well in average cases but also in worst cases or adverse situations. Despite the long-term vision, however, existing studies on black-box adversarial attacks are still restricted to very specific settings of threat models (e.g., single distortion metric and restrictive assumption on target model's feedback to queries) and/or suffer from prohibitively high query complexity. To push for further advances in this field, we introduce a general framework based on an operator splitting method, the alternating direction method of multipliers (ADMM) to devise efficient, robust black-box attacks that work with various distortion metrics and feedback settings without incurring high query complexity. Due to the black-box nature of the threat model, the proposed ADMM solution framework is integrated with zeroth-order (ZO) optimization and Bayesian optimization (BO), and thus is applicable to the gradient-free regime. This results in two new black-box adversarial attack generation methods, ZO-ADMM and BO-ADMM. Our empirical evaluations on image classification datasets show that our proposed approaches have much lower function query complexities compared to state-of-the-art attack methods, but achieve very competitive attack success rates.
研究动机与目标
- 解决现有黑盒对抗攻击中查询复杂度过高的问题,尤其是在查询受限或现实场景下的应用。
- 克服先前方法仅适用于特定失真度量(如ℓ₂或ℓ∞)或威胁模型(如仅基于得分)的局限性。
- 构建一个统一且灵活的框架,支持多种ℓp-范数失真度量,以及基于得分和基于决策的威胁模型。
- 在不牺牲攻击成功率的前提下提升查询效率,从而实现在真实机器学习系统中的实际部署。
- 在模型梯度不可用的无梯度设置下,实现鲁棒的对抗攻击生成。
提出的方法
- 提出一种基于增广拉格朗日乘子法(ADMM)的通用对抗攻击框架,ADMM是一种用于约束优化的一阶算子分裂方法。
- 将零阶(ZO)优化与ADMM结合,实现无梯度的攻击生成,利用随机梯度估计(RGE)高效利用函数查询。
- 开发ZO-ADMM用于基于得分的攻击,以及BO-ADMM用于基于决策的攻击,利用贝叶斯优化提升查询效率。
- 将框架推广至支持任意ℓp-范数球约束(如ℓ₀、ℓ₁、ℓ₂)及其线性组合,实现灵活的失真控制。
- 调整ADMM公式以同时处理来自黑盒模型的软标签(基于得分)和硬标签(基于决策)反馈。
- 采用增广拉格朗日形式将对抗攻击问题分解为可通过低每轮计算成本的迭代更新求解的子问题。
实验结果
研究问题
- RQ1在无梯度约束下,ADMM优化能否有效适配于黑盒对抗攻击生成?
- RQ2所提出的ZO-ADMM框架在查询效率和攻击成功率方面相较于最先进的ZOO和边界攻击表现如何?
- RQ3该框架在不重新设计优化过程的前提下,对不同ℓp-范数失真度量的泛化能力有多强?
- RQ4在基于决策的黑盒攻击设置中,贝叶斯优化(BO)的集成能否进一步降低查询复杂度?
- RQ5该框架在包括基于得分和基于决策反馈在内的多种威胁模型下,其鲁棒性如何?
主要发现
- 与ZOO攻击相比,ZO-ADMM在ImageNet上将实现初始成功的查询次数减少了94.3%(非目标攻击)和99.2%(目标攻击)。
- 在MNIST和CIFAR-10上,ZO-ADMM在少于1,000次查询内即实现成功攻击,显著优于基线方法。
- 对于ℓ₂失真,ZO-ADMM在MNIST上仅以1.93的平均ℓ₂失真实现了100%的攻击成功率,效率和失真控制均优于ZOO。
- 该框架成功推广至ℓ₀和ℓ₁范数,在平均ℓ₀和ℓ₁失真分别为18.5和10.5时,实现了100%的攻击成功率。
- 在基于决策的设置中,ZO-ADMM以显著更少的查询次数实现高攻击成功率,甚至在某些情况下优于标签仅有的攻击和ZOO攻击。
- 收敛性分析表明,ZO-ADMM在经过数百至数万次查询后可稳定在低失真水平,具体取决于数据集的复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。