[论文解读] Automated Discovery of Adaptive Attacks on Adversarial Defenses
本文提出 A3(Adaptive AutoAttack),一种自动化框架,通过在形式化定义的可重用攻击组件空间中搜索,发现针对特定防御的强效自适应攻击——包括算法、网络变换和损失函数等。该框架在24种评估防御中的10种上比 AutoAttack 发现了多出3.0%至50.8%的对抗样本,显著提升了鲁棒性评估的可靠性,同时减少了人工工作量。
Reliable evaluation of adversarial defenses is a challenging task, currently limited to an expert who manually crafts attacks that exploit the defense's inner workings or approaches based on an ensemble of fixed attacks, none of which may be effective for the specific defense at hand. Our key observation is that adaptive attacks are composed of reusable building blocks that can be formalized in a search space and used to automatically discover attacks for unknown defenses. We evaluated our approach on 24 adversarial defenses and show that it outperforms AutoAttack, the current state-of-the-art tool for reliable evaluation of adversarial defenses: our tool discovered significantly stronger attacks by producing 3.0\%-50.8\% additional adversarial examples for 10 models, while obtaining attacks with slightly stronger or similar strength for the remaining models.
研究动机与目标
- 为解决对抗防御评估不可靠的问题,该问题常因缺乏强效、量身定制的攻击而难以成立。
- 自动化手动且依赖专家的自适应攻击构造过程,以利用防御特异性弱点。
- 将可重用的攻击组件(如算法、损失函数和网络变换)形式化为搜索空间,以实现自动化攻击发现。
- 通过发现针对各防御特性的定制化攻击,提升对抗鲁棒性评估的可靠性与强度。
- 在保留人类专家创新新攻击类型能力的同时,减少攻击开发中的试错负担。
提出的方法
- 该方法定义了一个由三类核心组件构成的搜索空间:攻击算法(如 PGD、APGD、FAB)、网络变换(如 BPDA、层移除)和损失函数(如交叉熵、DLR、C&W)。
- 将攻击发现任务形式化为该搜索空间上的优化问题,其中每个配置代表一个候选自适应攻击。
- 搜索过程由一种高效算法引导,通过贝叶斯优化或早停等技术,平衡攻击效果与计算成本,探索攻击组件的组合。
- 框架支持超参数(如步长、迭代次数)的动态自适应,并集成 EOT(变换期望)和随机化等技术以提升攻击成功率。
- 该工具命名为 Adaptive AutoAttack(A3),可自动搜索定义空间内的最强攻击,以测试防御机制。
- 该方法具备可扩展性:专家可新增攻击组件以扩展搜索空间,而无需重构系统架构。
实验结果
研究问题
- RQ1系统化、自动化的攻击发现方法是否能发现强于现有固定集成方法(如 AutoAttack)的自适应攻击?
- RQ2可重用的攻击组件(如算法、损失函数、网络变换)能否被形式化为搜索空间,以实现有效的攻击发现?
- RQ3在对抗攻击成功率方面,自动化搜索在多大程度上优于人工专家手工设计的自适应攻击?
- RQ4该自动化工具在具有不同防御机制的多样化对抗防御中,性能表现如何?
- RQ5即使某些已知自适应攻击未显式包含在搜索空间中,搜索过程是否仍能重新发现或改进这些攻击?
主要发现
- 在24种评估防御中的10种上,A3 发现的攻击显著强于 AutoAttack,对抗样本数量多出3.0%至50.8%。
- 在其余14种防御中,A3 的攻击强度略优或与 AutoAttack 相当,表明其在多种防御类型中均具鲁棒性。
- 该工具成功重新发现或改进了未显式包含在搜索空间中的手工设计自适应攻击,展示了良好的泛化能力。
- 搜索空间设计有效支持了对攻击配置的探索,包括动态步长、修改后的损失函数以及替代模型变换。
- 该框架减少了攻击开发中的人工试错,使专家能将精力集中于创新而非超参数调优。
- 尽管取得成功,搜索空间仍不完整,且昂贵攻击可能因缺乏运行时建模而产生高昂计算成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。