[论文解读] Fighting Gradients with Gradients: Dynamic Defenses against Adversarial Attacks
本文提出 dent,一种动态防御方法,通过在测试时利用防御熵最小化动态调整模型和输入,以应对对抗性攻击。通过利用梯度和批量统计信息,dent 提升了对抗性训练和常规训练模型的鲁棒性,在 CIFAR-10 上 ϵ∞=8/255 的 AutoAttack 攻击下,将最先进防御方法的性能提升了 20 多个百分点。
Adversarial attacks optimize against models to defeat defenses. Existing defenses are static, and stay the same once trained, even while attacks change. We argue that models should fight back, and optimize their defenses against attacks at test time. We propose dynamic defenses, to adapt the model and input during testing, by defensive entropy minimization (dent). Dent alters testing, but not training, for compatibility with existing models and train-time defenses. Dent improves the robustness of adversarially-trained defenses and nominally-trained models against white-box, black-box, and adaptive attacks on CIFAR-10/100 and ImageNet. In particular, dent boosts state-of-the-art defenses by 20+ points absolute against AutoAttack on CIFAR-10 at $ε_\infty$ = 8/255.
研究动机与目标
- 解决静态防御在测试期间保持不变、无法应对不断演化的对抗性攻击的局限性。
- 通过在推理过程中实现实时自适应,克服现有防御对迭代式梯度攻击的脆弱性。
- 开发一种与现有模型和训练流程兼容的测试时自适应方法,无需重新训练。
- 在最小化自然数据性能下降的前提下,提升对多种攻击类型(包括白盒、黑盒和自适应攻击)的鲁棒性。
- 证明测试时的动态自适应提供了战略优势——即‘最后一手’——能够实时应对演化中的攻击。
提出的方法
- 提出防御熵最小化(dent)作为测试时的优化目标,以最大化模型置信度并减少不确定性。
- 受测试时自适应技术的启发,利用梯度和批量统计信息,在推理过程中同时调整模型参数和输入数据。
- 在测试期间迭代更新模型和输入,确保每个对抗性样本都面临不同的防御配置。
- 利用测试时更新的批量归一化统计信息实现动态自适应,消融实验表明其对批量大小敏感。
- 通过仅在推理阶段应用更新而非训练阶段,保持与预训练模型和现有防御的兼容性。
- 利用输入的梯度信息引导防御更新,有效以防御梯度对抗梯度攻击。
实验结果
研究问题
- RQ1测试时自适应能否提升对绕过静态防御的自适应、基于梯度的对抗性攻击的鲁棒性?
- RQ2在对抗性军备竞赛中,推理时对模型和输入的动态自适应是否相较于静态防御具有战略优势?
- RQ3dent 在标准基准(如 CIFAR-10 和 ImageNet)上对白盒、黑盒和自适应攻击的性能如何?
- RQ4批量大小和参数化对动态防御鲁棒性和稳定性的影响是什么?
- RQ5dent 是否可应用于对抗性训练模型和标准模型而无需重新训练?其对自然准确率的影响如何?
主要发现
- 在 CIFAR-10 上,dent 在 ϵ∞=8/255 的 AutoAttack 攻击下,将最先进对抗性训练防御的鲁棒性提升了 20 多个百分点。
- 在 CIFAR-10 上,dent 将现有最佳防御的鲁棒准确率提升至 57.3%(针对 AutoAttack),在 AutoAttack 排行榜上领先超过 15 个百分点。
- 即使在小批量大小下,使用训练时批量统计信息的 dent 仍能保持高达 86.6% 的自然准确率,表明其对推理批量大小具有鲁棒性。
- 当使用测试时批量统计信息时,若批量大小低于 10,dent 性能显著下降,凸显其在自适应过程中对批量统计信息的敏感性。
- 消融实验表明,dent 的性能对自适应迭代次数和模型参数化敏感,最优结果在中等设置下取得。
- dent 在 CIFAR-10 和 ImageNet 上对白盒、黑盒和自适应攻击的性能均优于现有防御方法,展现出广泛的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。