[论文解读] Joint Adversarial Training: Incorporating both Spatial and Pixel Attacks
本文提出一种联合对抗训练框架,通过同时引入像素级扰动和空间变换(如旋转、平移)来提升深度神经网络的鲁棒性。通过引入一种可微分的、受预算约束的空间攻击方法,并在训练过程中联合优化两类攻击,该方法在CIFAR10、CIFAR100和SVHN数据集上均实现了对像素攻击和空间攻击的最先进鲁棒性表现。
Conventional adversarial training methods using attacks that manipulate the pixel value directly and individually, leading to models that are less robust in face of spatial transformation-based attacks. In this paper, we propose a joint adversarial training method that incorporates both spatial transformation-based and pixel-value based attacks for improving model robustness. We introduce a spatial transformation-based attack with an explicit notion of budget and develop an algorithm for spatial attack generation. We further integrate both pixel and spatial attacks into one generation model and show how to leverage the complementary strengths of each other in training for improving the overall model robustness. Extensive experimental results on different benchmark datasets compared with state-of-the-art methods verified the effectiveness of the proposed method.
研究动机与目标
- 解决现有对抗训练中模型对像素攻击鲁棒但对空间变换攻击脆弱的问题。
- 开发一种可微分的一阶空间攻击方法,具有显式预算约束,适用于实际训练。
- 设计一种联合对抗训练框架,以利用像素攻击与空间攻击的互补优势。
- 通过实证验证,联合训练是否能提升对两类攻击(包括黑盒攻击与迁移攻击)的鲁棒性。
提出的方法
- 提出一种基于神经网络参数化流场的可微分空间变换攻击方法,对变换参数施加显式的ℓ∞-范数预算约束。
- 提出一种基于投影梯度下降的一阶优化算法用于空间攻击生成,实现可扩展且高效的训练。
- 在对抗训练过程中,将像素攻击与空间攻击整合到统一的生成模型中,采用联合极小极大目标函数。
- 使用可微分渲染器计算空间变换及其梯度,实现攻击过程的端到端反向传播。
- 在训练期间,对像素攻击与空间攻击均采用多步投影梯度下降(PGD)方法,且每类攻击的预算固定。
- 在训练过程中应用联合攻击生成,以生成同时包含像素域与空间域扰动的对抗样本。
实验结果
研究问题
- RQ1可微分的、受预算约束的空间攻击能否有效用于对抗训练?
- RQ2与单独训练相比,联合使用像素攻击与空间攻击的训练是否能进一步提升模型鲁棒性?
- RQ3在黑盒攻击与迁移攻击设置下,联合对抗训练框架的表现如何?
- RQ4像素攻击与空间攻击在提升模型鲁棒性方面,其互补性在多大程度上体现?
主要发现
- 在CIFAR10上,所提出的联合训练方法在联合攻击下(εₓ=8,εω=0.3)达到90.5%的准确率,优于先前方法。
- 在CIFAR100上,该模型在联合攻击下保持26.6%的准确率,显著高于Madry基线模型的4.8%。
- 在SVHN上,联合模型在联合攻击下达到38.8%的准确率,超过Madry模型的19.7%和Bilateral模型的35.0%。
- 使用联合攻击训练的模型在黑盒攻击下表现出强泛化能力,在攻击者使用不同模型生成对抗样本时,SVHN上的准确率仍达38.8%。
- 联合训练框架不仅提升了对空间攻击的鲁棒性,也增强了对标准像素攻击的鲁棒性,体现出显著的互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。