[论文解读] Adversarially Optimized Mixup for Robust Classification
本文提出对抗性优化混合(Adversarially Optimized Mixup),通过反向传播联合优化混合插值与对抗性扰动,提升对抗鲁棒性。通过使用投影梯度下降在混合空间中寻找最坏情况样本,该方法在CIFAR-10上将鲁棒准确率提升最高达2.1%,在CIFAR-100上提升达4%,对抗强攻击如PGD-100和AutoAttack。
Mixup is a procedure for data augmentation that trains networks to make smoothly interpolated predictions between datapoints. Adversarial training is a strong form of data augmentation that optimizes for worst-case predictions in a compact space around each data-point, resulting in neural networks that make much more robust predictions. In this paper, we bring these ideas together by adversarially probing the space between datapoints, using projected gradient descent (PGD). The fundamental approach in this work is to leverage backpropagation through the mixup interpolation during training to optimize for places where the network makes unsmooth and incongruous predictions. Additionally, we also explore several modifications and nuances, like optimization of the mixup ratio and geometrical label assignment, and discuss their impact on enhancing network robustness. Through these ideas, we have been able to train networks that robustly generalize better; experiments on CIFAR-10 and CIFAR-100 demonstrate consistent improvements in accuracy against strong adversaries, including the recent strong ensemble attack AutoAttack. Our source code would be released for reproducibility.
研究动机与目标
- 解决对抗训练中的过拟合问题,即鲁棒模型在强对抗攻击下仍表现出低准确率。
- 通过借鉴标准训练中数据增强的洞见,提升对抗训练网络的泛化能力。
- 克服先前混合插值-对抗训练方法的局限性,这些方法未能充分探测数据点之间插值空间中的最坏情况区域。
- 开发一种方法,实现从混合插值到对抗优化的端到端反向传播,以学习更平滑、更具鲁棒性的决策边界。
- 在不依赖梯度混淆的前提下,展示对强、最先进的对抗攻击(包括无梯度黑盒攻击)的鲁棒性提升。
提出的方法
- 通过在数据点之间的插值空间中直接执行对抗优化(使用PGD),将混合插值增强与对抗训练相结合。
- 通过混合插值过程进行反向传播,联合优化输入扰动与混合比例 $\lambda$。
- 使用基于Sigmoid的裁剪函数将混合比例 $\lambda$ 限制在0.5至1.0之间,确保有意义的插值,同时支持端到端优化。
- 应用投影梯度下降(PGD)在插值空间中寻找最坏情况的对抗性扰动,以最大化预测结果与平滑标签之间的KL散度。
- 探索几何标签分配与自适应混合比例优化,以提升鲁棒性,并通过消融实验验证各组件的贡献。
- 使用约束型极小极大公式进行模型训练,以优化由混合插值定义的邻域中的最坏情况损失。
实验结果
研究问题
- RQ1在混合插值空间中进行对抗优化,是否能比标准对抗训练或仅使用混合插值带来更优的鲁棒泛化?
- RQ2通过混合插值与对抗扰动的端到端反向传播,是否能通过识别决策边界中更严重的失效点来提升鲁棒性?
- RQ3混合比例与标签分配策略的选择如何影响在强对抗攻击下的鲁棒准确率?
- RQ4所提出的方法是否能在CIFAR-100等具有挑战性的数据集上提升鲁棒性,其中数据稀缺性加剧了有效增强的必要性?
- RQ5该方法是否对无梯度黑盒攻击保持鲁棒性,表明其不依赖梯度混淆?
主要发现
- 在100步PGD攻击下,该方法在CIFAR-10上相比最强基线,鲁棒准确率绝对提升2.1%。
- 在CIFAR-100上,该方法在PGD-100下鲁棒准确率提升约4%,表明在更具挑战性、低数据量的场景中受益更大。
- 在AutoAttack(一种强集成对抗器)下,该模型在CIFAR-100上达到58.34%的鲁棒准确率,优于所有基线,包括“先混合后攻击”方法。
- 消融实验表明,混合比例与对抗扰动的联合优化至关重要,完整方法在PGD-100下比消融变体高出0.6%。
- 该方法对无梯度黑盒攻击保持鲁棒性,表明其不遭受梯度混淆,且能泛化到未见过的攻击类型。
- 该方法在不同架构上具有泛化能力,并且与更大的鲁棒性导向模型(如RobNets)结合时,展现出进一步提升的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。