[论文解读] Guided Interpolation for Adversarial Training
本文提出Guided Interpolation Framework(GIF),一种用于对抗训练的数据增强方法,利用前一周期的元信息引导插值,提高可攻击数据的比例,同时减少类间有害的线性行为。GIF在不依赖额外数据的前提下,在多个数据集和模型上增强了对抗鲁棒性,在PGD和CW攻击下于CIFAR-10和SVHN数据集上达到了最先进性能。
To enhance adversarial robustness, adversarial training learns deep neural networks on the adversarial variants generated by their natural data. However, as the training progresses, the training data becomes less and less attackable, undermining the robustness enhancement. A straightforward remedy is to incorporate more training data, but sometimes incurring an unaffordable cost. In this paper, to mitigate this issue, we propose the guided interpolation framework (GIF): in each epoch, the GIF employs the previous epoch's meta information to guide the data's interpolation. Compared with the vanilla mixup, the GIF can provide a higher ratio of attackable data, which is beneficial to the robustness enhancement; it meanwhile mitigates the model's linear behavior between classes, where the linear behavior is favorable to generalization but not to the robustness. As a result, the GIF encourages the model to predict invariantly in the cluster of each class. Experiments demonstrate that the GIF can indeed enhance adversarial robustness on various adversarial training methods and various datasets.
研究动机与目标
- 为解决对抗训练过程中可攻击数据比例下降的问题,该问题会削弱鲁棒性提升效果。
- 缓解原始mixup引起的线性行为,尽管其有助于泛化,但会损害对抗鲁棒性。
- 在不依赖额外标注或未标注数据的前提下提升对抗鲁棒性,尤其适用于隐私敏感领域。
- 开发一种数据增强策略,利用先前训练周期的模型元信息动态引导插值过程。
提出的方法
- GIF利用前一周期的元信息(如模型预测、梯度或特征统计量)引导插值过程,确保插值样本更可能成为可攻击样本。
- 该框架在原始数据与对抗样本之间进行插值,插值权重λ固定为0.5,经实证验证为鲁棒性的最优选择。
- 插值样本的生成方式保留了类簇内的局部不变性,减少了类预测之间的线性过渡。
- 通过在每个小批量中结合原始数据与插值数据,将该方法整合进对抗训练,1:1的平衡比例被证明能取得最佳效果。
- 引入了预热阶段,模型先在干净数据上训练,再逐步引入插值样本,以提升训练稳定性和鲁棒性。
- 该框架兼容多种对抗攻击方法(如PGD、CW),用于生成训练数据,展示了在不同攻击设置下的鲁棒性。
实验结果
研究问题
- RQ1引导插值是否能在不损害局部不变性的情况下提升对抗训练中可攻击数据的比例?
- RQ2与原始mixup相比,减少类预测之间的线性行为是否能提升对抗鲁棒性?
- RQ3所提出的框架是否能在不依赖额外标注或未标注数据的前提下提升鲁棒性?
- RQ4插值权重λ和数据比例的选择如何影响PGD和CW攻击下的鲁棒性?
- RQ5预热阶段对引导插值框架的稳定性和性能有何影响?
主要发现
- AT-GIF结合PGD-10攻击生成,在PGD-20攻击下于CIFAR-10上实现了53.57%的鲁棒准确率,优于标准AT和AT-mixup方法。
- AT-GIF结合CW-10攻击生成,在PGD-20攻击下于CIFAR-10上实现了59.65%的鲁棒准确率,表明基于CW的数据生成同样有效。
- 固定λ=0.5时鲁棒准确率最高,而从均匀分布或β分布中随机采样λ则导致性能下降,原因在于线性行为增加。
- 预热阶段在CW攻击下略微提升了鲁棒性(50.07% vs. 49.13%),但在PGD-20攻击下有轻微负面影响(53.57% vs. 53.60%)。
- 原始数据与插值数据1:1的比例取得了最佳性能,1:2和2:1比例表现较差,表明数据平衡至关重要。
- 在SVHN数据集上,AT-GIF在PGD-20攻击下实现了77.98%的鲁棒准确率,表明其在标准AT方法上具有持续改进效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。