[论文解读] Why adversarial training can hurt robust accuracy
本文表明,在小样本数据设置下,对抗训练可能因对非信号特征的过拟合,而降低模型的鲁棒泛化性能,特别是在遮挡或损坏等定向攻击下。本文通过理论分析和实证验证,证明了在数据稀缺时,对抗训练的鲁棒误差反而高于标准训练,挑战了对抗训练普遍提升鲁棒性的普遍认知。
Machine learning classifiers with high test accuracy often perform poorly under adversarial attacks. It is commonly believed that adversarial training alleviates this issue. In this paper, we demonstrate that, surprisingly, the opposite may be true -- Even though adversarial training helps when enough data is available, it may hurt robust generalization in the small sample size regime. We first prove this phenomenon for a high-dimensional linear classification setting with noiseless observations. Our proof provides explanatory insights that may also transfer to feature learning models. Further, we observe in experiments on standard image datasets that the same behavior occurs for perceptible attacks that effectively reduce class information such as mask attacks and object corruptions.
研究动机与目标
- 探究为何对抗训练在低数据设置下可能降低鲁棒泛化性能。
- 挑战普遍认为对抗训练能普遍提升鲁棒性的观点。
- 分析在降低类别信号的定向攻击(如遮挡或损坏)下,对抗训练为何失效。
- 为小样本设置下鲁棒误差增加提供理论与实证证据。
- 解释对抗训练通过特征过拟合导致鲁棒准确率下降的内在机制。
提出的方法
- 对具有无噪声观测的高维线性分类器进行理论分析,证明在对抗训练下,鲁棒误差随扰动预算单调递增。
- 推导对抗训练与标准训练之间鲁棒误差差距的高概率非渐近下界。
- 在CIFAR-10、Waterbirds和手势识别数据集上进行实证评估,采用如方块遮挡扰动和运动模糊等可见攻击。
- 在训练和推理过程中使用网格搜索寻找最优的黑盒遮挡对抗扰动。
- 可视化逻辑回归权重,显示对抗训练模型对背景噪声的依赖性增强。
- 手动修正裁剪不当的图像,以确保小样本实验中数据表示的准确性。
实验结果
研究问题
- RQ1对抗训练是否在所有数据设置下均能一致提升鲁棒准确率?
- RQ2为何对抗训练在小样本设置下无法实现鲁棒泛化?
- RQ3降低类别信号的定向攻击如何影响对抗训练模型的性能?
- RQ4导致对抗训练反而增加鲁棒误差而非减少的原因是什么?
- RQ5对抗训练模型在多大程度上对数据中的非信号特征产生过拟合?
主要发现
- 在小样本设置下,尽管对抗训练在大规模数据设置中提升了鲁棒性,但其鲁棒误差仍高于标准训练。
- 在具有可分数据的高维线性模型中,对抗训练下的鲁棒误差随扰动预算单调增加。
- 在CIFAR-10和Waterbirds数据集上的实证结果表明,当数据子采样时,对抗训练下的鲁棒误差更高,尤其在遮挡和损坏攻击下。
- 对抗训练的逻辑回归模型权重向量表现出更高的背景噪声,表明其对非信号区域的过拟合。
- 对抗训练的分类器为其分配更高权重的无关图像区域(如背景),从而降低泛化性能。
- 即使通过完整网格搜索寻找最优扰动,对抗训练在小样本数据集上仍无法提升鲁棒性,反而导致性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。