[论文解读] Adversarial Unlearning: Reducing Confidence Along Adversarial Directions
该论文提出RCAD(沿对抗方向降低置信度),一种新颖的正则化方法,通过在大步长对抗扰动生成的分布外样本上降低预测置信度,从而提升模型泛化能力。通过在这些自生成的、高度扰动的样本上最大化熵,RCAD使模型能够消除虚假特征,并在基准测试中将测试准确率提升1–3%,尤其在低数据场景下效果显著,且计算开销极小,与现有方法(如标签平滑或MixUp)结合时可获得互补性增益。
Supervised learning methods trained with maximum likelihood objectives often overfit on training data. Most regularizers that prevent overfitting look to increase confidence on additional examples (e.g., data augmentation, adversarial training), or reduce it on training data (e.g., label smoothing). In this work we propose a complementary regularization strategy that reduces confidence on self-generated examples. The method, which we call RCAD (Reducing Confidence along Adversarial Directions), aims to reduce confidence on out-of-distribution examples lying along directions adversarially chosen to increase training loss. In contrast to adversarial training, RCAD does not try to robustify the model to output the original label, but rather regularizes it to have reduced confidence on points generated using much larger perturbations than in conventional adversarial training. RCAD can be easily integrated into training pipelines with a few lines of code. Despite its simplicity, we find on many classification benchmarks that RCAD can be added to existing techniques (e.g., label smoothing, MixUp training) to increase test accuracy by 1-3% in absolute value, with more significant gains in the low data regime. We also provide a theoretical analysis that helps to explain these benefits in simplified settings, showing that RCAD can provably help the model unlearn spurious features in the training data.
研究动机与目标
- 通过引入一种新的归纳偏置(即降低对类似对抗扰动的分布外样本的置信度),解决监督学习中的过拟合问题。
- 克服现有正则化方法的局限性,这些方法要么在增强数据上增加置信度,要么在分布内样本上降低置信度。
- 开发一种简单、高效且可组合的正则化器,提升泛化能力,而无需使用无标签数据或复杂架构。
- 从理论上和实证上证明,降低对对抗扰动样本的置信度有助于在训练数据中消除虚假特征。
提出的方法
- 通过损失梯度对训练输入施加大步长对抗扰动(10倍于标准FGSM),生成分布外样本。
- 在这些对抗扰动样本上最大化预测熵,以促使模型保持不确定,从而有效正则化模型,避免对非鲁棒特征产生过度自信。
- 通过约5行代码将RCAD集成到标准训练流程中,将标准交叉熵损失与在扰动输入上的熵最大化相结合。
- 采用两阶段训练目标:在原始数据上最小化标准交叉熵,同时在大扰动对抗样本上最大化熵。
- 将该方法应用于分类和回归任务,均在测试准确率和对数似然上取得一致提升。
- 该方法计算高效,标准训练时间最多增加30%。
实验结果
研究问题
- RQ1在自生成的、高度扰动的对抗样本上降低模型置信度,是否能提升在分布内测试数据上的泛化能力?
- RQ2在高维噪声存在的情况下,RCAD是否能有效消除模型对训练数据中虚假特征的过拟合?
- RQ3在测试准确率和数据稀缺性鲁棒性方面,RCAD与对抗训练和标签平滑相比表现如何?
- RQ4RCAD能否与MixUp或标签平滑等其他正则化技术有效结合,从而进一步提升性能?
- RQ5在简化设置下,RCAD能够改善泛化的理论依据是什么?
主要发现
- 在多个分类基准上,RCAD在绝对值上将测试准确率提升了1–3%,在低数据场景下增益更大。
- 在一个简化的非线性分类任务中,RCAD实现94.9%的测试准确率,而标准ERM仅为80.4%,表明其在消除虚假特征方面具有强大能力。
- RCAD优于对抗训练(FGSM)和ME-ADA,后两者在分布内性能下降,而RCAD保持或提升了准确率。
- 该方法对输入维度和噪声水平的增加具有鲁棒性,与基线相比性能下降极小。
- 将RCAD与标签平滑或MixUp结合可进一步提升性能,表明其具有互补优势。
- 理论分析表明,在简化设置下,RCAD可严格证明有助于消除虚假特征,与实证结果一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。