[论文解读] How benign is benign overfitting?
本文研究了尽管通过良性过拟合实现了高自然准确率,深度神经网络为何仍对对抗攻击保持脆弱。研究识别出SGD训练中的标签噪声和隐式归纳偏置是主要原因,表明鲁棒性需要与更优表示学习相关的复杂决策边界,而不仅仅是对抗训练本身。
We investigate two causes for adversarial vulnerability in deep neural networks: bad data and (poorly) trained models. When trained with SGD, deep neural networks essentially achieve zero training error, even in the presence of label noise, while also exhibiting good generalization on natural test data, something referred to as benign overfitting [2, 10]. However, these models are vulnerable to adversarial attacks. We identify label noise as one of the causes for adversarial vulnerability, and provide theoretical and empirical evidence in support of this. Surprisingly, we find several instances of label noise in datasets such as MNIST and CIFAR, and that robustly trained models incur training error on some of these, i.e. they don't fit the noise. However, removing noisy labels alone does not suffice to achieve adversarial robustness. Standard training procedures bias neural networks towards learning "simple" classification boundaries, which may be less robust than more complex ones. We observe that adversarial training does produce more complex decision boundaries. We conjecture that in part the need for complex decision boundaries arises from sub-optimal representation learning. By means of simple toy examples, we show theoretically how the choice of representation can drastically affect adversarial robustness.
研究动机与目标
- 理解在表现出良性过拟合的深度神经网络中,对抗脆弱性的根本原因。
- 调查像MNIST和CIFAR-10这样的标准数据集中的标签噪声是否导致对抗脆弱性。
- 分析SGD对简单决策边界的归纳偏置如何影响鲁棒性。
- 评估改进的表示学习(如通过细粒度标签)是否能提升对抗鲁棒性。
- 挑战鲁棒性与准确率之间存在固有权衡的假设,特别是在存在鲁棒分类器的情况下。
提出的方法
- 对一种显式引入标签噪声的合成数据分布进行理论分析,以研究其对对抗鲁棒性的影响。
- 对真实数据集(MNIST、CIFAR-10)进行经验检查,以检测和量化标签噪声,使用模型错误的手动验证。
- 比较标准训练与对抗训练(如AT、TRADES),以评估其在噪声或异常样本上的泛化能力。
- 使用Chernoff不等式和集中不等式,推导在噪声环境下标签分布和多数投票准确率的概率保证。
- 构建小样本示例,以展示不同特征表示如何导致复杂度不同的决策边界,从而影响对抗鲁棒性。
- 在细粒度标注(如CIFAR-100)下评估鲁棒准确率,以评估更丰富监督对鲁棒性的影响。
实验结果
研究问题
- RQ1像MNIST和CIFAR-10这样的标准数据集中,标签噪声在多大程度上导致了实现高自然准确率的模型的对抗脆弱性?
- RQ2为何鲁棒训练模型无法记忆噪声标签,这种现象如何影响其在罕见但正确标注的异常样本上的泛化能力?
- RQ3SGD对简单决策边界的归纳偏置如何损害对抗鲁棒性?
- RQ4通过细粒度标签等改进的表示学习,是否能生成更鲁棒的决策边界而不牺牲自然准确率?
- RQ5鲁棒性与准确率之间的权衡是否不可避免?当数据分布本身具有鲁棒可分性时,是否存在鲁棒分类器?
主要发现
- 标签噪声在标准数据集(如MNIST和CIFAR-10)中普遍存在,实证证据表明对抗训练方法(如AT和TRADES)不会记忆这些噪声标签。
- 鲁棒训练模型在噪声样本和罕见但正确标注的异常样本(如稀有犬种)上均出现训练误差,表明其避免了对两类样本的记忆。
- 理论分析表明,即使训练误差为零且自然准确率很高,当存在标签噪声时,模型的对抗风险仍可能高于0.1。
- 对抗训练产生的决策边界比标准SGD训练更复杂,表明其归纳偏置向鲁棒性发生了转变。
- 细粒度标注(如CIFAR-100)可提升鲁棒准确率,证明更好的表示学习能增强对抗鲁棒性。
- 在存在鲁棒分类器的场景中(如人类可鲁棒分离),鲁棒性与准确率之间的权衡并非不可避免——当学习到合适的表示时,鲁棒性可与高自然准确率共存。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。