[论文解读] Controlling Over-generalization and its Effect on Adversarial Examples Generation and Detection
本文提出一种增强型卷积神经网络(CNN),引入额外的“垃圾箱”类别以控制过度泛化,从而提升对分布外样本和对抗性样本的鲁棒性。通过在具有代表性的自然分布外数据和插值的分布内样本上进行训练,该模型在保持分布内准确率的同时,显著提高了对恶意输入的拒绝率,有效将对抗性样本和分布外样本与合法类别分离。
Convolutional Neural Networks (CNNs) significantly improve the state-of-the-art for many applications, especially in computer vision. However, CNNs still suffer from a tendency to confidently classify out-distribution samples from unknown classes into pre-defined known classes. Further, they are also vulnerable to adversarial examples. We are relating these two issues through the tendency of CNNs to over-generalize for areas of the input space not covered well by the training set. We show that a CNN augmented with an extra output class can act as a simple yet effective end-to-end model for controlling over-generalization. As an appropriate training set for the extra class, we introduce two resources that are computationally efficient to obtain: a representative natural out-distribution set and interpolated in-distribution samples. To help select a representative natural out-distribution set among available ones, we propose a simple measurement to assess an out-distribution set's fitness. We also demonstrate that training such an augmented CNN with representative out-distribution natural datasets and some interpolated samples allows it to better handle a wide range of unseen out-distribution samples and black-box adversarial examples without training it on any adversaries. Finally, we show that generation of white-box adversarial attacks using our proposed augmented CNN can become harder, as the attack algorithms have to get around the rejection regions when generating actual adversaries.
研究动机与目标
- 解决CNN对对抗性样本和分布外样本高置信度误分类的共同根源:过度泛化。
- 开发一种统一的、端到端的解决方案,同时提升对对抗性样本和分布外输入的检测能力。
- 识别计算高效、具有代表性的自然分布外数据集,作为垃圾箱类别的有效训练数据。
- 证明在不使用对抗性样本的情况下,通过自然分布外数据和插值样本进行训练,可有效减少过度泛化。
- 展示增强型CNN通过引入拒绝区域,提高了白盒对抗性攻击生成的难度。
提出的方法
- 在标准CNN基础上增加一个额外的“垃圾箱”类别,以显式建模分布外和对抗性样本。
- 使用具有代表性的自然分布外数据集和插值的分布内样本,对增强型CNN进行训练,以构建垃圾箱类别。
- 引入一种适应度度量方法,用于评估并选择最适合训练垃圾箱类别的自然分布外数据集。
- 利用训练后的模型通过将样本分类为垃圾箱类别而非错误分类为分布内类别,实现对分布外样本和对抗性样本的检测。
- 利用模型学习到的特征空间,使白盒对抗性攻击生成更加困难,因为攻击者现在必须避开垃圾箱拒绝区域。
- 在多个分布内和分布外基准上,与基于阈值的方法(OpenMax、Calibrated CNN)及标准CNN进行性能对比。
实验结果
研究问题
- RQ1通过为分布外和对抗性样本引入专用的垃圾箱类别,能否有效控制CNN中的过度泛化?
- RQ2如何高效地选择具有代表性的自然分布外数据集,以用于训练垃圾箱类别?
- RQ3在自然分布外数据和插值样本上训练增强型CNN,能否提升对分布外样本和对抗性样本的检测能力?
- RQ4与基线模型相比,增强型CNN在多大程度上减少了对抗性样本和分布外输入的误分类?
- RQ5增强型CNN是否通过创建有效的拒绝区域,使白盒对抗性攻击生成更加困难?
主要发现
- 在代表性自然分布外数据集和插值样本上训练的增强型CNN,在NotMNIST(已见)上实现了99.98%的拒绝率,在Omniglot(未见)上实现了100%的拒绝率,优于OpenMax和Calibrated CNN。
- 在CIFAR-10上,增强型模型在未见分布外数据集上实现了0.00%错误率和100%拒绝率,显著优于基于阈值的基线模型。
- 在CIFAR-100上,增强型模型在TinyImageNet(已见)上实现了1.52%错误率和98.35%拒绝率,而Calibrated CNN因类别数量过高而无法收敛。
- 该模型在保持高分布内准确率(如CIFAR-10上为97.05%)的同时,显著降低了对分布外样本的误分类率。
- 对增强型CNN的白盒对抗性攻击需要更大的扰动幅度,且效果更差,因为攻击者必须避开垃圾箱拒绝区域。
- 用于分布外数据集的适应度度量方法能够有效选择训练数据,直接提升了模型的鲁棒性和泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。