Skip to main content
QUICK REVIEW

[论文解读] Detecting Adversarial Examples and Other Misclassifications in Neural Networks by Introspection

Jonathan Aigrain, Marcin Detyniecki|arXiv (Cornell University)|May 22, 2019
Adversarial Robustness in Machine Learning被引用 14
一句话总结

本文提出 Introspection-Net,一种三层神经网络,利用预训练分类器的 logits 检测对抗样本、分布外输入以及常规误分类。通过在对抗数据增强下对 logits 激活进行训练,其检测性能显著优于基线方法(如 Softmax Thresholding 和 Trust Score),尤其在分布外和对抗样本检测方面表现更优。

ABSTRACT

Despite having excellent performances for a wide variety of tasks, modern neural networks are unable to provide a reliable confidence value allowing to detect misclassifications. This limitation is at the heart of what is known as an adversarial example, where the network provides a wrong prediction associated with a strong confidence to a slightly modified image. Moreover, this overconfidence issue has also been observed for regular errors and out-of-distribution data. We tackle this problem by what we call introspection, i.e. using the information provided by the logits of an already pretrained neural network. We show that by training a simple 3-layers neural network on top of the logit activations, we are able to detect misclassifications at a competitive level.

研究动机与目标

  • 解决神经网络在错误预测上过度自信的问题,包括对抗样本、分布外输入和标准错误。
  • 探究预训练分类器的原始 logits(在 softmax 之前)是否包含用于置信度估计的判别性信息。
  • 开发一种模型无关的检测方法,利用网络内部表示(内省)来提升可靠性,而无需微调基础分类器。
  • 证明即使 softmax 输出表现出误导性的高置信度,logits 仍保留对检测有用的有用信息。

提出的方法

  • 在预训练分类器的 logits 上训练一个三层全连接神经网络(Introspection-Net),以预测置信度分数(正确为 1,错误为 0)。
  • 使用 FGSM、BIM 和 DeepFool 攻击进行对抗训练,使模型在训练过程中暴露于误分类样本。
  • 应用数据增强(旋转、平移、缩放)以提升置信度预测器的泛化能力和鲁棒性。
  • 使用平衡数据集(包含分布内、对抗样本、分布外和错误样本)结合均方误差损失训练 Introspection-Net。
  • 使用标准指标评估模型:AUROC、AUPR(内和外)以及在 95% TPR 下的 FPR。
  • 在 MNIST 上使用预训练 CNN,在 CIFAR-10 上使用 Wide ResNet,分别测试方法在不同架构和数据集上的泛化能力。

实验结果

研究问题

  • RQ1预训练神经网络的原始 logits 是否能为检测误分类提供可靠的置信度信号?
  • RQ2与依赖 softmax 概率相比,使用内省(分析内部激活)是否能提升对抗样本的检测能力?
  • RQ3在 logits 上训练的简单轻量级模型是否能跨不同数据集和神经网络架构实现良好泛化?
  • RQ4基于 logits 的检测方法在多种误分类类型上的表现,与 Softmax Baseline 和 Trust Score 等现有方法相比如何?
  • RQ5是否可以仅通过 logits 的大小和分布,无需额外微调模型,有效检测分布外和对抗样本?

主要发现

  • Introspection-Net 在检测分布外数据方面显著优于 Softmax Baseline 和 Trust Score,在高斯噪声上实现 0.0% FPR,且在所有 OOD 数据集上均达到近乎完美的 AUROC。
  • 在 CIFAR-10 实验中,对于 BIM 攻击,Introspection-Net 的 AUROC 达到 97.6,而 Softmax Baseline 为 14.4,Trust Score 为 56.1。
  • 该方法在 OOD 检测中表现最佳,对所有测试的 OOD 数据(高斯分布、均匀分布、CIFAR-10、Fashion-MNIST)均取得近乎完美的分数,同时在对抗样本检测中仍优于基线方法。
  • 错误检测仍是最具挑战性的任务,所有方法表现相近,表明仅靠 logits 可能不足以区分自然错误与正确预测。
  • Softmax Baseline 在 DeepFool 对抗样本上表现最佳,因其最大 softmax 概率较低(54.0%),使得通过阈值判断更容易检测,凸显了仅依赖 softmax 的局限性。
  • 尽管需要对抗训练,Introspection-Net 在不同架构(MNIST 上的 CNN,CIFAR-10 上的 Wide ResNet)上均表现出良好泛化能力,证明了该方法的鲁棒性和可迁移性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。