Skip to main content
QUICK REVIEW

[论文解读] Detecting Adversarial Examples through Nonlinear Dimensionality Reduction

Francesco Crecchi, Davide Bacciu|arXiv (Cornell University)|Apr 30, 2019
Adversarial Robustness in Machine Learning参考文献 14被引用 10
一句话总结

该论文提出了一种多层对抗样本检测器,利用 t-SNE 进行非线性降维,以在深度神经网络特征空间中分离自然输入与对抗性输入。通过在 t-SNE 投影的自然样本和对抗性样本上训练检测器,该方法实现了高检测准确率——在 FGSM、BIM 和 PGD 攻击下,MNIST 上的分类器准确率保持在 0.8 以上,CIFAR10 上保持在 0.7 以上,证明了其对非自适应攻击者的有效性。

ABSTRACT

Deep neural networks are vulnerable to adversarial examples, i.e., carefully-perturbed inputs aimed to mislead classification. This work proposes a detection method based on combining non-linear dimensionality reduction and density estimation techniques. Our empirical findings show that the proposed approach is able to effectively detect adversarial examples crafted by non-adaptive attackers, i.e., not specifically tuned to bypass the detection method. Given our promising results, we plan to extend our analysis to adaptive attackers in future work.

研究动机与目标

  • 为解决深度神经网络在安全关键应用中对对抗样本的脆弱性问题。
  • 开发一种基于检测的防御机制,识别并拒绝分布外的对抗性输入,而无需重新训练主分类器。
  • 通过证明对抗样本在高维表示中位于自然数据流形之外,验证流形假设。
  • 设计一种多层检测器,利用 t-SNE 投影在多个网络层中区分自然样本与对抗性样本。
  • 提供一种计算高效的对抗训练替代方案,仅在检测器设置阶段一次性生成对抗样本。

提出的方法

  • 该方法使用 t-SNE 将中间层的高维神经激活投影到低维空间(2D 或 3D),使自然样本与对抗性样本在其中可分。
  • 在每个监控层附加一个层检测器(LD),利用基于 t-SNE 的 Mapper 和密度估计器计算每个样本的类别概率。
  • 检测器将各层的概率分数聚合为一个数据序列,由多层检测器(MLD)分析其中异常趋势,以识别对抗性输入。
  • 使用 Carlini-Wagner 攻击一次性生成对抗样本,用于训练 Mapper 组件,从而实现对 FGSM、BIM 和 PGD 等其他攻击的泛化能力。
  • 当检测到异常模式时,MLD 将分类器输出覆盖为特殊类别 'adversarial'(N+1),确保拒绝被扰动的输入。
  • 该方法将全序列的各层概率分数视为整体信号,利用对抗样本在各层中表现出不一致、低置信度趋势的特性。

实验结果

研究问题

  • RQ1基于 t-SNE 的非线性降维是否能有效分离深度神经网络特征空间中的自然样本与对抗性样本?
  • RQ2基于 t-SNE 投影与概率趋势分析的多层检测器架构,是否相比单层方法提升了对抗样本检测性能?
  • RQ3在一种攻击类型(如 Carlini-Wagner)上训练的检测器,是否能泛化到检测由其他攻击算法(如 FGSM、BIM、PGD)生成的对抗样本?
  • RQ4该检测器在保持干净输入和轻微扰动输入的分类器准确率的同时,对强扰动对抗样本的拒绝能力如何?
  • RQ5该方法对非自适应攻击者的有效性如何?其在面对自适应对手时的局限性是什么?

主要发现

  • 在 FGSM、BIM 和 PGD 攻击下,该检测器在 MNIST 数据集上的分类器准确率保持在 0.8 以上,在 CIFAR10 上保持在 0.7 以上,且使用 L2 范数扰动。
  • 在混合自然样本与对抗样本上训练的 t-SNE 投影成功地将两类样本分离为独立聚类,证实了流形假设。
  • 自然样本与对抗性样本在各层中的概率分数趋势存在显著差异:自然样本对真实类别的置信度一致且较高,而对抗性样本则表现出低且不一致的分数。
  • 该方法仅在检测器训练阶段一次性生成对抗样本,与对抗训练不同,后者需在每个训练周期重新训练对抗样本。
  • 即使对抗样本由与 Mapper 训练阶段不同的攻击算法生成,检测器仍能成功识别并拒绝,表明其具备泛化能力。
  • 安全评估曲线显示,该检测器显著提升了鲁棒性,即使在扰动强度增加时仍能保持高准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。