[论文解读] Building Robust Deep Neural Networks for Road Sign Detection
本文提出了一种针对道路标志检测的鲁棒深度学习流水线,通过使用快速梯度符号法(FGSM)和雅可比显著性图法生成对抗性样本,并在GTSRB数据集上结合防御蒸馏和对抗性训练提升模型鲁棒性。该方法在防御后对对抗性样本的准确率达到91.46%,显著优于非鲁棒模型在对抗性样本上50.89%的准确率。
Deep Neural Networks are built to generalize outside of training set in mind by using techniques such as regularization, early stopping and dropout. But considerations to make them more resilient to adversarial examples are rarely taken. As deep neural networks become more prevalent in mission-critical and real-time systems, miscreants start to attack them by intentionally making deep neural networks to misclassify an object of one type to be seen as another type. This can be catastrophic in some scenarios where the classification of a deep neural network can lead to a fatal decision by a machine. In this work, we used GTSRB dataset to craft adversarial samples by Fast Gradient Sign Method and Jacobian Saliency Method, used those crafted adversarial samples to attack another Deep Convolutional Neural Network and built the attacked network to be more resilient against adversarial attacks by making it more robust by Defensive Distillation and Adversarial Training
研究动机与目标
- 开发一种针对实时自动驾驶系统中道路标志检测的鲁棒深度神经网络,以抵抗对抗性攻击。
- 在GTSRB数据集上使用FGSM和雅可比显著性图法生成对抗性样本,用于黑盒攻击评估。
- 评估防御蒸馏和对抗性训练在提升模型对人工构造的对抗性样本鲁棒性方面的有效性。
- 验证防御机制在保持对干净(非对抗性)测试数据高性能的同时,提升对对抗性扰动的鲁棒性。
- 弥补先前研究的不足,将对抗性防御技术应用于交通标志识别领域,该领域相较于MNIST或CIFAR-10仍属研究不足。
提出的方法
- 使用SGD优化器(初始学习率0.01,动量,权重衰减)在GTSRB数据集上训练深度卷积神经网络(DeepCNN),共30个周期,以实现接近当前最先进水平的性能。
- 利用快速梯度符号法(FGSM)和雅可比显著性图法生成对抗性样本,以生成难以察觉的、有目标和无目标的扰动。
- 采用温度缩放(T=100)的防御蒸馏方法,平滑模型预测结果,提升对对抗性输入的鲁棒性。
- 通过在干净样本与对抗性样本的混合数据上重新训练模型,实施对抗性训练,以增强模型在攻击下的泛化能力。
- 采用黑盒攻击设置,攻击者无法访问目标网络的内部架构或权重。
- 使用交叉熵损失、准确率、F1分数和Softmax熵对模型在干净和对抗性测试集上的性能进行评估。
实验结果
研究问题
- RQ1在黑盒设置下,通过FGSM和雅可比显著性图法生成的对抗性样本是否能有效欺骗在GTSRB数据集上表现优异的深度CNN?
- RQ2防御蒸馏在提升对对抗性攻击的鲁棒性的同时,对干净数据性能的保持程度如何?
- RQ3与非鲁棒模型相比,对抗性训练在保持对抗性样本上高准确率方面的有效性如何?
- RQ4防御蒸馏与对抗性训练的结合是否能产生比单独使用任一方法更鲁棒的模型?
- RQ5FGSM与基于雅可比的扰动在感知差异上如何影响实际场景中攻击的成功率与物理可实现性?
主要发现
- 非鲁棒的DeepCNN模型在干净测试样本上达到98.77%的准确率,但在使用攻击网络生成的对抗性样本上准确率下降至50.89%。
- 在应用T=100的防御蒸馏后,模型在对抗性样本上的测试准确率提升至91.46%,表明鲁棒性得到显著增强。
- 经过防御蒸馏和对抗性训练后,模型在对抗性样本上的交叉熵损失从3.682降至0.405,表明预测更加自信且准确。
- 尽管鲁棒性提升,防御蒸馏后模型在干净数据上的准确率从98.77%略微下降至98.30%,表明存在轻微性能权衡。
- 防御后,对抗性样本上Softmax预测的熵从8.78升至10.41,表明预测更加均匀且不那么过度自信,这是鲁棒性提升的标志。
- 研究证实,传统的正则化方法(如Dropout)无法防御对抗性攻击,而防御蒸馏和对抗性训练有效,但需要仔细的超参数调优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。