[论文解读] Towards Dependable Deep Convolutional Neural Networks (CNNs) with Out-distribution Learning.
本文提出通过引入分布外学习来增强深度卷积神经网络(CNNs),以提高对对抗样本的鲁棒性。通过在无需对抗训练的情况下检测并拒绝分布外输入,该方法在MNIST上实现了超过95%的拒绝率或正确分类,在CIFAR-10上实现了超过75%的性能,同时将干净数据准确率的退化控制在4%以内。
Detection and rejection of adversarial examples in security sensitive and safety-critical systems using deep CNNs is essential. In this paper, we propose an approach to augment CNNs with out-distribution learning in order to reduce misclassification rate by rejecting adversarial examples. We empirically show that our augmented CNNs can either reject or classify correctly most adversarial examples generated using well-known methods ( >95% for MNIST and >75% for CIFAR-10 on average). Furthermore, we achieve this without requiring to train using any specific type of adversarial examples and without sacrificing the accuracy of models on clean samples significantly (< 4%).
研究动机与目标
- 为在安全关键和安全敏感系统中实现可靠的深度学习,通过提高对对抗样本的鲁棒性来应对关键需求。
- 在不依赖对抗训练数据的情况下,降低CNN在对抗输入上的误分类率。
- 在显著提升对分布外输入检测能力的同时,保持对干净自然数据的高准确率。
- 开发一种可泛化的防御机制,可在未预先接触特定攻击的情况下,适用于多种对抗攻击类型。
提出的方法
- 该方法通过基于置信度的拒绝机制,将分布外检测集成到预训练CNN的最后层。
- 利用蒙特卡洛Dropout进行不确定性估计,以识别与训练分布显著偏离的输入。
- 模型仅在分布内数据上进行训练,避免在训练过程中收集或生成对抗样本。
- 通过设定预测熵或置信度分数的阈值,拒绝被判定为分布外的输入。
- 该方法在训练后应用,可实现对现有模型的轻量级微调,便于快速部署。
实验结果
研究问题
- RQ1分布外学习能否在无需对抗训练的情况下有效检测并拒绝对抗样本?
- RQ2在提升鲁棒性的同时,带有分布外检测的CNN在干净数据上的准确率能保持多高?
- RQ3该方法在不同对抗攻击类型和数据集上的泛化能力如何?
- RQ4在所提出的框架中,拒绝率与干净准确率之间的权衡关系如何?
主要发现
- 所提出的方法在MNIST数据集上成功拒绝或正确分类了超过95%的对抗样本。
- 在CIFAR-10数据集上,该模型实现了对对抗样本超过75%的平均正确分类或拒绝率。
- 该方法将干净数据准确率保持在原始模型的4%以内退化范围内,表明性能退化极小。
- 该方法在未使用任何特定对抗样本进行训练的情况下,对多种对抗攻击方法均表现出良好的泛化能力。
- 通过置信度估计实现的分布外检测能有效将对抗输入识别为异常,即使这些输入对人类而言难以察觉。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。