[论文解读] Denoising Dictionary Learning Against Adversarial Perturbations
本文提出去噪字典学习(DDL)作为深度神经网络对抗扰动的防御方法。通过学习一个冗余、过完备的字典,从对抗性扰动输入中重建干净图像,DDL 在 MNIST 和 CIFAR10 上实现了高置信度的正确预测,显著提升了多种架构(如 MLP、CNN、ResNet 和 HRNN)的鲁棒性。
We propose denoising dictionary learning (DDL), a simple yet effective technique as a protection measure against adversarial perturbations. We examined denoising dictionary learning on MNIST and CIFAR10 perturbed under two different perturbation techniques, fast gradient sign (FGSM) and jacobian saliency maps (JSMA). We evaluated it against five different deep neural networks (DNN) representing the building blocks of most recent architectures indicating a successive progression of model complexity of each other. We show that each model tends to capture different representations based on their architecture. For each model we recorded its accuracy both on the perturbed test data previously misclassified with high confidence and on the denoised one after the reconstruction using dictionary learning. The reconstruction quality of each data point is assessed by means of PSNR (Peak Signal to Noise Ratio) and Structure Similarity Index (SSI). We show that after applying (DDL) the reconstruction of the original data point from a noisy
研究动机与目标
- 解决深度神经网络对导致高置信度误分类的对抗扰动的脆弱性。
- 开发一种鲁棒、灵活且可逆的防御机制,避免存储原始数据和变换后数据的需求。
- 评估字典学习在不同复杂度和拓扑结构的深度神经网络架构中的有效性。
- 通过 PSNR 和 SSIM 评估重建质量,确保去噪后图像的语义和结构保真度。
- 证明 DDL 可在推理阶段无需访问干净训练数据的情况下,从高度扰动的测试样本中恢复干净输入。
提出的方法
- 将去噪字典学习(DDL)应用于使用学习到的过完备字典从对抗性扰动输入中重建干净图像。
- 通过求解稀疏编码问题,将每张扰动图像表示为字典原子的稀疏线性组合。
- 通过将扰动输入投影到学习到的字典上,并利用稀疏系数进行重构,获得最终结果。
- 字典仅在干净数据上进行训练,使其能够泛化到未见过的扰动测试样本,而无需使用带噪声的训练样本。
- 该方法与网络架构无关,可无缝集成到任何监督学习流程中,无需修改底层 DNN。
- 通过 PSNR 和 SSIM 评估重建质量,以确保去噪后图像的结构和信号保真度。
实验结果
研究问题
- RQ1在 FGSM 和 JSMA 攻击下,去噪字典学习能否有效从对抗性扰动输入中恢复干净图像?
- RQ2DDL 在具有不同复杂度和拓扑结构的多种深度神经网络架构中表现如何?
- RQ3与基线模型相比,DDL 在受扰动测试数据上的分类准确率提升程度如何?
- RQ4以 PSNR 和 SSIM 衡量的重建质量,与模型鲁棒性的提升之间是否存在相关性?
- RQ5DDL 是否可作为灵活、可逆且计算高效的防御机制,且无需存储原始数据和变换后数据?
主要发现
- 应用 DDL 后,FGSM 扰动下的 MNIST 分类准确率从 12.80% 提升至 82%,CIFAR10 从 15.06% 提升至 68.29%。
- 对于 JSMA 扰动数据,MNIST 的准确率从 53.02% 提升至 60%,CIFAR10 从 14.59% 提升至 67.23%。
- 自编码器和 ResNet 模型表现最显著,FGSM-MNIST 上准确率分别提升了 29.45% 和 23.01%。
- 重建质量较高,PSNR 和 SSIM 值表明去噪图像具有较强的结构和信号保真度。
- 对图像细节敏感度高的模型(如 ResNet)对扰动更脆弱,但 DDL 显著提升了其性能。
- 即使在强扰动下,该方法仍能成功恢复干净输入,使去噪后模型实现高置信度的正确预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。