[论文解读] ReabsNet: Detecting and Revising Adversarial Examples
ReabsNet 是一种新颖的防御框架,通过守护网络检测对抗性样本并将其修正以恢复原始标签,在多种攻击下表现优于最先进的方法(如 Madry 等人提出的鲁棒模型),尤其在扰动范围超过 ε=0.3 时表现更优。
Though deep neural network has hit a huge success in recent studies and applica- tions, it still remains vulnerable to adversarial perturbations which are imperceptible to humans. To address this problem, we propose a novel network called ReabsNet to achieve high classification accuracy in the face of various attacks. The approach is to augment an existing classification network with a guardian network to detect if a sample is natural or has been adversarially perturbed. Critically, instead of simply rejecting adversarial examples, we revise them to get their true labels. We exploit the observation that a sample containing adversarial perturbations has a possibility of returning to its true class after revision. We demonstrate that our ReabsNet outperforms the state-of-the-art defense method under various adversarial attacks.
研究动机与目标
- 解决深度神经网络对难以察觉的对抗性扰动的脆弱性,这些扰动会误导分类结果。
- 克服现有‘检测并丢弃’类防御方法的局限性,后者因误报而拒绝自然图像。
- 开发一种防御机制,不仅能检测对抗性样本,还能对其进行修正以恢复其真实标签。
- 通过仅在一种攻击类型(DeepFool)上训练守护网络与修正网络,实现对未见过的攻击的鲁棒分类。
提出的方法
- 提出三组件架构:主网络用于分类,守护网络用于对抗性样本检测,修正网络用于对抗性输入的迭代修正。
- 使用通过 DeepFool 生成的对抗性样本,训练守护网络以区分自然样本与对抗性样本。
- 应用基于对抗性攻击机制(如 DeepFool)的图像修改方法,对检测到的对抗性样本进行迭代修正。
- 通过迭代修正,将对抗性输入转化为守护网络分类为自然样本的样本,从而实现主网络的正确分类。
- 采用端到端联合损失函数,同时优化检测与修正目标,联合训练整个系统。
- 利用观察结果:对抗性样本可通过有针对性的扰动反转恢复至原始类别,其机制类似于生理上的重吸收过程。
实验结果
研究问题
- RQ1守护网络是否能在不依赖攻击类型先验知识的情况下有效检测对抗性样本?
- RQ2是否可通过迭代修改成功将对抗性样本修正为其原始自然形态?
- RQ3一种能够修正对抗性输入的防御系统是否优于传统的‘检测并丢弃’或鲁棒训练方法?
- RQ4ReabsNet 框架在不同对抗性攻击类型和扰动尺度下的泛化能力如何?
- RQ5该框架是否能在保持自然图像高准确率的同时,有效防御强而多样的攻击?
主要发现
- ReabsNet 在自然 MNIST 图像上达到 99.05% 的分类准确率,与仅使用主网络的性能完全一致。
- 在 FGSM 和 DeepFool 攻击下,当 ε < 0.3 时,ReabsNet 的防御成功率高达 100%,优于相同条件下的 Madry 模型。
- 当扰动范围扩大至 ε < 0.6 时,ReabsNet 在 FGSM 攻击下仍保持 95% 的防御成功率,在 CW $L_{∞}$ 针对性攻击下达到 97.3%,显著优于 Madry 模型。
- 在测试的六种攻击类型中,ReabsNet 的防御成功率始终保持高水平,包括 CW $L_2$ 和 $L_∞$ 的非目标/目标攻击。
- 该框架具有良好的泛化能力:仅使用 DeepFool 生成的对抗性样本进行训练,即可在其他攻击类型下实现有效的检测与修正。
- 修正网络成功将对抗性样本恢复至其原始类别,证明了基于机制感知的修正方法可实现对抗性扰动的可逆性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。