Skip to main content
QUICK REVIEW

[论文解读] L 1-norm double backpropagation adversarial defense

Ismaïla Seck, Gaëlle Loosli|arXiv (Cornell University)|Mar 5, 2019
Adversarial Robustness in Machine Learning参考文献 8被引用 5
一句话总结

该论文提出了一种基于 $L_1$-范数的双重反向传播防御方法,通过惩罚输出相对于输入的梯度的 $L_1$-范数,以降低模型对对抗性扰动的敏感性。当与对抗性训练结合时,该方法提升了模型的鲁棒性,在 $\varepsilon=0.3$ 时,$\lambda=50$ 的条件下,对对抗性样本的准确率最高达到 97.25%,表明梯度惩罚可使模型鲁棒性超越仅使用对抗性训练的效果。

ABSTRACT

Adversarial examples are a challenging open problem for deep neural networks. We propose in this paper to add a penalization term that forces the decision function to be at in some regions of the input space, such that it becomes, at least locally, less sensitive to attacks. Our proposition is theoretically motivated and shows on a first set of carefully conducted experiments that it behaves as expected when used alone, and seems promising when coupled with adversarial training.

研究动机与目标

  • 为解决深度神经网络中对抗性样本的持续挑战,即模型可能因极小且难以察觉的扰动而错误分类输入。
  • 通过梯度惩罚减少模型对输入扰动的局部敏感性,以提升模型鲁棒性。
  • 从理论上证明使用输出梯度的 $L_1$-范数作为正则化项对对抗鲁棒性的合理性。
  • 评估将 $L_1$-范数梯度惩罚与对抗性训练结合的有效性。
  • 探究在训练点附近决策函数的平坦性是否能增强模型对对抗攻击的鲁棒性。

提出的方法

  • 该方法通过惩罚每个输出分量 $f_i$ 相对于输入 $\mathbf{x}$ 的梯度的 $L_1$-范数,即 $\|\nabla_{\mathbf{x}}f_i(\mathbf{x})\|_1$,以实现决策函数的局部平坦化。
  • 惩罚不仅应用于原始输入,也应用于对抗性扰动后的点,以确保在邻近输入上均具备鲁棒性。
  • 通过一阶泰勒展开证明,最小化 $\|\nabla_{\mathbf{x}}f_i(\mathbf{x})\|_1$ 可限制小扰动 $\varepsilon\mathbf{v}$ 引起的输出变化。
  • 该防御方法通过在标准交叉熵损失中添加梯度惩罚项,整合进训练过程,其中超参数 $\lambda$ 控制正则化的强度。
  • 该方法在结合对抗性训练时,使用 FGSM 生成的对抗性样本进行评估,同时采用标签平滑和输入裁剪以保持 $\mathcal{X}=[0,1]^d$。
  • 由于计算限制,雅可比矩阵范数被近似为 $\sum_{j=1}^d \left| \sum_{i=1}^c \frac{\partial f_i(\mathbf{x})}{\partial x_j} \right|$。

实验结果

研究问题

  • RQ1通过惩罚输出相对于输入的梯度的 $L_1$-范数,能否提升对抗鲁棒性?
  • RQ2当与对抗性训练结合时,所提出的 $L_1$-范数梯度惩罚是否能生成比仅使用对抗性训练更鲁棒的模型?
  • RQ3梯度惩罚强度($\lambda$)如何影响干净准确率与鲁棒性之间的权衡?
  • RQ4在决策函数中强制实现局部平坦性是否能降低对对抗性扰动的敏感性?
  • RQ5梯度的 $L_1$-范数是否为对抗防御提供理论合理且有效的正则化方法?

主要发现

  • 仅使用 $L_1$-范数梯度惩罚即可提升鲁棒性,干净准确率保持较高水平(例如,模型 A 的干净准确率为 99.36%),而对抗性准确率从 95.72% 提升至 $\lambda=10$ 时的 98.73%。
  • 当与对抗性训练结合时,该方法在模型 C 上实现了 97.25% 的对抗性准确率($\varepsilon=0.3$,$\lambda=50$),优于仅使用对抗性训练的 95.52%。
  • 当 $\lambda$ 从 10 增加到 50 时,模型 C 的对抗性准确率从 96.62% 提升至 97.25%,表明更强的惩罚具有积极影响。
  • 当 $\lambda=1000$ 时,对抗性准确率下降至 94.65%,表明过高的 $\lambda$ 会损害性能,提示 $\lambda$ 存在最优范围。
  • 该方法在多个模型(A、B、C)上均表现出一致的改进,尤其在较高 $\varepsilon$ 值下增益最大,表明对更强攻击具有有效性。
  • 部分结果中较大的标准差表明,100 个周期的训练可能尚未完全收敛,提示通过更长的训练可能获得进一步提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。