Skip to main content
QUICK REVIEW

[论文解读] Adversarial Defense via Data Dependent Activation Function and Total Variation Minimization

Bao Wang, A. T. Lin|arXiv (Cornell University)|Sep 23, 2018
Adversarial Robustness in Machine Learning参考文献 41被引用 16
一句话总结

本文提出一种数据相关的激活函数——具体为流形插值函数(WNLL),以增强深度神经网络的对抗鲁棒性。通过用这种基于几何信息的激活函数替代标准的softmax,并结合总变差最小化(TVM)与PGD对抗训练,该方法在强IFGSM攻击下将CIFAR-10的鲁棒准确率提升高达38.9%,在ResNet20上实现约69%的鲁棒准确率,显著优于标准模型。

ABSTRACT

We improve the robustness of Deep Neural Net (DNN) to adversarial attacks by using an interpolating function as the output activation. This data-dependent activation remarkably improves both the generalization and robustness of DNN. In the CIFAR10 benchmark, we raise the robust accuracy of the adversarially trained ResNet20 from $\sim 46\%$ to $\sim 69\%$ under the state-of-the-art Iterative Fast Gradient Sign Method (IFGSM) based adversarial attack. When we combine this data-dependent activation with total variation minimization on adversarial images and training data augmentation, we achieve an improvement in robust accuracy by 38.9$\%$ for ResNet56 under the strongest IFGSM attack. Furthermore, We provide an intuitive explanation of our defense by analyzing the geometry of the feature space.

研究动机与目标

  • 为解决深度神经网络(DNNs)在自动驾驶和恶意软件检测等安全关键应用中对对抗攻击的脆弱性问题。
  • 通过用数据相关的流形插值函数替代标准的softmax输出激活函数,提升DNN的泛化能力和鲁棒性。
  • 开发一种对白盒和黑盒对抗攻击(包括可迁移和通用扰动)均鲁棒的防御框架。
  • 证明可通过激活函数设计与后处理,利用特征空间中的几何结构来增强鲁棒性。

提出的方法

  • 在DNN中用数据相关的、流形插值的激活函数(WNLL)替代标准softmax输出激活函数,利用训练数据中的几何信息。
  • 对对抗样本和训练数据应用总变差最小化(TVM),以简化扰动并减少噪声。
  • 将WNLL激活与PGD对抗训练结合,以在模型优化过程中提升鲁棒性。
  • 使用投影梯度下降(PGD)求解对抗训练中的内层最大化问题,近似最强攻击。
  • 将WNLL激活与数据增强及TVM结合,构建多管齐下的防御策略。
  • 利用WNLL函数的近似梯度,实现在对抗训练过程中的端到端反向传播。

实验结果

研究问题

  • RQ1与标准softmax相比,数据相关的流形插值激活函数是否能同时提升DNN的泛化能力和鲁棒性?
  • RQ2在对抗扰动下,潜在空间中特征的几何结构如何变化?这种变化能否被用于防御?
  • RQ3将WNLL激活与总变差最小化及对抗训练结合,能在多大程度上增强对强IFGSM攻击的鲁棒性?
  • RQ4所提出的防御方法是否对可迁移和通用对抗扰动有效?
  • RQ5WNLL-based防御能否与数据增强和TVM等其他防御方法叠加使用,以进一步提升鲁棒性?

主要发现

  • 在CIFAR-10上,该方法将PGD对抗训练的ResNet20在最强IFGSM攻击下的鲁棒准确率从约46%提升至约69%。
  • 当与TVM和数据增强结合时,该方法在最强IFGSM攻击下使ResNet56的鲁棒准确率提升38.9%。
  • WNLL激活在IFGSM迭代次数增加时显著减缓准确率下降,10次迭代时相比标准ResNet20表现出约23%的性能优势。
  • 特征空间可视化显示,WNLL在原始图像和对抗样本中均保持了有意义的几何结构,而softmax则扭曲了特征分布。
  • 由于WNLL函数的几何稳定性,该防御在黑盒攻击设置下依然有效。
  • 该方法与现有防御(如PGD训练和TVM)兼容,可实现鲁棒性的叠加提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。