[论文解读] Art of singular vectors and universal adversarial perturbations
本文提出SingularFool,一种通过计算深度神经网络特征图的雅可比矩阵的(p,q)-奇异向量,生成通用对抗扰动的新方法。仅使用64张图像,该方法在ImageNet上实现了60%的欺骗率,显著优于以往需要数千张图像的方法,并展现出在模型间的强泛化能力以及视觉模式的一致性。
Vulnerability of Deep Neural Networks (DNNs) to adversarial attacks has been attracting a lot of attention in recent studies. It has been shown that for many state of the art DNNs performing image classification there exist universal adversarial perturbations --- image-agnostic perturbations mere addition of which to natural images with high probability leads to their misclassification. In this work we propose a new algorithm for constructing such universal perturbations. Our approach is based on computing the so-called $(p, q)$-singular vectors of the Jacobian matrices of hidden layers of a network. Resulting perturbations present interesting visual patterns, and by using only 64 images we were able to construct universal perturbations with more than 60 \% fooling rate on the dataset consisting of 50000 images. We also investigate a correlation between the maximal singular value of the Jacobian matrix and the fooling rate of the corresponding singular vector, and show that the constructed perturbations generalize across networks.
研究动机与目标
- 开发一种更高效的通用对抗扰动生成方法,与现有方法相比,所需训练图像更少。
- 探究雅可比矩阵最大(p,q)-奇异值与生成扰动欺骗率之间的关系。
- 评估生成扰动在不同深度神经网络架构间的泛化能力。
- 分析基于奇异向量的扰动所呈现的视觉模式与结构特性。
- 探索(p,q)-奇异值作为模型鲁棒性定量度量指标的潜力,以及其作为训练过程中候选正则化项的可能性。
提出的方法
- 通过适用于任意p-范数的广义幂方法,计算隐藏层特征图雅可比矩阵的(p,q)-奇异向量。
- 将对抗扰动生成建模为优化问题:在||ε||_p = 1的约束下,最大化||J_i(x)ε||_q,其中J_i(x)为第i层的雅可比矩阵。
- 该问题的解即为(p,q)-奇异向量,经缩放后可达到期望的扰动范数L。
- 该算法使用小批量大小(例如32),并通过在单一层(如VGG-19中的block2_pool)的雅可比矩阵上迭代应用幂方法来更新扰动。
- 该方法利用了优化问题的齐次性,使得扰动可无须重新计算即可缩放至任意范数。
- 该方法使用TensorFlow和NumPy实现,每层仅需一次符号化雅可比矩阵-向量乘积的计算。
实验结果
研究问题
- RQ1雅可比矩阵的(p,q)-奇异向量能否用于在极小数据量下高效生成具有高欺骗率的通用对抗扰动?
- RQ2雅可比矩阵最大(p,q)-奇异值与生成扰动欺骗率之间存在何种相关性?
- RQ3该方法生成的扰动在不同深度神经网络架构间的泛化能力如何?
- RQ4训练过程中使用的图像数量如何影响通用扰动的收敛性与性能?
- RQ5生成的扰动是否表现出一致的视觉模式?其是否可被视为跨数据集与模型的通用扰动?
主要发现
- 所提出的SingularFool方法仅使用64张图像,就在ImageNet上实现了超过60%的欺骗率,显著优于需要数千张图像才能达到类似性能的UAP方法。
- 随着训练图像数量的增加,扰动的欺骗率迅速稳定:仅使用64张图像时即达到约63%,而UAP方法需约3000张图像才能达到60%的欺骗率。
- 在单张GPU(Tesla K80)上,该方法使用32批大小和30次迭代,运行时间约为1分钟,而UAP方法使用更大批大小时需约10分钟。
- 雅可比矩阵最大(p,q)-奇异值与欺骗率之间存在强烈正相关,表明其可作为模型鲁棒性的定量度量指标。
- 生成的扰动展现出一致的视觉模式,并在不同DNN架构(包括VGG-19、ResNet和Inception)间表现出有效的泛化能力。
- 该方法展现出强大的泛化能力:在某一网络上训练的扰动可在其他预训练模型上实现高欺骗率,证实了其通用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。