Skip to main content
QUICK REVIEW

[论文解读] Transferable Perturbations of Deep Feature Distributions

Nathan Inkawhich, Kevin J Liang|arXiv (Cornell University)|Apr 27, 2020
Adversarial Robustness in Machine Learning参考文献 26被引用 20
一句话总结

本文提出特征分布攻击(Feature Distribution Attack, FDA),一种新颖的定向黑盒对抗攻击方法,通过利用白盒替代模型学习到的类别特定与层特定深度特征分布,生成高度可迁移的扰动。与依赖输出层梯度的方法不同,FDA通过优化中间特征分布的偏移来实现,在未受防御的ImageNet模型上实现了最先进的迁移成功率,同时增强了对特征空间变化与可迁移性机制的可解释性。

ABSTRACT

Almost all current adversarial attacks of CNN classifiers rely on information derived from the output layer of the network. This work presents a new adversarial attack based on the modeling and exploitation of class-wise and layer-wise deep feature distributions. We achieve state-of-the-art targeted blackbox transfer-based attack results for undefended ImageNet models. Further, we place a priority on explainability and interpretability of the attacking process. Our methodology affords an analysis of how adversarial attacks change the intermediate feature distributions of CNNs, as well as a measure of layer-wise and class-wise feature distributional separability/entanglement. We also conceptualize a transition from task/data-specific to model-specific features within a CNN architecture that directly impacts the transferability of adversarial examples.

研究动机与目标

  • 开发一种基于迁移的黑盒对抗攻击方法,在未受防御的ImageNet分类器上超越现有方法的表现。
  • 通过分析扰动如何改变深度神经网络中中间特征分布,提升对抗攻击的可解释性。
  • 探究特征分布可分性、层深度与对抗迁移性之间的关系。
  • 识别在类别特异性和与最终模型输出低相关性之间实现平衡的最优扰动层。
  • 概念化卷积神经网络架构中从任务/数据特定特征到模型特定特征的转变过程,及其对迁移性的影响。

提出的方法

  • 训练辅助二值神经网络 $ g_{l,c} $ 以估计 $ p(y=c|f_l(x)) $,即来自层 $ l $ 的特征属于类别 $ c $ 的概率。
  • 利用这些学习到的分布,通过在替代模型的特征空间中最大化目标类别的置信度,生成定向对抗样本。
  • 在对抗样本生成过程中采用动量优化方法,以改善收敛性并减少对替代架构的过拟合。
  • 通过类间与类内扰动距离来度量特征分布可分性,定义为到达目标类或源类分布高置信区域所需的小步数。
  • 通过分析辅助模型的显著性图,可视化不同层深度下对分类预测最具影响力的图像区域。
  • 通过中间特征分布与最终模型输出之间的相关性分析,识别出信息丰富但与最终决策边界关联不强的层。

实验结果

研究问题

  • RQ1扰动中间特征分布如何影响对抗样本向黑盒模型的迁移性?
  • RQ2卷积神经网络中的哪些层展现出最有利于生成高度可迁移对抗样本的特征分布?
  • RQ3特征分布可分性与纠缠程度在不同架构之间与迁移成功率的相关性如何?
  • RQ4从任务/数据特定特征到模型特定特征的转变过程如何影响对抗迁移性?
  • RQ5特征分布建模能否为对抗攻击如何改变深度网络内部表征提供可解释的洞见?

主要发现

  • FDA通过利用中间特征分布而非输出层梯度,在未受防御的ImageNet模型上实现了最先进的定向黑盒迁移攻击成功率。
  • 最具迁移性的对抗扰动产生于特征分布对类别间高度可分但与最终模型输出关联不过强的层。
  • VGG19的特征可分性显著低于DenseNet121和ResNet50,这与攻击实验中其较差的迁移性能相吻合。
  • 显著性分析揭示,在高性能迁移层中,显著性从全局向局部转变,表明这些层捕获了判别性且可泛化的特征。
  • 高度可迁移的攻击在黑盒模型的中间特征空间中引发显著扰动,证实了特征层面的变化驱动了成功的迁移。
  • 本研究识别出特征表征中的一个关键转变点——从任务特定到模型特定——在此处最优迁移性出现,为模型鲁棒性设计提供了洞见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。