Skip to main content
QUICK REVIEW

[论文解读] Intermediate Level Adversarial Attack for Enhanced Transferability

Qian Huang, Zeqi Gu|arXiv (Cornell University)|Nov 20, 2018
Adversarial Robustness in Machine Learning参考文献 19被引用 4
一句话总结

本文提出中间层攻击(ILA),通过微调对抗样本以在源模型的特定中间层最大化扰动,从而提升对抗样本的黑盒迁移性。通过针对模型间共享的、可泛化的特征层,ILA 在无需了解目标模型的情况下提升了迁移成功率,在 CIFAR-10 基准上实现了最先进水平的迁移性。

ABSTRACT

Neural networks are vulnerable to adversarial examples, malicious inputs crafted to fool trained models. Adversarial examples often exhibit black-box transfer, meaning that adversarial examples for one model can fool another model. However, adversarial examples may be overfit to exploit the particular architecture and feature representation of a source model, resulting in sub-optimal black-box transfer attacks to other target models. This leads us to introduce the Intermediate Level Attack (ILA), which attempts to fine-tune an existing adversarial example for greater black-box transferability by increasing its perturbation on a pre-specified layer of the source model. We show that our method can effectively achieve this goal and that we can decide a nearly-optimal layer of the source model to perturb without any knowledge of the target models.

研究动机与目标

  • 解决现有对抗攻击方法过度拟合于源模型架构、降低黑盒迁移性的局限性。
  • 探究在具有共享、可泛化特征的中间层施加扰动是否能提升在多样化模型间的迁移性。
  • 开发一种方法,在无需在超参数调优过程中对目标模型进行评估的情况下,选择最优的中间层用于攻击。
  • 证明在中间层中针对高方差通道进行攻击,可通过干扰共享信息进一步提升迁移性。

提出的方法

  • 制定一种迭代优化目标,以在指定中间层最大化激活差异的 L2 范数,同时保持原始扰动的方向。
  • 将损失函数定义为归一化扰动幅度与原始扰动方向余弦相似度的加权和,以确保结构一致性。
  • 将攻击作为预存在的对抗样本的微调步骤,使用迭代梯度更新在选定层上优化扰动。
  • 通过将层输出替换为单个通道输出,将方法扩展至通道级目标选择,从而实现对最具信息量通道的选择。
  • 使用数据集中通道激活方差作为代理,识别出在模型间可能共享的高信息量通道。
  • 仅使用源模型的层扰动统计信息选择攻击的最优层,避免在超参数搜索过程中对目标模型进行昂贵的评估。

实验结果

研究问题

  • RQ1与聚焦于最终层的标准攻击相比,针对源模型的中间层是否能提升对抗样本的黑盒迁移性?
  • RQ2在模型中是否存在某个特定的中间层,其扰动能在多种目标模型间带来更高的迁移性?
  • RQ3能否仅使用源模型的内部统计信息选择出最优的迁移性攻击层,而无需在目标模型上进行评估?
  • RQ4在中间层中针对高方差通道进行攻击,是否可通过干扰共享的、可泛化的特征进一步提升迁移性?
  • RQ5ILA 损失函数中的方向保持组件如何影响优化后对抗样本的鲁棒性与迁移性?

主要发现

  • ILA 显著提升了在多种源-目标模型组合下的黑盒迁移性,与基线攻击相比,平均迁移成功率提升高达 10.5 个百分点。
  • 当以 ResNet18 作为源模型时,ILA 在 GoogLeNet 上实现了 55.9% 的攻击成功率,相较于标准 I-FGSM 的 47.3%,提升了 8.6 个百分点。
  • 在针对最具信息量的通道(激活方差最高)进行攻击时,通过 ILA 生成的对抗样本在 GoogLeNet 上实现了 34.5% 的攻击成功率,优于低方差通道攻击。
  • 最优攻击层始终位于特征表示仍具通用性并跨模型共享的区域,通常位于网络中间层,而非最终层。
  • 该方法成功仅基于源模型的层扰动曲线识别出接近最优的攻击层,消除了在超参数调优过程中对目标模型评估的需求。
  • 损失函数中的方向保持组件确保了优化后的对抗样本维持其原始的对抗结构,防止在源模型上性能下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。