Skip to main content
QUICK REVIEW

[论文解读] Label Universal Targeted Attack

Naveed Akhtar, Mohammad A. A. K. Jalwana|arXiv (Cornell University)|May 27, 2019
Advanced Malware Detection Techniques参考文献 20被引用 4
一句话总结

本文提出标签通用定向攻击(LUTA),一种白盒对抗攻击,通过生成通用扰动,以高概率迫使深度神经网络将任意源类别图像误分类为用户定义的目标类别。通过利用一阶和二阶梯度矩优化扰动,LUTA 在 ImageNet 和 VGGFace 模型上实现了高欺骗率,并在物理世界设置中展现出强大的可迁移性。

ABSTRACT

We introduce Label Universal Targeted Attack (LUTA) that makes a deep model predict a label of attacker's choice for `any' sample of a given source class with high probability. Our attack stochastically maximizes the log-probability of the target label for the source class with first order gradient optimization, while accounting for the gradient moments. It also suppresses the leakage of attack information to the non-source classes for avoiding the attack suspicions. The perturbations resulting from our attack achieve high fooling ratios on the large-scale ImageNet and VGGFace models, and transfer well to the Physical World. Given full control over the perturbation scope in LUTA, we also demonstrate it as a tool for deep model autopsy. The proposed attack reveals interesting perturbation patterns and observations regarding the deep models.

研究动机与目标

  • 开发一种新型对抗攻击,实现对整个源类别图像的通用、定向误分类,使其指向选定目标标签。
  • 通过针对特定源类别与目标类别对,实现对扰动范围的细粒度控制,提升攻击的实际可行性。
  • 通过抑制非源类别上的意外误分类,降低检测风险,保持隐蔽性。
  • 利用攻击作为模型自检工具,探索深度模型内部机理,揭示其学习到的分类边界特征。
  • 验证 LUTA 扰动在真实世界物理部署中的可迁移性,证明其实际威胁性。

提出的方法

  • LUTA 采用基于随机梯度的优化方法,最大化源类别中所有图像在目标类别上的对数概率。
  • 通过一阶和二阶梯度矩(类似 Adam 优化)实现自适应优化,高效学习扰动。
  • 通过在 ℓ∞ 或 ℓ2 范数内约束扰动,实现受控且不可察觉的扰动;或允许无界探索以用于模型分析。
  • 在优化过程中主动抑制非源类别的预测结果,避免被检测并保持隐蔽性。
  • 该方法在白盒设置下运行,可完全访问模型的梯度和架构信息。
  • 评估了三种变体:ℓ∞ 有界、ℓ2 有界和无界 LUTA,其中无界版本用于探测模型决策区域。

实验结果

研究问题

  • RQ1能否构建一种通用对抗扰动,实现对给定源类别所有图像的普遍误分类,使其指向特定目标类别?
  • RQ2该攻击在 VGG-16、ResNet-50 和 Inception-V3 等多样化深度学习模型上的 ImageNet 数据集上,是否能保持高欺骗率?
  • RQ3LUTA 扰动在无需数字增强的情况下,能否有效迁移到真实物理世界部署?
  • RQ4通过分析 LUTA 生成的扰动模式,能否揭示深度模型内部决策边界的内在特征?
  • RQ5使用梯度矩(一阶和二阶)是否能显著提升攻击的效率与收敛速度?

主要发现

  • 在 ℓ∞ 和 ℓ2 约束下,LUTA 在 VGG-16、ResNet-50、Inception-V3 和 MobileNet-V2 等 ImageNet 模型上实现了 99% 的欺骗率。
  • 无界 LUTA 变体揭示了清晰的扰动模式,可追踪语义相关类别间的迁移路径,例如从 'car' 到 'bus' 经由中间的交通类。
  • 物理世界实验表明,LUTA 扰动在打印后通过实时网络摄像头查看时仍保持有效性,证明其无需后处理即可实现强可迁移性。
  • 使用梯度矩(一阶和二阶)显著提升了优化效率,减少了达到高欺骗率所需的迭代次数。
  • 该攻击成功抑制了非源类别上的误分类,显著降低检测风险,确保部署过程中的隐蔽性。
  • LUTA 通过可视化整个类别区域如何被操纵,实现了模型自检,揭示了深度模型决策边界中的几何与语义结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。