Skip to main content
QUICK REVIEW

[论文解读] Black-Box Adversarial Attack with Transferable Model-based Embedding

Zhichao Huang, Tong Zhang|arXiv (Cornell University)|Nov 17, 2019
Adversarial Robustness in Machine Learning参考文献 39被引用 49
一句话总结

TREMBA通过在源模型上训练生成器并在嵌入空间进行NES-based搜索来攻击未知目标,学习一个低维嵌入以生成可转移的对抗扰动,从而提高查询效率和成功率,即使在有防御的模型和真实API上也能有效。

ABSTRACT

We present a new method for black-box adversarial attack. Unlike previous methods that combined transfer-based and scored-based methods by using the gradient or initialization of a surrogate white-box model, this new method tries to learn a low-dimensional embedding using a pretrained model, and then performs efficient search within the embedding space to attack an unknown target network. The method produces adversarial perturbations with high level semantic patterns that are easily transferable. We show that this approach can greatly improve the query efficiency of black-box adversarial attack across different target network architectures. We evaluate our approach on MNIST, ImageNet and Google Cloud Vision API, resulting in a significant reduction on the number of queries. We also attack adversarially defended networks on CIFAR10 and ImageNet, where our method not only reduces the number of queries, but also improves the attack success rate.

研究动机与目标

  • 提出在可转移性和查询效率之间取得平衡的黑盒攻击动机。
  • 提出一个两阶段框架(基于生成器的嵌入和 NES 搜索)以攻击未知目标网络。
  • 证明嵌入空间扰动捕捉到在模型之间可转移的高级语义模式。
  • 证明在未防御和防御性数据集上的有效性,包括真实世界 API。

提出的方法

  • 训练一个由 E (encoder) 和 D (decoder) 构成的编码器-解码器生成器 G,通过 delta = epsilon * tanh(D(E(x))) 产生扰动。
  • 在白盒源网络 Fs 上使用铰链损失(无目标或定目标)如 C&W 公式那样来训练 G,以塑造能够欺骗 Fs 的扰动。
  • 在低维嵌入 z 上使用 NES(自然进化策略)进行黑盒搜索,以找到能够欺骗未知目标 Ft 的扰动,利用梯度估计更新 z,且不进行符号归一化。
  • 从 z0 = E(x) 开始,迭代使用 NES 导出的梯度更新 zt,然后输出 delta = epsilon * tanh(D(zt))。
  • 在 z 周围使用高斯扰动模型,进行采样并进行裁剪步骤,以使 delta 保持在 L-infinity 预算内;同时处理无目标和有目标的损失。
  • 解释嵌入空间搜索为何由于从 Fs 学到的高级可转移语义而加速找到有效对抗模式。

实验结果

研究问题

  • RQ1能否从预训练源网络学习的低维嵌入实现对未知目标网络的高效黑盒攻击?
  • RQ2在嵌入空间生成的扰动是否表现出跨架构和防御的高度语义模式?
  • RQ3在未防御和防御模型以及真实世界 API 上,TREMBA 在查询效率和成功率方面的表现如何?

主要发现

  • 与基线黑盒攻击相比,TREMBA 在 MNIST 和 ImageNet 上将查询次数降低最多约 2–6 倍。
  • TREMBA 产生的扰动表现出高级语义模式(例如类似目标类别特征的模式),并在不同目标模型之间具备良好转移性。
  • 在防御模型(CIFAR-10 和 ImageNet)上,TREMBA 以显著更少的查询获得更高的成功率,优于 including AutoZOOM 和 P-RGF 变体在内的竞争方法。
  • 在 Google Cloud Vision API 上,TREMBA 在查询次数显著减少的情况下取得更高的成功率。
  • 使用优化起点 z0* (OSP) 在防御模型上进一步提升性能,尤其在低查询次数下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。