Skip to main content
QUICK REVIEW

[论文解读] Improving Query Efficiency of Black-box Adversarial Attack

Yang Bai, Yuyuan Zeng|arXiv (Cornell University)|Sep 24, 2020
Adversarial Robustness in Machine Learning参考文献 34被引用 7
一句话总结

本文提出 NP-Attack,一种查询高效的黑盒对抗攻击方法,利用神经过程(Neural Processes)通过图像结构信息建模对抗分布。通过结合局部(确定性)和全局(潜在)表征,NP-Attack 相较于先前基于分布的方法(如 ℒ-Attack)将查询次数减少高达 40%,在 ResNet18 上以仅 185 次平均查询实现 CIFAR-10 数据集上 100% 的攻击成功率。

ABSTRACT

Deep neural networks (DNNs) have demonstrated excellent performance on various tasks, however they are under the risk of adversarial examples that can be easily generated when the target model is accessible to an attacker (white-box setting). As plenty of machine learning models have been deployed via online services that only provide query outputs from inaccessible models (e.g. Google Cloud Vision API2), black-box adversarial attacks (inaccessible target model) are of critical security concerns in practice rather than white-box ones. However, existing query-based black-box adversarial attacks often require excessive model queries to maintain a high attack success rate. Therefore, in order to improve query efficiency, we explore the distribution of adversarial examples around benign inputs with the help of image structure information characterized by a Neural Process, and propose a Neural Process based black-box adversarial attack (NP-Attack) in this paper. Extensive experiments show that NP-Attack could greatly decrease the query counts under the black-box setting.

研究动机与目标

  • 解决现有基于查询的黑盒对抗攻击查询复杂度过高的问题,尽管其成功率较高,但限制了实际应用。
  • 通过利用图像中的结构信息建模对抗样本的分布,而非依赖简单的像素级变换,提升查询效率。
  • 利用神经过程(NPs)联合建模局部和全局图像结构,实现更有效且高效的对抗样本生成。
  • 与最先进方法(如 ℒ-Attack 和 ZOO)相比,实现更高攻击成功率的同时显著减少查询次数。
  • 在严格扰动约束下,验证方法在多种架构和数据集(包括 ImageNet)上的泛化能力。

提出的方法

  • 使用神经过程(NP)建模对抗样本的分布,其中编码器捕捉全局上下文,解码器重建局部图像块。
  • 在干净图像上预训练 NP 以学习图像结构的先验,然后在攻击生成过程中通过查询反馈进行微调。
  • 分别或联合优化 NP 的潜在变量(全局上下文)和确定性变量(局部结构),以生成对抗扰动。
  • 采用自然进化策略(NES)对潜在变量和确定性变量进行无梯度优化,实现高效的基于查询的更新。
  • 集成多尺度重建头,处理 32×32×3 的图像块,实现局部化但结构一致的扰动。
  • 使用带有残差连接和 ReLU 激活函数的可微分解码器,在 L∞-有界扰动下从潜在码重建对抗样本。

实验结果

研究问题

  • RQ1通过神经过程利用结构化图像先验建模对抗分布,是否能显著降低黑盒攻击中的查询复杂度?
  • RQ2同时引入局部和全局图像结构信息,是否能提升基于查询的对抗攻击的效率与有效性?
  • RQ3所提出的 NP-Attack 是否在多个数据集和架构上优于现有基于分布的方法(如 ℒ-Attack),在查询效率和攻击成功率方面表现更优?
  • RQ4不同的优化策略(如仅优化潜在变量、仅优化确定性变量,或两者联合优化)如何影响生成对抗样本的质量与查询效率?
  • RQ5在严格 L∞ 扰动约束下,NP-Attack 是否能在高分辨率数据集(如 ImageNet)上实现良好泛化?

主要发现

  • 在 CIFAR-10 上,NP-Attack 在 ResNet18、VGG16 和 WideResNet 上分别仅需 185、294 和 196 次平均查询即可实现 100% 攻击成功率,优于 ℒ-Attack 所需的 311、430 和 335 次查询。
  • 在 MNIST 上,NP-Attack 在相同 L∞ 约束下,生成 90% 对抗样本所需的查询次数较 ℒ-Attack 减少超过 50%。
  • NP-Attack-RZ 变体(同时优化潜在和确定性变量)生成的扰动更具自然感,且在目标中心与背景之间保持空间平衡。
  • 在 ImageNet 上,NP-Attack-R 生成的对抗样本在 L∞ = 0.05 下仍保持不可察觉性,且在真实图像上成功实现无目标攻击。
  • 神经过程的使用相比 ℒ-Attack 中的像素级函数,实现了更高效的分布建模,将查询复杂度降低高达 40%,同时保持或提升攻击成功率。
  • 消融实验表明,优化潜在变量(全局上下文)的性能优于仅优化确定性(局部)路径,而联合优化(NP-Attack-RZ)提供了稳健的性能权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。