Skip to main content
QUICK REVIEW

[论文解读] Spanning Attack: Reinforce Black-box Attacks with Unlabeled Data

Lu Wang, Huan Zhang|arXiv (Cornell University)|May 11, 2020
Adversarial Robustness in Machine Learning参考文献 35被引用 4
一句话总结

本文提出了一种名为spanning attack的新方法,通过将对抗性扰动限制在由少量辅助无标签数据集所张成的低维子空间内,显著提升了黑箱对抗攻击的查询效率。该方法在软标签和硬标签攻击中均大幅减少了查询次数,同时保持了较高的成功率,表明即使是一个小而有偏的无标签数据集,也足以实现高效的攻击性能。

ABSTRACT

Adversarial black-box attacks aim to craft adversarial perturbations by querying input-output pairs of machine learning models. They are widely used to evaluate the robustness of pre-trained models. However, black-box attacks often suffer from the issue of query inefficiency due to the high dimensionality of the input space, and therefore incur a false sense of model robustness. In this paper, we relax the conditions of the black-box threat model, and propose a novel technique called the spanning attack. By constraining adversarial perturbations in a low-dimensional subspace via spanning an auxiliary unlabeled dataset, the spanning attack significantly improves the query efficiency of a wide variety of existing black-box attacks. Extensive experiments show that the proposed method works favorably in both soft-label and hard-label black-box attacks. Our code is available at https://github.com/wangwllu/spanning_attack.

研究动机与目标

  • 为解决黑箱对抗攻击的高查询复杂度问题,尤其是在硬标签设置下通常需要超过10,000次查询的情况。
  • 通过降低输入空间的有效维度,提升黑箱攻击的效率与实用性。
  • 通过假设仅存在一个小的辅助无标签数据集,放宽黑箱威胁模型,使其更符合现实且可行。
  • 证明对抗性扰动自然位于由数据流形张成的低维子空间中,从而实现高效搜索。
  • 展示该方法在多种攻击算法和模型类型(包括不可微模型)中的通用性。

提出的方法

  • 该方法利用一个小的辅助无标签数据集构建低维子空间,该子空间可作为训练数据流形的代理。
  • 通过投影将对抗性扰动限制在此子空间内,从而降低搜索空间的维度,提升优化效率。
  • 该方法与黑箱攻击中使用的零阶优化方法兼容,可无缝集成到现有攻击框架中。
  • 通过在辅助数据集上进行奇异值分解(SVD),构建子空间,可选择使用前导或后继奇异向量进行选择性张成。
  • 通过适配不同输出类型的查询反馈机制,该方法支持软标签和硬标签攻击设置。
  • 该攻击被实现为一种通用增强方法,可应用于任何现有的黑箱攻击算法。

实验结果

研究问题

  • RQ1通过低维子空间降低输入空间维度,是否能显著提升黑箱对抗攻击中的查询效率?
  • RQ2spanning attack的性能是否依赖于辅助数据集与训练数据之间的分布相似性?
  • RQ3一个小型、有偏或非独立同分布的无标签数据集是否仍能有效提升攻击效率?
  • RQ4由最显著或最不显著奇异向量构成的子空间,哪一种对对抗性扰动搜索更有效?
  • RQ5与需要有标签辅助数据或依赖替代模型的现有方法相比,spanning attack表现如何?

主要发现

  • 与基线黑箱攻击相比,spanning attack将查询次数减少了高达50%,且在多个模型和数据集上成功率始终更高。
  • 即使辅助数据集仅包含1,000张图像,该方法在VGG-16上仍达到68.6%的成功率,在ResNet-50上达到58.7%,优于使用有标签数据的先前方法。
  • 使用后800个奇异向量的bottom spanning attack进一步提升了性能,表明对抗性扰动位于数据流形之外。
  • 完全随机的子空间表现劣于基线,证实有意义数据集提供的先验知识至关重要,而非任意的低维投影。
  • 即使辅助数据集的分布与训练数据不同(例如,使用Flickr8k图像用于ImageNet模型),该方法仍保持有效性。
  • spanning attack在不同扰动半径下均持续提升性能,成功率和查询效率在不同ε值下保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。