[论文解读] Nonlinear Projection Based Gradient Estimation for Query Efficient Blackbox Attacks
本文提出 NonLinear-BA,一种通过深度生成模型(VAEs、GANs、自编码器)进行非线性投影以在低维空间中估计梯度的查询高效黑盒对抗攻击方法。通过理论分析余弦相似度边界和查询复杂度,该方法在 ImageNet、CIFAR-10、MNIST 和 CelebA 上实现了 100% 的攻击成功率,且查询次数和扰动幅度显著少于当前最先进方法,包括对商业 MEGVII Face++ API 的攻击。
Gradient estimation and vector space projection have been studied as two distinct topics. We aim to bridge the gap between the two by investigating how to efficiently estimate gradient based on a projected low-dimensional space. We first provide lower and upper bounds for gradient estimation under both linear and nonlinear projections, and outline checkable sufficient conditions under which one is better than the other. Moreover, we analyze the query complexity for the projection-based gradient estimation and present a sufficient condition for query-efficient estimators. Built upon our theoretic analysis, we propose a novel query-efficient Nonlinear Gradient Projection-based Boundary Blackbox Attack (NonLinear-BA). We conduct extensive experiments on four image datasets: ImageNet, CelebA, CIFAR-10, and MNIST, and show the superiority of the proposed methods compared with the state-of-the-art baselines. In particular, we show that the projection-based boundary blackbox attacks are able to achieve much smaller magnitude of perturbations with 100% attack success rate based on efficient queries. Both linear and nonlinear projections demonstrate their advantages under different conditions. We also evaluate NonLinear-BA against the commercial online API MEGVII Face++, and demonstrate the high blackbox attack performance both quantitatively and qualitatively. The code is publicly available at https://github.com/AI-secure/NonLinear-BA.
研究动机与目标
- 通过分析低维投影对梯度估计质量的影响,弥合梯度估计与向量空间投影之间的联系。
- 理论上推导在线性与非线性投影下,估计梯度与真实梯度之间余弦相似度的边界。
- 识别基于投影方法实现查询高效梯度估计的充分条件。
- 开发一种实用的、查询高效的黑盒攻击框架,利用非线性投影。
- 在多样化数据集和真实世界 API(包括 MEGVII Face++)上实证验证该方法。
提出的方法
- 提出一种通用框架,通过从低维子空间到原始梯度空间的向量空间投影实现梯度估计。
- 使用深度生成模型(VAEs、GANs、自编码器)作为非线性投影函数,将采样的潜在向量映射到高维扰动方向。
- 采用蒙特卡洛梯度估计方法,通过查询目标模型生成扰动,其中扰动方向由投影方向决定。
- 利用泰勒展开和采样分布分析,分析估计梯度与真实梯度之间的余弦相似度,推导理论边界。
- 引入代理指标 ω,用于衡量预测与梯度方向符号冲突的扰动比例,用以评估估计质量。
- 在边界攻击设置中应用该方法,通过迭代优化对抗样本,同时最小化查询次数和扰动幅度。
实验结果
研究问题
- RQ1能否通过从低维子空间的投影有效实现梯度估计?其估计质量的理论边界是什么?
- RQ2在提升估计梯度与真实梯度之间余弦相似度的下界方面,非线性投影相较于线性投影有何优势?
- RQ3基于投影的梯度估计中实现查询效率的条件是什么?这些条件如何验证?
- RQ4基于非线性投影的梯度估计是否能带来更高效的黑盒攻击,实现更低的查询次数和更小的扰动?
- RQ5所提方法在真实世界商业 API(如 MEGVII Face++)上的表现如何?
主要发现
- NonLinear-BA 在 ImageNet、CelebA、CIFAR-10 和 MNIST 上实现了 100% 的攻击成功率,且查询次数显著少于当前最先进基线方法。
- 该方法生成的对抗样本具有更小的扰动幅度(以 MSE 衡量),表明其具有更高的不可察觉性。
- 在特定条件下,非线性投影在余弦相似度下界方面优于线性投影,体现了其理论优越性。
- 代理指标 ω 在 ImageNet、CIFAR-10 和 MNIST 上与余弦相似度表现出强负相关性,验证了其作为估计质量指示器的有效性。
- 在 MEGVII Face++ API 上的实证结果证实了方法的高攻击有效性,无论在定量还是定性层面,均在多样化图像对上表现优异。
- 理论分析表明,非线性投影可实现严格高于线性投影的余弦相似度下界,为更优估计提供了理论基础。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。