Skip to main content
QUICK REVIEW

[论文解读] Robust Attacks against Multiple Classifiers

Juan C. Perdomo, Yaron Singer|arXiv (Cornell University)|Jun 6, 2019
Adversarial Robustness in Machine Learning参考文献 32被引用 6
一句话总结

本文提出了一种博弈论框架,通过将交互建模为两人零和博弈,实现对多个分类器的鲁棒对抗性攻击,其中最优攻击通过纳什均衡利用乘法权重更新(MWU)和最优响应预言机求解。该方法显著优于现有基线方法,在ImageNet上将多个分类器的最大准确率降低高达16.8%,在MNIST上降低30%,证明了在对抗性噪声中引入随机化对于鲁棒攻击策略的必要性。

ABSTRACT

We address the challenge of designing optimal adversarial noise algorithms for settings where a learner has access to multiple classifiers. We demonstrate how this problem can be framed as finding strategies at equilibrium in a two-player, zero-sum game between a learner and an adversary. In doing so, we illustrate the need for randomization in adversarial attacks. In order to compute Nash equilibrium, our main technical focus is on the design of best response oracles that can then be implemented within a Multiplicative Weights Update framework to boost deterministic perturbations against a set of models into optimal mixed strategies. We demonstrate the practical effectiveness of our approach on a series of image classification tasks using both linear classifiers and deep neural networks.

研究动机与目标

  • 为解决当学习者使用多个分类器(对单模型攻击更具鲁棒性)时,设计最优对抗性攻击的挑战。
  • 将问题形式化为学习者从多个分类器中选择与添加有界噪声的对抗者之间的两人零和博弈。
  • 证明在对抗性噪声中引入随机化对于实现跨多个分类器的最优攻击性能至关重要,因为确定性攻击在面对多样化决策边界时会失效。
  • 在MWU框架内,为线性分类器和深度神经网络分类器设计高效的最优响应预言机。
  • 通过实证验证该方法在同时欺骗多个分类器方面优于现有方法。

提出的方法

  • 将问题建模为学习者(从多个分类器中选择)与对抗者(添加噪声)之间的零和博弈中的纳什均衡求解,其中对抗者旨在最小化最大分类器准确率。
  • 使用乘法权重更新(MWU)算法通过迭代更新权重来计算最优混合策略(随机化噪声),基于最优响应预言机。
  • 对于线性分类器,利用凸优化构建精确的最优响应预言机,实现对给定分类器混合的最有效欺骗噪声的精确计算。
  • 对于深度神经网络,通过在未定向反向铰链损失的加权和上使用PGD近似最优响应,确保鲁棒性和视觉不可察觉性。
  • 引入凸松弛方法,以处理当分类器数量超过数据维度常数时的NP难情况,保证在多项式时间内获得近似最优解。
  • 通过修改损失函数使框架可推广至神经网络,支持基于梯度的优化,同时保持有界扰动。

实验结果

研究问题

  • RQ1能否使对抗性攻击对具有多样化决策边界的多个分类器具备鲁棒性,而非仅针对单个模型?
  • RQ2在对抗性噪声中引入随机化是否对于在多个分类器上实现最优攻击性能是必要的?
  • RQ3能否利用博弈论均衡概念高效计算针对一组分类器的最优攻击?
  • RQ4在此框架中,如何为线性和深度神经网络分类器构建最优响应预言机?
  • RQ5与现有集成或单体攻击基线相比,基于MWU的确定性攻击增强在提升鲁棒性方面有多大改进?

主要发现

  • 在MNIST上的线性多类模型中,MWU-Oracle方法将分类器的最大准确率降低至16.8%,显著优于次佳方法(Ensemble)的55%。
  • 在ImageNet上的深度神经网络中,MWU-Oracle方法在攻击下实现最大准确率为36%,而最佳单模型攻击为99%,集成基线为55%。
  • 仅使用Oracle基线(无MWU增强)时,MNIST上最大准确率降至30%,ImageNet上降至36%,表明即使无迭代优化也具备强大性能。
  • 运行多轮MWU进一步提升了攻击质量,在ImageNet上使最大准确率额外降低12%,证实了增强策略的有效性。
  • 各类别准确率的均值与最大值之间的差距凸显了最小化最坏情况性能而非平均性能的重要性。
  • 该方法仅需增加20%的噪声预算即可达到集成基线的性能,而后者需增加60%,证明了更高的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。