Skip to main content
QUICK REVIEW

[论文解读] Playing the Game of Universal Adversarial Perturbations

Julien Pérolat, Mateusz Malinowski|arXiv (Cornell University)|Sep 20, 2018
Adversarial Robustness in Machine Learning参考文献 23被引用 14
一句话总结

本文提出一种基于博弈论的方法,通过将分类器与对抗者之间的交互建模为两人零和博弈,以训练对通用对抗扰动具有鲁棒性的图像分类器。该方法基于虚构博弈(fictitious play)的扩展,通过迭代整合先前生成的通用扰动来逐步提升鲁棒性,在CIFAR10、CIFAR100和ImageNet上均优于标准对抗训练,尤其在应对通用扰动和对抗补丁方面表现更优。

ABSTRACT

We study the problem of learning classifiers robust to universal adversarial perturbations. While prior work approaches this problem via robust optimization, adversarial training, or input transformation, we instead phrase it as a two-player zero-sum game. In this new formulation, both players simultaneously play the same game, where one player chooses a classifier that minimizes a classification loss whilst the other player creates an adversarial perturbation that increases the same loss when applied to every sample in the training set. By observing that performing a classification (respectively creating adversarial samples) is the best response to the other player, we propose a novel extension of a game-theoretic algorithm, namely fictitious play, to the domain of training robust classifiers. Finally, we empirically show the robustness and versatility of our approach in two defence scenarios where universal attacks are performed on several image classification datasets -- CIFAR10, CIFAR100 and ImageNet.

研究动机与目标

  • 解决当前缺乏针对通用对抗扰动的鲁棒防御机制的问题,此类扰动具有可迁移性且在现实应用中构成真实威胁。
  • 克服标准对抗训练的局限性,后者在大扰动幅度下难以泛化至通用扰动。
  • 开发一种可扩展的防御框架,在保持高标准准确率的同时,实现对通用扰动和对抗补丁的强鲁棒性。
  • 提供首个专门针对空间受限对抗补丁(spatially bounded adversarial patches)设计的防御机制,填补了该领域此前未被解决的威胁空白。
  • 证明该方法可扩展至大规模数据集(如ImageNet),而此前的鲁棒训练方法因计算成本过高而难以应用。

提出的方法

  • 将对抗鲁棒性训练建模为分类器(最小化分类损失)与对抗者(通过通用扰动最大化相同损失)之间的两人零和博弈。
  • 将虚构博弈算法扩展至深度学习场景,其中双方基于对手的历史最优响应来更新策略。
  • 在每个训练步骤中,分类器在干净数据与先前生成的通用扰动混合数据上进行训练,而对抗者则生成新扰动以最大化当前分类器的误分类率。
  • 通过迭代优化生成具有固定L∞-范数约束的通用扰动,确保其在数据集中所有图像上均有效。
  • 将该方法同时应用于通用扰动(作用于整张图像)和通用对抗补丁(在随机位置应用的局部圆形补丁)。
  • 通过随机梯度下降和高效的扰动生成方法实现训练过程的扩展,使该方法在计算需求极高的情况下仍可部署于ImageNet。

实验结果

研究问题

  • RQ1基于虚构博弈的博弈论框架是否能相比标准对抗训练,提升对通用对抗扰动的鲁棒性?
  • RQ2所提出的方法是否在大范围通用扰动下仍能保持高标准准确率,尤其在标准对抗训练失效时?
  • RQ3该方法能否扩展以防御空间局部化的对抗补丁,这一此前在鲁棒性文献中未被解决的威胁?
  • RQ4该方法在大规模数据集(如ImageNet)上是否具备可扩展性,而此前的鲁棒训练方法因计算成本过高而难以应用?
  • RQ5通过虚构博弈整合历史扰动是否比标准对抗训练中仅依赖最新扰动更有效?

主要发现

  • 在CIFAR10上使用16像素的通用扰动时,虚构博弈方法实现了显著更高的鲁棒准确率(超过70%),远超标准对抗训练(低于20%)和SGD(约60%),展现出更优的鲁棒性。
  • 在CIFAR100上使用8像素扰动时,虚构博弈方法的对抗准确率接近标准准确率(超过80%),优于SGD和对抗训练。
  • 该方法在CIFAR100和ImageNet上对对抗补丁实现了最先进水平的鲁棒性,此前尚无针对此类攻击类型的防御方法。
  • 在ImageNet上,该方法成功实现大规模数据扩展,表现出对通用扰动和对抗补丁的改进鲁棒性,同时保持了高标准准确率。
  • 在通用扰动的鲁棒性方面,该方法优于标准对抗训练,即使后者使用了较大的扰动预算。
  • 结果表明,通过虚构博弈整合历史扰动可带来比仅依赖最新扰动的方法更稳定、更具泛化能力的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。