Skip to main content
QUICK REVIEW

[论文解读] Evading Adversarial Example Detection Defenses with Orthogonal Projected Gradient Descent

Oliver Bryniarski, Nabeel Hingun|arXiv (Cornell University)|Jun 28, 2021
Adversarial Robustness in Machine Learning被引用 15
一句话总结

本文提出正交投影梯度下降(OPGD),一种新颖的攻击方法,通过选择性地将梯度下降应用于分类器或检测器损失,避免扰动浪费,从而提升对抗样本生成效果。该方法成功绕过了四种最先进的检测防御机制,在保持检测AUC低于0.5(低于随机猜测水平)的同时,将分类器准确率降至0%。

ABSTRACT

Evading adversarial example detection defenses requires finding adversarial examples that must simultaneously (a) be misclassified by the model and (b) be detected as non-adversarial. We find that existing attacks that attempt to satisfy multiple simultaneous constraints often over-optimize against one constraint at the cost of satisfying another. We introduce Orthogonal Projected Gradient Descent, an improved attack technique to generate adversarial examples that avoids this problem by orthogonalizing the gradients when running standard gradient-based attacks. We use our technique to evade four state-of-the-art detection defenses, reducing their accuracy to 0% while maintaining a 0% detection rate.

研究动机与目标

  • 为解决同时欺骗分类器和检测防御机制的对抗样本生成挑战。
  • 克服先前攻击方法在过度优化一个约束(如误分类)的同时,牺牲另一约束(如绕过检测)的局限性。
  • 开发一种更简单、更有效的攻击策略,根据哪个约束尚未满足,选择性地优化梯度。
  • 在四种此前未被攻破的检测防御机制上评估该方法,证明其鲁棒性和泛化能力。
  • 提供实用的开源实现,以支持未来在对抗鲁棒性领域的研究与评估。

提出的方法

  • 该方法通过正交化梯度更新,对标准投影梯度下降进行改进,每次迭代中选择性地将梯度应用于分类器损失或检测器损失。
  • 不采用带超参数λ的联合损失函数最小化,OPGD根据哪个约束尚未满足,交替优化f(x)和g(x)。
  • 在每次迭代中,算法同时计算f和g的梯度,然后应用最能直接减少未满足约束的梯度。
  • 该方法确保扰动始终用于改进最关键约束,防止在已满足目标上浪费优化。
  • 对于可微分检测器(如SPAM),该方法使用检测器特征提取的可微分近似,以实现梯度反向传播。
  • 该攻击仅需对标准PGD进行少量代码修改,可轻松集成到现有的对抗攻击流水线中。

实验结果

研究问题

  • RQ1能否设计一种基于梯度的攻击方法,以高效满足对抗样本生成中的多个同时约束?
  • RQ2选择性正交梯度下降是否优于联合损失优化,在攻击检测防御机制方面表现更优?
  • RQ3OPGD是否能在维持低检测率的同时,成功绕过四种此前未被攻破的检测防御机制?
  • RQ4在标准威胁模型和不同扰动范数(如ℓ∞、ℓ2)下,OPGD的性能如何?
  • RQ5梯度正交性对扰动效率和约束满足有何影响?

主要发现

  • OPGD在所有四种评估的检测防御机制上,均成功将受保护分类器的准确率降至0%。
  • 该攻击在所有防御机制上均保持检测AUC低于0.5,表明性能低于随机猜测水平。
  • 对于SPAM检测器,该攻击在5%假阳性率下实现了98.8%的成功率,显著优于原始防御的最佳攻击(3%)。
  • 该方法在Honeypot防御、Dense Layer Analysis和Sensitivity Inconsistency Detector上均实现了100%的攻击成功率。
  • 该攻击运行高效,在CIFAR-10上仅需数分钟,在ImageNet上仅需数小时,且仅使用单张GPU。
  • SPAM检测器的可微分近似使基于梯度的优化成为可能,从而能够攻击此前不可微的防御机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。