Skip to main content
QUICK REVIEW

[论文解读] Second-Order Adversarial Attack and Certifiable Robustness

Bai Li, Changyou Chen|arXiv (Cornell University)|Sep 10, 2018
Adversarial Robustness in Machine Learning被引用 49
一句话总结

本文提出了一种新型二阶对抗攻击,显著降低了最先进对抗训练模型的准确率,从而推动了可认证鲁棒性新框架的发展。该方法能够推导出模型在对抗样本下的可证明准确率下界,相较于先前防御方法,在相同攻击下展现出更高的鲁棒性和准确率。

ABSTRACT

We propose a powerful second-order attack method that outperforms existing attack methods on reducing the accuracy of state-of-the-art defense models based on adversarial training. The effectiveness of our attack method motivates an investigation of provable robustness of a defense model. To this end, we introduce a framework that allows one to obtain a certifiable lower bound on the prediction accuracy against adversarial examples. We conduct experiments to show the effectiveness of our attack method. At the same time, our defense models obtain higher accuracies compared to previous works under our proposed attack.

研究动机与目标

  • 开发一种比现有方法更有效的对抗攻击方法,以更显著地降低鲁棒训练模型的准确率。
  • 研究在日益强大的对抗攻击下,防御模型的可证明鲁棒性。
  • 设计一种可提供模型在对抗扰动下准确率可证明下界的框架。
  • 在新攻击下评估防御模型,并与先前工作相比展示性能的提升。

提出的方法

  • 本文提出一种利用模型损失曲面曲率信息的二阶攻击,以生成更有效的对抗样本。
  • 将攻击形式化为双层优化问题,通过优化扰动以最大化模型损失,同时满足扰动约束。
  • 使用海森向量乘积计算二阶梯度,以改进扰动搜索方向。
  • 提出一种新颖的鲁棒性认证框架,可为模型在对抗扰动下的准确率提供数学上可证明的下界。
  • 该认证框架设计为可扩展,并适用于通过对抗训练训练出的模型。

实验结果

研究问题

  • RQ1所提出的二阶攻击在降低最先进对抗训练模型准确率方面的有效性如何?
  • RQ2能否利用所提出的框架在对抗扰动下推导出模型准确率的可证明下界?
  • RQ3在新攻击下训练的防御模型在准确率和鲁棒性方面与以往防御方法相比表现如何?
  • RQ4二阶攻击在多大程度上暴露了当前对抗训练防御的漏洞?

主要发现

  • 所提出的二阶攻击在降低鲁棒训练模型准确率方面,相较于现有的一阶和二阶攻击方法具有更高的成功率。
  • 在新攻击下训练的防御模型在保持强鲁棒性的同时,比以往防御方法具有更高的干净准确率。
  • 所提出的认证框架成功提供了模型准确率的可认证下界,为对抗样本提供了数学保证。
  • 实证结果证实,与先前方法相比,新攻击更具有效性,尤其在具有强防御能力的模型上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。