Skip to main content
QUICK REVIEW

[论文解读] Provably Adversarially Robust Nearest Prototype Classifiers

Václav Voràček, Matthias Hein|arXiv (Cornell University)|Jul 14, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出可证明对抗鲁棒的最近原型分类器(PNPC),可在多种威胁模型下实现精确且可扩展的鲁棒性认证,包括 ℓ₁、ℓ₂、ℓ∞ 和感知 LPIPS 指标。通过推导最小对抗扰动的改进下界并整合领域约束,PNPC 在 MNIST 和 CIFAR-10 上实现了最先进的认证鲁棒准确率,优于标准神经网络和先前的认证方法。

ABSTRACT

Nearest prototype classifiers (NPCs) assign to each input point the label of the nearest prototype with respect to a chosen distance metric. A direct advantage of NPCs is that the decisions are interpretable. Previous work could provide lower bounds on the minimal adversarial perturbation in the $\ell_p$-threat model when using the same $\ell_p$-distance for the NPCs. In this paper we provide a complete discussion on the complexity when using $\ell_p$-distances for decision and $\ell_q$-threat models for certification for $p,q \in \{1,2,\infty\}$. In particular we provide scalable algorithms for the \emph{exact} computation of the minimal adversarial perturbation when using $\ell_2$-distance and improved lower bounds in other cases. Using efficient improved lower bounds we train our Provably adversarially robust NPC (PNPC), for MNIST which have better $\ell_2$-robustness guarantees than neural networks. Additionally, we show up to our knowledge the first certification results w.r.t. to the LPIPS perceptual metric which has been argued to be a more realistic threat model for image classification than $\ell_p$-balls. Our PNPC has on CIFAR10 higher certified robust accuracy than the empirical robust accuracy reported in (Laidlaw et al., 2021). The code is available in our repository.

研究动机与目标

  • 开发一种可证明鲁棒的最近原型分类器(PNPC),在多种威胁模型下提供精确且可扩展的对抗鲁棒性认证。
  • 改进基于 ℓp 距离的最近原型分类器中最小对抗扰动的现有下界,尤其针对 ℓ₂ 和 ℓ∞ 指标。
  • 将认证鲁棒性扩展至 ℓp-范数之外的感知指标(如 LPIPS),以更真实地反映图像分类中的人类感知。
  • 在标准基准上实现高于先前方法(包括随机平滑和多范数认证模型)的认证鲁棒准确率。
  • 通过推导 ℓ₂、ℓ₁ 和 ℓ∞ 鲁棒性的快速可计算下界,实现高效训练与认证。

提出的方法

  • 利用通用半度量推导最近原型分类器中最小对抗扰动的改进下界,突破以往研究中仅使用半范数的局限。
  • 提出可扩展的算法,精确计算最近原型分类器中最小 ℓ₂ 扰动,实现带鲁棒性保证的高效训练。
  • 整合输入域约束(如图像的 [0,1]^d),以收紧 ℓ₂ 鲁棒性认证边界。
  • 提出针对 ℓ₁ 和 ℓ∞ 的新型下界,优于先前工作,支持多范数鲁棒性认证。
  • 将最近原型分类器适配为使用 LPIPS 感知度量作为半度量,支持在更现实的威胁模型下进行认证。
  • 采用一种训练过程,通过优化原型以在所选度量和威胁模型下最大化认证鲁棒准确率。

实验结果

研究问题

  • RQ1我们能否为基于 ℓp 和非 ℓp 度量的最近原型分类器,推导出更紧致且更可扩展的最小对抗扰动下界?
  • RQ2我们能否在 LPIPS 感知度量下实现最近原型分类器的可证明鲁棒性认证,该度量相比 ℓp-范数更能反映人类感知?
  • RQ3PNPC 能否在认证鲁棒准确率上超越最先进方法,包括使用随机平滑的神经网络和多范数认证模型?
  • RQ4输入域约束的整合如何提升最近原型分类器中 ℓ₂ 鲁棒性认证边界的紧致性?
  • RQ5我们能否通过统一框架高效训练并认证多种威胁模型(ℓ₁、ℓ₂、ℓ∞)下的最近原型分类器?

主要发现

  • 在 MNIST 上,ℓ₂-PNPC 在大扰动半径下实现的 ℓ₂ 鲁棒准确率高于此前报告的所有模型,包括随机平滑方法。
  • 在 CIFAR-10 上,ℓ₂-PNPC 在 ε₂ = 0.1 时实现 41.9% 的认证鲁棒准确率,超过 Laidlaw 等人(2021)提出的对抗训练 ResNet-50 的实际鲁棒准确率。
  • ℓ₂-PNPC 在 ℓ₁、ℓ₂ 和 ℓ∞ 威胁模型的联合下实现 32.7% 的认证鲁棒准确率,优于 MMR-Univ 基线。
  • 对于 ℓ₁ 和 ℓ∞ 的最近原型分类器,作者推导出新颖的下界,优于先前工作,支持更紧致的认证。
  • 使用 LPIPS 度量的 PNPC 在 CIFAR-10 上实现高于对抗训练 ResNet-50 的干净准确率与认证鲁棒准确率,证明了感知度量在认证中的可行性。
  • 实现了对 ℓ₂-NPC 的 ℓ₁ 和 ℓ∞ 鲁棒性的精确认证,支持多范数鲁棒性保证并提升了紧致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。