[论文解读] Provably Adversarially Robust Nearest Prototype Classifiers
本文提出可证明对抗鲁棒的最近原型分类器(PNPC),可在多种威胁模型下实现精确且可扩展的鲁棒性认证,包括 ℓ₁、ℓ₂、ℓ∞ 和感知 LPIPS 指标。通过推导最小对抗扰动的改进下界并整合领域约束,PNPC 在 MNIST 和 CIFAR-10 上实现了最先进的认证鲁棒准确率,优于标准神经网络和先前的认证方法。
Nearest prototype classifiers (NPCs) assign to each input point the label of the nearest prototype with respect to a chosen distance metric. A direct advantage of NPCs is that the decisions are interpretable. Previous work could provide lower bounds on the minimal adversarial perturbation in the $\ell_p$-threat model when using the same $\ell_p$-distance for the NPCs. In this paper we provide a complete discussion on the complexity when using $\ell_p$-distances for decision and $\ell_q$-threat models for certification for $p,q \in \{1,2,\infty\}$. In particular we provide scalable algorithms for the \emph{exact} computation of the minimal adversarial perturbation when using $\ell_2$-distance and improved lower bounds in other cases. Using efficient improved lower bounds we train our Provably adversarially robust NPC (PNPC), for MNIST which have better $\ell_2$-robustness guarantees than neural networks. Additionally, we show up to our knowledge the first certification results w.r.t. to the LPIPS perceptual metric which has been argued to be a more realistic threat model for image classification than $\ell_p$-balls. Our PNPC has on CIFAR10 higher certified robust accuracy than the empirical robust accuracy reported in (Laidlaw et al., 2021). The code is available in our repository.
研究动机与目标
- 开发一种可证明鲁棒的最近原型分类器(PNPC),在多种威胁模型下提供精确且可扩展的对抗鲁棒性认证。
- 改进基于 ℓp 距离的最近原型分类器中最小对抗扰动的现有下界,尤其针对 ℓ₂ 和 ℓ∞ 指标。
- 将认证鲁棒性扩展至 ℓp-范数之外的感知指标(如 LPIPS),以更真实地反映图像分类中的人类感知。
- 在标准基准上实现高于先前方法(包括随机平滑和多范数认证模型)的认证鲁棒准确率。
- 通过推导 ℓ₂、ℓ₁ 和 ℓ∞ 鲁棒性的快速可计算下界,实现高效训练与认证。
提出的方法
- 利用通用半度量推导最近原型分类器中最小对抗扰动的改进下界,突破以往研究中仅使用半范数的局限。
- 提出可扩展的算法,精确计算最近原型分类器中最小 ℓ₂ 扰动,实现带鲁棒性保证的高效训练。
- 整合输入域约束(如图像的 [0,1]^d),以收紧 ℓ₂ 鲁棒性认证边界。
- 提出针对 ℓ₁ 和 ℓ∞ 的新型下界,优于先前工作,支持多范数鲁棒性认证。
- 将最近原型分类器适配为使用 LPIPS 感知度量作为半度量,支持在更现实的威胁模型下进行认证。
- 采用一种训练过程,通过优化原型以在所选度量和威胁模型下最大化认证鲁棒准确率。
实验结果
研究问题
- RQ1我们能否为基于 ℓp 和非 ℓp 度量的最近原型分类器,推导出更紧致且更可扩展的最小对抗扰动下界?
- RQ2我们能否在 LPIPS 感知度量下实现最近原型分类器的可证明鲁棒性认证,该度量相比 ℓp-范数更能反映人类感知?
- RQ3PNPC 能否在认证鲁棒准确率上超越最先进方法,包括使用随机平滑的神经网络和多范数认证模型?
- RQ4输入域约束的整合如何提升最近原型分类器中 ℓ₂ 鲁棒性认证边界的紧致性?
- RQ5我们能否通过统一框架高效训练并认证多种威胁模型(ℓ₁、ℓ₂、ℓ∞)下的最近原型分类器?
主要发现
- 在 MNIST 上,ℓ₂-PNPC 在大扰动半径下实现的 ℓ₂ 鲁棒准确率高于此前报告的所有模型,包括随机平滑方法。
- 在 CIFAR-10 上,ℓ₂-PNPC 在 ε₂ = 0.1 时实现 41.9% 的认证鲁棒准确率,超过 Laidlaw 等人(2021)提出的对抗训练 ResNet-50 的实际鲁棒准确率。
- ℓ₂-PNPC 在 ℓ₁、ℓ₂ 和 ℓ∞ 威胁模型的联合下实现 32.7% 的认证鲁棒准确率,优于 MMR-Univ 基线。
- 对于 ℓ₁ 和 ℓ∞ 的最近原型分类器,作者推导出新颖的下界,优于先前工作,支持更紧致的认证。
- 使用 LPIPS 度量的 PNPC 在 CIFAR-10 上实现高于对抗训练 ResNet-50 的干净准确率与认证鲁棒准确率,证明了感知度量在认证中的可行性。
- 实现了对 ℓ₂-NPC 的 ℓ₁ 和 ℓ∞ 鲁棒性的精确认证,支持多范数鲁棒性保证并提升了紧致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。