[논문 리뷰] Provably Adversarially Robust Nearest Prototype Classifiers
이 논문은 ℓ₁, ℓ₂, ℓ∞ 및 인지적 LPIPS 메트릭을 포함한 여러 위협 모델 하에서 정확하고 스케일러블한 강건성 인증을 제공하는 증명 가능하게 강건한 최근접 프로토타입 분류기(PNPC)를 제안한다. 최소 적대적 변형에 대한 개선된 하한을 유도하고 도메인 제약 조건을 통합함으로써, MNIST와 CIFAR-10에서 기존 표준 신경망 및 이전의 인증 방법을 능가하는 최신 기술(SOTA)의 인증 강건 정확도를 달성한다.
Nearest prototype classifiers (NPCs) assign to each input point the label of the nearest prototype with respect to a chosen distance metric. A direct advantage of NPCs is that the decisions are interpretable. Previous work could provide lower bounds on the minimal adversarial perturbation in the $\ell_p$-threat model when using the same $\ell_p$-distance for the NPCs. In this paper we provide a complete discussion on the complexity when using $\ell_p$-distances for decision and $\ell_q$-threat models for certification for $p,q \in \{1,2,\infty\}$. In particular we provide scalable algorithms for the \emph{exact} computation of the minimal adversarial perturbation when using $\ell_2$-distance and improved lower bounds in other cases. Using efficient improved lower bounds we train our Provably adversarially robust NPC (PNPC), for MNIST which have better $\ell_2$-robustness guarantees than neural networks. Additionally, we show up to our knowledge the first certification results w.r.t. to the LPIPS perceptual metric which has been argued to be a more realistic threat model for image classification than $\ell_p$-balls. Our PNPC has on CIFAR10 higher certified robust accuracy than the empirical robust accuracy reported in (Laidlaw et al., 2021). The code is available in our repository.
연구 동기 및 목표
- 다양한 위협 모델 하에서 정확하고 스케일러블한 강건성 인증을 제공하는 증명 가능 강건 최근접 프로토타입 분류기(PNPC)를 개발하는 것.
- 특히 ℓ₂ 및 ℓ∞ 메트릭에 대해, ℓp-거리 기반 최근접 프로토타입 분류기(NPC)의 기존 하한을 개선하는 것.
- ℓp-노름을 초월해 인간의 인식을 더 잘 반영하는 LPIPS와 같은 인지적 메트릭으로의 강건성 인증을 확장하는 것.
- 표준 벤치마크에서 랜덤화 스무딩 및 다중 노름 인증 모델을 포함한 이전 방법보다 높은 인증 강건 정확도를 달성하는 것.
- ℓ₂, ℓ₁ 및 ℓ∞ 강건성에 대한 빠르게 계산 가능한 하한을 유도함으로써 효율적인 훈련 및 인증을 가능하게 하는 것.
제안 방법
- 기존 연구에서 사용된 반노름의 제한을 초월하여 일반적인 반거리(measure)를 사용하여 NPC에 대한 최소 적대적 변형에 대한 개선된 하한을 도출한다.
- NPC에서 최소 ℓ₂-편향의 정확한 계산을 위한 스케일러블 알고리즘을 제안하여 강건성 보장을 갖춘 효율적 훈련을 가능하게 한다.
- 입력 도메인 제약 조건(예: 이미지의 [0,1]^d)을 통합하여 ℓ₂-강건성 인증 하한을 강화한다.
- ℓ₁ 및 ℓ∞-NPC에 대한 새로운 하한을 도입하여 이전 작업을 개선하고 다중 노름 강건성 인증을 가능하게 한다.
- 최근접 프로토타입 분류기를 LPIPS 인지적 메트릭을 반거리로 사용하도록 변형하여 더 현실적인 위협 모델 하에서의 인증을 가능하게 한다.
- 선택된 메트릭 및 위협 모델 하에서 인증 강건 정확도를 최대화하도록 프로토타입을 최적화하는 훈련 절차를 활용한다.
실험 결과
연구 질문
- RQ1ℓp 및 비-ℓp 메트릭 하에서 최근접 프로토타입 분류기의 최소 적대적 변형에 대한 더 날카우며 스케일러블한 하한을 도출할 수 있는가?
- RQ2ℓp-노름보다 인간의 인식을 더 잘 모델링하는 LPIPS 인지적 메트릭 하에서 NPC에 대해 증명 가능 강건성 인증을 달성할 수 있는가?
- RQ3PNPC는 랜덤화 스무딩 및 다중 노름 인증 모델을 포함한 최신 기술 방법보다 더 높은 인증 강건 정확도를 달성할 수 있는가?
- RQ4입력 도메인 제약 조건의 통합이 NPC에서 ℓ₂-강건성 인증의 날카움을 어떻게 향상시키는가?
- RQ5통합 프레임워크를 사용하여 ℓ₁, ℓ₂, ℓ∞ 등 여러 위협 모델에 대해 효율적으로 훈련 및 인증할 수 있는가?
주요 결과
- 큰 편향 반경에서, ℓ₂-PNPC는 랜덤화 스무딩을 포함한 이전에 보고된 모든 모델보다 MNIST에서 더 높은 ℓ₂-강건 정확도를 달성한다.
- CIFAR-10에서 ℓ₂-PNPC는 ε₂ = 0.1에서 41.9%의 인증 강건 정확도를 달성하여, (Laidlaw 등, 2021)에서 보고된 적대적으로 훈련된 ResNet-50의 경험적 강건 정확도를 능가한다.
- ℓ₂-PNPC는 ℓ₁, ℓ₂ 및 ℓ∞ 위협 모델의 합집합 하에서 32.7%의 인증 강건 정확도를 달성하여 MMR-Univ 기준을 초월한다.
- ℓ₁ 및 ℓ∞-NPC에 대해 저자들이 새로운 하한을 도출하여 이전 작업을 개선하고 더 날카운 인증을 가능하게 하였다.
- LPIPS 메트릭을 사용한 PNPC는 CIFAR-10에서 적대적으로 훈련된 ResNet-50보다 더 높은 청소정확도 및 인증 강건 정확도를 달성하여, 인지적 메트릭이 인증에 실현 가능함을 보여준다.
- ℓ₂-NPC에 대해 ℓ₁ 및 ℓ∞ 강건성의 정확한 인증이 달성되어 다중 노름 강건성 보장을 더 날카운 방식으로 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.