Skip to main content
QUICK REVIEW

[논문 리뷰] Projected Randomized Smoothing for Certified Adversarial Robustness

Samuel Pfrommer, Brendon G. Anderson|arXiv (Cornell University)|2023. 09. 25.
Adversarial Robustness in Machine LearningComputer Science인용 수 3
한 줄 요약

이 논문은 입력을 저차원 부분공간에 투영한 후 랜덤화된 스무딩을 적용함으로써 인증 가능한 적대적 로버스트니를 향상시키는 방법인 투영된 랜덤화 스무딩(Projected Randomized Smoothing)을 제안한다. 낮은 차원에서 스무딩을 수행함으로써 데이터 다양체에 수직인 노이즈에 대해 인증 가능한 로버스트니를 달성하며, 이로 인해 CIFAR-10 및 SVHN에서 최신 기술 대비 체적 차원으로 수백만 배 이상 큰 인증 영역을 확보한다.

ABSTRACT

Randomized smoothing is the current state-of-the-art method for producing provably robust classifiers. While randomized smoothing typically yields robust $\ell_2$-ball certificates, recent research has generalized provable robustness to different norm balls as well as anisotropic regions. This work considers a classifier architecture that first projects onto a low-dimensional approximation of the data manifold and then applies a standard classifier. By performing randomized smoothing in the low-dimensional projected space, we characterize the certified region of our smoothed composite classifier back in the high-dimensional input space and prove a tractable lower bound on its volume. We show experimentally on CIFAR-10 and SVHN that classifiers without the initial projection are vulnerable to perturbations that are normal to the data manifold and yet are captured by the certified regions of our method. We compare the volume of our certified regions against various baselines and show that our method improves on the state-of-the-art by many orders of magnitude.

연구 동기 및 목표

  • 입력 차원이 증가함에 따라 인증 가능한 로버스트니가 계승적으로 악화되는 랜덤화 스무딩의 차원의 저주 문제를 해결한다.
  • 입력 데이터를 저차원 부분공간에 투영하여 통계적으로 의미 없는 특징을 제거함으로써 다양체 가설을 활용한다.
  • 기존 입력 공간에서의 인증 영역에 이론적 보장을 제공하면서도, 실용적인 인증 가능성을 유지한다.
  • 기존의 스무딩 분류기가 다양체에 수직인 방향으로의 노이즈에 취약하다는 것을 입증한다. 이는 제안된 방법에 의해 제거된다.
  • 기존 최고 수준의 기준선(등방성, 이방성, 입력에 의존하는 스무딩 방법 포함)에 비해 훨씬 큰 인증 영역 체적을 달성한다.

제안 방법

  • 학습 데이터의 최상위 주성분에 의해 생성되는 저차원 선형 부분공간에 고차원 입력을 투영한다.
  • 등방성 가우시안 노이즈를 사용하여 투영된 공간에서 랜덤화 스무딩을 적용함으로써, 저차원 공간에서 인증 가능한 로버스트니를 확보한 스무딩 분류기를 생성한다.
  • 기존 입력 공간에서의 인증 영역을 투영된 공간의 인증 영역의 원상상(preimage)으로 특성화하며, 투영의 영공간(nullspace) 내의 노이즈를 고려한다.
  • 단위 큐브와의 교차 분석을 통해 입력 공간에서의 인증 영역 체적에 대한 실용적인 하한을 유도한다.
  • 두 가지 개선 기법을 도입한다: ℓ∞-정규화된 회귀 문제를 풀고, 닫힌 형태의 반경 조정을 통해 인증 반경 추정치를 향상시킨다.
  • 투영된 공간에서의 인증 영역 내 임의의 노이즈가 입력 공간에서 유효한 안정 영역에 대응함을 증명함으로써 이론적 인증을 보장한다.

실험 결과

연구 질문

  • RQ1랜덤화 스무딩 이전에 입력을 저차원 부분공간에 투영함으로써 고차원 입력 공간에서의 인증 영역 체적이 크게 증가할 수 있는가?
  • RQ2기존 스무딩 분류기가 다양체의 주성분의 영공간에 위치한 방향으로의 적대적 노이즈에 취약한가?
  • RQ3저차원 공간에서 랜덤화 스무딩을 수행할 경우, 인증 가능한 로버스트니가 입력 공간의 차원이 아닌 부분공간의 차원에 따라 유리하게 스케일링되는가?
  • RQ4투영된 스무딩 프레임워크 하에서 기존 입력 공간의 인증 영역 체적에 대한 실용적인 하한을 도출할 수 있는가?
  • RQ5제안된 방법의 인증 영역 체적은 최신 기술인 등방성, 이방성, 입력에 의존하는 스무딩 기준선과 비교해 정량적으로 어떻게 다른가?

주요 결과

  • CIFAR-10에서 투영된 랜덤화 스무딩은 중앙값 인증 영역 체적 log₁₀(10⁻³¹⁷⁵)을 달성하였으며, 이는 다음으로 우수한 기준선(RS: 10⁻⁴³⁷⁷)보다 1,000배 이상 큰 체적을 확보하였다.
  • SVHN에서는 중앙값 인증 체적이 log₁₀(10⁻¹⁵⁷⁸)을 기록하였으며, RS(10⁻⁴²⁸⁰), ANCER(10⁻⁴⁰³¹), RS4A 기준선에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 이 방법의 인증 영역 체적은 저차원 투영 차원 p에 따라 계승적으로 감소하지만, 경쟁 기준선은 고차원 입력 차원 d에 따라 계승적으로 감소하므로, 이는 체적 증가의 근본적 이유를 설명한다.
  • 주성분의 영공간에 명시적으로 구성된 적대적 예제들이 기존 스무딩 분류기를 성공적으로 속였으며, 이는 다양체에 수직인 방향의 노이즈에 취약함을 확인한다.
  • 청결한 정확도가 높은 편(85.8% on CIFAR-10, 91.4% on SVHN)을 유지하면서도 인증 가능한 로버스트니가 매우 뛰어나, 정확도와 로버스트니 사이의 유리한 트레이드오���을 보여준다.
  • 닫힌 형태의 반경 조정 및 ℓ∞-회귀 개선 기법이 인증 반경 추정치를 향상시켰으며, 특히 후자는 재학습 없이도 로버스트니를 향상시킬 수 있는 실용적인 방법을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.