Skip to main content
QUICK REVIEW

[논문 리뷰] Higher-Order Certification for Randomized Smoothing

Jeet Mohapatra, Ching-Yun Ko|arXiv (Cornell University)|2020. 10. 13.
Adversarial Robustness in Machine Learning참고 문헌 15인용 수 5
한 줄 요약

이 논문은 랜덤화 스무딩의 고차수 인증 프레임워크를 제안하며, 일阶 및 고차수 정보(예: 기울기, 헤시안)를 활용하여 기존 방법에 비해 훨씬 넓은 인증 가능 안정성 반경을 확보한다. 인증을 중첩 최적화 문제로 재구성하고 일阶 통계량에 대한 고신뢰도 추정기법을 도입함으로써, CIFAR-10 및 ImageNet에서 $σ$-가우시안 스무딩 분류기의 상태최적 인증 정확도를 달성한다. 특히 $σ$-노름 및 부분공간 $σ$-노름 공격에 대해 뛰어난 성능을 보이며, near-optimal $σ$-노름 성능도 유지한다.

ABSTRACT

Randomized smoothing is a recently proposed defense against adversarial attacks that has achieved SOTA provable robustness against $\ell_2$ perturbations. A number of publications have extended the guarantees to other metrics, such as $\ell_1$ or $\ell_\infty$, by using different smoothing measures. Although the current framework has been shown to yield near-optimal $\ell_p$ radii, the total safety region certified by the current framework can be arbitrarily small compared to the optimal. In this work, we propose a framework to improve the certified safety region for these smoothed classifiers without changing the underlying smoothing scheme. The theoretical contributions are as follows: 1) We generalize the certification for randomized smoothing by reformulating certified radius calculation as a nested optimization problem over a class of functions. 2) We provide a method to calculate the certified safety region using $0^{th}$-order and $1^{st}$-order information for Gaussian-smoothed classifiers. We also provide a framework that generalizes the calculation for certification using higher-order information. 3) We design efficient, high-confidence estimators for the relevant statistics of the first-order information. Combining the theoretical contribution 2) and 3) allows us to certify safety region that are significantly larger than the ones provided by the current methods. On CIFAR10 and Imagenet datasets, the new regions certified by our approach achieve significant improvements on general $\ell_1$ certified radii and on the $\ell_2$ certified radii for color-space attacks ($\ell_2$ restricted to 1 channel) while also achieving smaller improvements on the general $\ell_2$ certified radii. Our framework can also provide a way to circumvent the current impossibility results on achieving higher magnitude of certified radii without requiring the use of data-dependent smoothing techniques.

연구 동기 및 목표

  • 현재 랜덤화 스무딩 프레임워크의 한계를 해결하기 위해, 근접한 최적의 $σ$-노름 반경을 가짐에도 불구하고 인증 가능한 안정 영역이 임의로 작아지는 문제를 해결한다.
  • 기본 스무딩 방식을 변경하거나 데이터 의존적 스무딩을 요구하지 않고도 인증 가능 안정성을 향상시킨다.
  • 지역 분류기 성질(예: 기울기, 헤시안)을 활용하는 위협 모델에 종속되지 않는 인증 프레임워크를 개발한다.
  • 표본 복잡도를 낮추기 위해 일阶 정보에 대한 효율적이고 고신뢰도의 추정기법을 설계한다.

제안 방법

  • 인증 반경 계산을 함수의 집합에 대한 중첩 최적화 문제로 재구성함으로써 고차수 정보 사용이 가능하도록 한다.
  • 영차수 및 일阶 정보를 사용하여 $σ$-노름 위협 모델($p=1,2,\infty$)과 그 부분공간 변형에 대해 분석적 공식을 유도한다.
  • 더 높은 안정성 경계를 확보하기 위해 고차수 정보(예: 헤시안)를 활용하는 인증 프레임워크를 일반화한다.
  • 서브가우시안 농도와 경험적 모멘트 경계를 활용하여 일阶 통계량(예: 기울기)에 대한 효율적이고 고신뢰도의 추정기법을 설계한다.
  • 신뢰 구간을 갖춘 몬테카를로 샘플링을 사용하여 $y^{(0)}$ 및 $y^{(1)}$을 추정함으로써 표본 복잡도를 감소시킨다.
  • 각각 $N=200,000$ 및 $N=1,250,000$ 개의 샘플을 사용하여 CIFAR-10 및 ImageNet에서 방법을 검증하였으며, $\alpha=0.001$을 사용한다.

실험 결과

연구 질문

  • RQ1기본 스무딩 측도를 변경하지 않고도 기존 랜덤화 스무딩 방법을 뛰어넘는 인증 가능 안정성을 크게 향상시킬 수 있는가?
  • RQ2스무딩 분류기의 일阶 및 고차수 정보를 활용하여 더 큰 인증 가능한 안정 영역을 달성할 수 있는가?
  • RQ3고차수 정보를 사용하여 기존에 불가능하다고 알려진 더 큰 $σ$-노름 반경 달성을 회피할 수 있는가?
  • RQ4실제 인증에 적합한 일阶 통계량에 대한 고신뢰도이면서 표본 복잡도가 낮은 추정기법을 어떻게 구성할 수 있는가?
  • RQ5제안된 프레임워크는 다른 위협 모델에서 성능을 향상시키는 동안 $σ$-노름에 대한 근접 최적의 안정성을 유지하는가?

주요 결과

  • 제안된 방법은 CIFAR-10 및 ImageNet에서 $σ$-노름 및 부분공간 $σ$-노름 공격에 대해 상당한 인증 정확도 향상을 보이며, 훨씬 넓은 인증 반경을 달성한다.
  • $σ$-노름 공격에 대해서는 인증 반경 향상이 미미하며, 기존 방법의 근접 최적성과 일치한다.
  • $σ$-노름 부분공간 공격(예: 한 색상 채널에 국한된 변형)에서는 기존 기준 방법 대비 인증 반경이 크게 증가한다.
  • 고차수 정보를 사용할 경우, 가우시안 스무딩 분류기의 경우 점근적으로 최적의 인증이 가능해지며, 기존의 불가능성 결과를 우회한다.
  • 더 많은 샘플($N=6.4M$)을 사용하면 더 큰 반경에서도 인증 정확도 향상 범위가 확장되지만, 매우 높은 반경에서는 여전히 성능 향상이 제한적이다.
  • 이 방법은 $σ$-노름 공격에 대해 인증 정확도를 유지하거나 약간 향상시키며, 다양한 위협 모델에 걸쳐 안정성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.