[논문 리뷰] Scaling provable adversarial defenses
논문은 모듈식 듀얼을 사용한 스킵 연결이 있는 대형 네트워크에 대해 입증 가능한 강건 학습을 확장하고, 무작위 프로젝션을 통한 선형 스케일 bound 계산 및 cascade 모델을 통해 l-무한 공격에 대한 인증 강건성 향상을 제시한다.
Recent work has developed methods for learning deep network classifiers that are provably robust to norm-bounded adversarial perturbation; however, these methods are currently only possible for relatively small feedforward networks. In this paper, in an effort to scale these approaches to substantially larger models, we extend previous work in three main directions. First, we present a technique for extending these training procedures to much more general networks, with skip connections (such as ResNets) and general nonlinearities; the approach is fully modular, and can be implemented automatically (analogous to automatic differentiation). Second, in the specific case of $\ell_\infty$ adversarial perturbations and networks with ReLU nonlinearities, we adopt a nonlinear random projection for training, which scales linearly in the number of hidden units (previous approaches scaled quadratically). Third, we show how to further improve robust error through cascade models. On both MNIST and CIFAR data sets, we train classifiers that improve substantially on the state of the art in provable robust adversarial error bounds: from 5.8% to 3.1% on MNIST (with $\ell_\infty$ perturbations of $ε=0.1$), and from 80% to 36.4% on CIFAR (with $\ell_\infty$ perturbations of $ε=2/255$). Code for all experiments in the paper is available at https://github.com/locuslab/convex_adversarial/.
연구 동기 및 목표
- 더 크고 현대적인 아키텍처에 대해 노름으로 한정된 적대적扰동에 대한 확장 가능한 provable robustness를 동기화한다.
- 스킵 연결과 일반 활성화를 가진 네트워크의 적대적 손실을 bound하는 모듈식 듀얼 함수 프레임워크를 개발한다.
- 비선형 랜덤 프로젝션을 통해 l-infinity扰동에 대한 경계 계산을 선형 시간으로 달성한다.
- 초기 단계에서 인증되지 않은 예제들을 다루는 cascade(앙상블) 모델을 사용해 강건한 성능을 향상시킨다.
- MNIST와 CIFAR-10에서 기존의 provable defenses에 비해 상당한 개선을 입증한다.
제안 방법
- 레이어 연산의 Fenchel 쌍을 사용해 모듈식 듀얼 층을 조합하여 듀얼 네트워크를 구성한다.
- 피드포워드 구조뿐 아니라 스킵 연결과 임의 활성화를 갖는 네트워크로 일반화한다.
- 비선형 랜덤 프로젝션을 사용해 적대적 경계를 추정하고, ReLU를 갖는 l-infinity扰동에 대해 숨겨진 유닛 수의 선형 스케일링을 달성한다.
- 선형 연산자와 ReLU 활성화(다른 활성화는 참고 문헌을 통해)용 구체적인 듀얼 층을 제공하여 듀얼 네트워크의 자동 구성을 가능하게 한다.
- 후속 분류기가 이전 단계에서 인증되지 않은 사례만 인증하도록 설계된 cascading ensembles 전략을 도입한다.
- 시험 시점에 정확한 확률 경계를 보고하고, 정확한 대 근사(bound) 계산 간의 차이를 논의한다.
실험 결과
연구 질문
- RQ1제한된 피드백으로 구성된 간단한 피드포워드 구조를 넘어 스킵 연결 및 임의 활성화를 가진 네트워크에도 provable robustness 경계가 확장될 수 있는가?
- RQ2이차 제곱 스케일 없이 큰 네트워크에 대해 l-infinity扰动에 대한 강건한 경계를 효율적으로 계산할 수 있는가?
- RQ3cascade를 통한 강건 모델이 단일 모델 방어보다 인증 강건성을 개선하는가?
- RQ4네트워크 크기를 확장하고 프로젝션을 사용할 때 MNIST와 CIFAR-10에서 검증된 강건 오류의 실질적 이득은 무엇인가?
- RQ5이 방법들이 강건성 경계 및 학습 효율성 측면에서 기존의 provable defense와 어떻게 비교되는가?
주요 결과
- MNIST에서 epsilon = 0.1에서 인증 강건 오류가 5.8%에서 3.1%로 감소했다.
- CIFAR-10에서 epsilon = 2/255에서 강건 오류가 80%에서 36.4%로 개선되었다.
- MNIST의 경우 비 cascade 학습에서 큰 모델이 3.7%의 강건 오류를 달성 (epsilon = 0.1), cascade를 적용하면 3.1%로 감소했다.
- CIFAR-10에서 ResNet은 cascade를 적용해 46.1%의 강건 오류 (epsilon = 2/255)에서 36.4%로 감소했다.
- 캐스케이드는 명목상의 오류를 증가시키지만 강건 오류를 개선해 강건성과 정확도 간의 트레이드오프를 제시한다.
- 50 차원의 랜덤 프로젝션은 MNIST에서 정확한 경계와 유사한 테스트 성능을 제공하며 상당한 속도 향상을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.