Skip to main content
QUICK REVIEW

[논문 리뷰] Robustness Certificates Against Adversarial Examples for ReLU Networks

Sahil Singla, Soheil Feizi|arXiv (Cornell University)|2019. 02. 01.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 5
한 줄 요약

이 논문은 ReLU 신경망의 활성화 영역의 조각별 선형 구조를 활용하여 효율적으로 계산 가능한 새로운 강건성 인증서를 제안한다. 단체형 인증서는 적대적 공격에 의존하지 않는, 미분 가능하고 닫힌 형태의 강건성 하한을 제공하며, 이전 방법보다 약 10배 빠르게 계산되어 깊은 네트워크에 대해서도 확장 가능한 인증이 가능하다.

ABSTRACT

While neural networks have achieved high performance in different learning tasks, their accuracy drops significantly in the presence of small adversarial perturbations to inputs. Defenses based on regularization and adversarial training are often followed by new attacks to defeat them. In this paper, we propose attack-agnostic robustness certificates for a multi-label classification problem using a deep ReLU network. Although computing the exact distance of a given input sample to the classification decision boundary requires solving a non-convex optimization, we characterize two lower bounds for such distances, namely the simplex certificate and the decision boundary certificate. These robustness certificates leverage the piece-wise linear structure of ReLU networks and use the fact that in a polyhedron around a given sample, the prediction function is linear. In particular, the proposed simplex certificate has a closed-form, is differentiable and is an order of magnitude faster to compute than the existing methods even for deep networks. In addition to theoretical bounds, we provide numerical results for our certificates over MNIST and compare them with some existing upper bounds.

연구 동기 및 목표

  • 딥 러닝에서 적대적 공격에 의존하지 않는 강건성 평가의 부족을 해결한다. 기존 방법은 적대적 공격에서 유도된 상한에 의존한다.
  • 특정 공격 알고리즘에 종속되지 않는 하한 강건성 인증서를 개발하여 진정된 보안 보장을 제공한다.
  • ReLU 네트워크의 조각별 선형 성질을 활용하여 적대적 예제까지의 거리에 대한 날카운 가용 하한을 유도한다.
  • 학습 중에 사용 가능한, 동시에 미분 가능하고 효율적인 인증서를 설계한다.
  • 특히 다중 레이블 분류에 적합한 깊은 ReLU 네트워크에서의 강건성 인증을 위한 확장 가능한 솔루션을 제공한다.

제안 방법

  • 입력 공간을 다면체 영역 S(θ)로 분할하는 활성화 패턴 θ를 정의한다. 여기서 ReLU 네트워크는 선형 함수 dθ(x) = W^(θ)x + b^(θ)로 행동한다.
  • 닫힌 형태의 해를 사용하여, 주어진 입력 u로부터 국소 다면체 S(θ) 내의 결정 경계까지의 최소 거리를 계산함으로써 단체형 인증서를 구성한다.
  • S(θ) 내에서 선형 함수 dθ(x)를 사용하여 예측 클래스를 뒤바꿀 수 있는 최소한의 변형을 계산함으로써, 인증서가 유효하고 보수적인지 보장한다.
  • 다층 네트워크에 적용 가능한 다면체 면의 기하학적 성질에 기반한 결정 경계 인증서를 제2의 하한으로 유도한다.
  • 볼록 최적화 기법을 통해 단체형 인증서가 미분 가능하고 효율적으로 계산되도록 보장하여 학습 파ip라인에 통합할 수 있도록 한다.
  • MNIST 및 CIFAR-10에서 Fast-Lin, Fast-Lip, CROWN-Ada와의 비교를 통해 방법을 검증하여 뚜렷한 속도 향상을 입증한다.

실험 결과

연구 질문

  • RQ1특정 적대적 공격 방법에 종속되지 않으며, 적대적 변형 크기의 진정한 하한을 제공하는 ReLU 네트워크를 위한 강건성 인증서를 유도할 수 있는가?
  • RQ2ReLU 네트워크의 조각별 선형 구조를 어떻게 활용하여 날카운 효율적인 강건성 인증서를 계산할 수 있는가?
  • RQ3특히 깊은 네트워크에서 기존 하한 방법에 비해 제안된 인증서의 계산 효율성은 어떠한가?
  • RQ4제안된 인증서를 학습 중 정규화 항으로 사용하여 적대적 강건성을 향상시킬 수 있는가?
  • RQ5반복 공격인 FGSM 및 DeepFool에서 유도된 상한과 비교했을 때, 제안된 하한이 진정한 강건성 반경에 얼마나 가까운가?

주요 결과

  • 단체형 인증서는 Fast-Lin, Fast-Lip, CROWN-Ada와 같은 이전 방법보다 약 10배 빠르게 계산되며, 각각 MNIST 3×[1024], 4×[1024], CIFAR 7×[1024] 네트워크에서 계산 시간이 0.0037초, 0.0063초, 0.0387초이다.
  • 단체형 인증서는 특히 더 깊은 네트워크에서 결정 경계 인증서보다 하한 값 면에서 뚜렷이 뛰어나다.
  • 두 층의 MNIST 네트워크에서, 단체형 인증서 값은 DeepFool 및 반복적 FGSM 값보다 항상 작으며, 이는 하한으로서의 타당성을 확인한다.
  • 더 깊은 네트워크(예: MNIST의 3층 MLP)에서, 단체형 인증서와 DeepFool 상한 사이의 격차는 일부 예시에서 작아, 날카운 정도를 시사한다.
  • 단체형 인증서는 미분 가능하고 닫힌 형태이므로, 적대적 훈련 또는 인증 기반 최적화에 잠재적으로 통합될 수 있다.
  • 수치적 결과는 제안된 인증서가 항상 적대적 공격에서 유도된 상한보다 작기 때문에, 올바른 하한임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.