[논문 리뷰] Randomization matters. How to defend against strong adversarial attacks
이 논문은 적대적 훈련된 분류기의 앙상블 부스팅 기반의 랜덤화 방식을 제안하며, 이론적 및 실험적으로 랜덤화가 강력한 적응형 공격에 대해 저항력을 크게 향상시킴을 입증한다. 게임 이론적 저항력 보장에 기반해 단일 결정론적 모델을 초월하는 분류기 혼합을 구성함으로써, 적응형 PGD 공격 하에서 CIFAR-10에서 0.55의 정확도를 달성하며, 이는 적대적 훈련 대비 13% 높은 성능이다.
Is there a classifier that ensures optimal robustness against all adversarial attacks? This paper answers this question by adopting a game-theoretic point of view. We show that adversarial attacks and defenses form an infinite zero-sum game where classical results (e.g. Sion theorem) do not apply. We demonstrate the non-existence of a Nash equilibrium in our game when the classifier and the Adversary are both deterministic, hence giving a negative answer to the above question in the deterministic regime. Nonetheless, the question remains open in the randomized regime. We tackle this problem by showing that, undermild conditions on the dataset distribution, any deterministic classifier can be outperformed by a randomized one. This gives arguments for using randomization, and leads us to a new algorithm for building randomized classifiers that are robust to strong adversarial attacks. Empirical results validate our theoretical analysis, and show that our defense method considerably outperforms Adversarial Training against state-of-the-art attacks.
연구 동기 및 목표
- 모든 적대적 공격에 대해 최적의 저항력을 확보할 수 있는 결정론적 분류기가 존재하는지 조사한다.
- 결정론적 접근의 한계를 극복하기 위해 랜덤화 방어 전략이 강력한 적응형 공격 상황에서 결정론적 전략을 능가할 수 있는지 탐색한다.
- 강력한 적응형 공격에 저항할 수 있는 실용적이고 이론적으로 타당한 랜덤화 분류기 구축 방법을 개발한다.
- CIFAR-10 및 CIFAR-100에서 최신 공격 기법에 대해 제안된 방법을 실험적으로 검증한다.
제안 방법
- 공격자와 방어자 사이의 무한한 0-합 게임으로서 적대적 공격-방어 문제를 수식화한다.
- 결정론적 설정에서 나시 균형이 존재하지 않음을 증명함으로써, 어떤 결정론적 분류기라도 항상 최적일 수 없음을 의미한다.
- 현재 혼합 모델에 대해 생성된 적대적 예제를 기반으로 새로운 모델을 반복적으로 훈련함으로써 랜덤화된 분류기를 구성하는 부스팅 기반 방법을 제안한다.
- 적응형 공격에 대비한 혼합 모델의 저항력을 극대화하기 위해 훈련 중 예측 로짓과 기대 손실 최적화를 사용한다.
- 다중 랜덤 재시작과 기울기 기반 최적화를 사용한 적응형 공격(예: Adaptive-ℓ∞-PGD)을 활용해 저항력을 평가한다.
- 최종 혼합 모델의 저항력을 향상시키기 위해 자연 정확도가 아닌 공격 하에서의 성능(가장 높은 AUA)을 기반으로 초기 분류기를 선택한다.
실험 결과
연구 질문
- RQ1모든 적대적 공격에 대해 최적의 저항력을 보장하는 결정론적 분류기가 존재하는가?
- RQ2강력한 적응형 공격 상황에서 랜덤화 방어 전략이 결정론적 전략을 능가할 수 있는가?
- RQ3부스팅을 통해 구성된 분류기 혼합은 개별 모델보다 나은 최악의 상황 저항력 보장을 제공하는가?
- RQ4게임 이론적 프레임워크는 적대적 방어에서 랜덤화의 사용을 정당화할 수 있는가?
주요 결과
- 논문은 해당 무한한 0-합 게임에서 나시 균형이 존재하지 않음을 증명함으로써, 어떤 결정론적 분류기라도 모든 적대적 공격에 대해 최적의 저항력을 확보할 수 없음을 입증한다.
- 모든 결정론적 방어는 랜덤화된 분류기 혼합에 의해 열등하게 될 수 있으며, 이는 랜덤화의 이론적 우월성을 보여준다.
- 제안된 부스팅된 랜덤화 분류기는 적응형 ℓ∞-PGD 공격 하에서 CIFAR-10에서 0.55의 정확도를 달성하였으며, 이는 적대적 훈련(0.42) 대비 0.13 높은 성능이다.
- CIFAR-100에서는 ℓ∞-PGD 공격 하에서 0.53의 정확도, ℓ2-C&W 공격 하에서는 0.52의 정확도를 기록하여, 두 경우 모두 적대적 훈련을 능가한다.
- 초기 분류기를 자연 정확도가 아닌 공격 하에서의 성능(가장 높은 AUA)을 기반으로 선택할 경우, 자연 정확도 기반 선택 대비 3% 높은 정확도를 확보한다.
- 합리성 검증을 통해 기울기 마스킹이 존재하지 않음을 확인하였으며, ℓ∞-PGD 공격에서 ε=0.250일 때 정확도가 0.000으로 떨어짐으로써 저항력 평가의 타당성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.