[논문 리뷰] Enhancing Adversarial Defense by k-Winners-Take-All
이 논문은 표준 ReLU 활성화 함수를 대체하여 k-Winners-Take-All (k-WTA) 활성화 함수를 도입하여 적대적 공격에 대한 강건성을 향상시킨다. k-WTA는 네트워크 출력에 C⁰ 불연속성을 도입함으로써, 밀집된 입력 점에서 기울기가 정의되지 않게 하여 기울기 기반 적대적 공격를 무력화시킨다. 모든 테스트된 아키텍처와 학습 방식에서, k-WTA 네트워크는 ReLU 네트워크보다 유의미하게 뛰어난 성능을 보이며, 자연 학습을 사용할 경우 CIFAR-10에서 최대 96.9%의 강건한 정확도와 MNIST에서 62.2%의 강건한 정확도를 달성한다.
We propose a simple change to existing neural network structures for better defending against gradient-based adversarial attacks. Instead of using popular activation functions (such as ReLU), we advocate the use of k-Winners-Take-All (k-WTA) activation, a C0 discontinuous function that purposely invalidates the neural network model's gradient at densely distributed input data points. The proposed k-WTA activation can be readily used in nearly all existing networks and training methods with no significant overhead. Our proposal is theoretically rationalized. We analyze why the discontinuities in k-WTA networks can largely prevent gradient-based search of adversarial examples and why they at the same time remain innocuous to the network training. This understanding is also empirically backed. We test k-WTA activation on various network structures optimized by a training method, be it adversarial training or not. In all cases, the robustness of k-WTA networks outperforms that of traditional networks under white-box attacks.
연구 동기 및 목표
- 딥 네트워크가 기울기 기반 적대적 공격에 취약한 점을 해결하기 위해.
- 네트워크 출력에 불연속성을 도입함으로써 적대적 예제 생성을 방지할 수 있는지 탐색하기 위해.
- 학습 절차를 변경하지 않고도 강건성을 향상시킬 수 있는 최소한의 아키텍처 변경을 개발하기 위해.
- 비연속적인 활성화 함수를 가짐에도 불구하고 k-WTA가 학습 가능성을 유지하는지 검증하기 위해.
- 다양한 화이트박스 및_BLK 박스 공격 하에서 k-WTA 네트워크가 보여주는 열등한 강건성의 정도를 입증하기 위해.
제안 방법
- 층 내에서 가장 큰 k개의 활성화만 유지하고 나머지는 0으로 설정하는 k-WTA로 표준 ReLU 활성화 함수를 대체한다.
- 네트워크의 기울기가 밀집된 입력 점에서 정의되지 않도록 하는 C⁰ 불연속성 활성화 함수로 k-WTA를 사용한다.
- 기타 모든 네트워크 구성 요소(예: BatchNorm, 컨볼루션, 풀링)와 학습 방법을 그대로 유지한다.
- 입력 공간에서의 밀집된 불연속성에도 불구하고 가중치 공간에서의 불연속성은 희박하므로 학습이 성공할 수 있음을 활용한다.
- 활성 뉴런 수를 제어하기 위해 희박성 비율 γ를 사용하며, 더 작은 γ 값은 불연속성의 밀도를 증가시킨다.
- 여러 데이터셋과 아키텍처에서 PGD, C&W, DeepFool, MIM 및 전이 공격에 대해 강건성을 평가한다.
실험 결과
연구 질문
- RQ1네트워크 출력에 C⁰ 불연속성을 도입함으로써 기울기 기반 적대적 공격를 방지할 수 있는가?
- RQ2비미분 가능 활성화 함수를 가진 k-WTA가 비록 비연속적이지만 어떻게 학습 가능성을 유지할 수 있는가?
- RQ3다양한 학습 방법에서 k-WTA는 화이트박스 공격 하에서 ReLU와 비교해 어떤 수준의 강건성을 보이는가?
- RQ4k-WTA 네트워크에서 생성된 적대적 예제가 ReLU 네트워크로 전이되는 정도는 어느 정도이며, 반대로도 마찬가지인가?
- RQ5k-WTA의 희박성 비율 γ가 손실 곡면의 매끄러움과 적대적 강건성에 영향을 미치는가?
주요 결과
- CIFAR-10에서 k-WTA-0.1 네트워크는 TRADES 학습을 사용할 경우 PGD 공격 하에서 96.9%의 강건한 정확도를 기록했으며, 이는 ReLU 네트워크를 능가하는 성능이다.
- 비적대적(자연) 학습을 사용할 경우에도 k-WTA-0.1은 CIFAR-10에서 96.0%의 강건한 정확도를 달성했고, 동일한 설정에서 ReLU는 95.0%였다.
- MNIST에서는 k-WTA-0.1가 자연 학습을 사용할 경우 PGD 공격 하에서 62.2%의 강건한 정확도를 기록했고, ReLU는 0.0%였다.
- k-WTA와 ReLU 네트워크 간의 전이 공격 결과에서 k-WTA 네트워크의 성공률이 유의미하게 낮아, 전이 가능성 감소를 확인했다.
- 전이 공격 표의 대각선 항목을 보면, k-WTA-0.1(ADT)는 가장 강력한 블랙박스 공격 하에서도 67.2%의 강건한 정확도를 기록했고, ReLU(ADT)는 59.4%였다.
- 손실 곡면 시각화 결과, 적대적 학습 후에도 k-WTA 네트워크가 뾰족하고 불연속적인 상태를 유지함을 확인했으며, 더 큰 γ 값은 표면을 약간 더 매끄럽게 만든다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.