[논문 리뷰] Improved Adversarial Robustness by Reducing Open Space Risk via Tent Activations
이 논문은 계산 비용이 저렴하고 개방된 공간 위험을 제한하는 활성화 함수인 tent 활성화 함수를 소개한다. 이는 학습 비용을 증가시키지 않으면서도 적대적 방해에 대한 강건성을 향상시킨다. ReLU와 같은 단조 증가 활성화 함수를 대체함으로써 tent 활성화 함수는 분포 외 입력에 대한 반응을 제한하여 적대적 편향에 대한 취약성을 줄인다. 이로 인해 MNIST에서 평균 91.8%의 강건 정확도와 CIFAR-10에서 73.5%의 강건 정확도를 달성하였으며, 각각 PGD 적대적 훈련보다 15점과 30점 이상 높다.
Adversarial examples contain small perturbations that can remain imperceptible to human observers but alter the behavior of even the best performing deep learning models and yield incorrect outputs. Since their discovery, adversarial examples have drawn significant attention in machine learning: researchers try to reveal the reasons for their existence and improve the robustness of machine learning models to adversarial perturbations. The state-of-the-art defense is the computationally expensive and very time consuming adversarial training via projected gradient descent (PGD). We hypothesize that adversarial attacks exploit the open space risk of classic monotonic activation functions. This paper introduces the tent activation function with bounded open space risk and shows that tents make deep learning models more robust to adversarial attacks. We demonstrate on the MNIST dataset that a classifier with tents yields an average accuracy of 91.8% against six white-box adversarial attacks, which is more than 15 percentage points above the state of the art. On the CIFAR-10 dataset, our approach improves the average accuracy against the six white-box adversarial attacks to 73.5% from 41.8% achieved by adversarial training via PGD.
연구 동기 및 목표
- 깊은 신경망의 적대적 예제에 대한 취약성을 줄이기 위해 활성화 함수의 개방된 공간 위험을 근본 원인으로 규명하는 것.
- 학습 데이터를 초월한 반응 성장에 제한을 두는 새로운 활성화 함수 설계를 통해 딥 러닝 모델의 개방된 공간 위험을 감소시키는 것.
- 비용이 많이 드는 적대적 훈련과는 달리 계산 비용을 증가시키지 않고도 적대적 강건성을 향상시키는 것.
- 표준 벤치마크에서 제한된 개방된 공간 위험은 상당히 높은 강건 정확도를 달성할 수 있음을 보여주는 것.
- 높은 정순 정확도를 유지하면서 PGD 기반 적대적 훈련의 이론적으로 탄탄한 효율적인 대안을 제공하는 것.
제안 방법
- 입력이 학습 데이터에서 멀어질수록 출력이 제한되는 비단조화, 조각별 선형 함수인 tent 활성화 함수를 제안한다.
- 일정한 입력 임계값을 초월하면 출력이 0이 되도록 설계하여, ReLU와 유사한 함수에서 흔히 발생하는 비한계 반응을 방지한다.
- 적대적 훈련에서 요구되는 추가 전방/역전파 단계가 필요 없이 표준 최적화(SGD와 가중치 감쇠를 동반)를 사용하여 딥 네트워크를 훈련시킨다.
- MNIST와 CIFAR-10에서 Wide ResNet 아키텍처(WRN-28-1과 WRN-28-10)의 모든 은닉층에 tent 활성화 함수를 적용한다.
- 훈련 안정성 향상과 강건성 향상을 위해 tent 파라미터(δ)에 가중치 감쇠를 적용한다.
- 백색 상자 및_BLK 백색 상자 공격(PGD, DeepFool, Carlini & Wagner 등)을 활용하여 다양한 위협 모델에서 강건성을 평가한다.
실험 결과
연구 질문
- RQ1활성화 함수의 개방된 공간 위험을 줄이면 적대적 강건성이 향상될 수 있는가?
- RQ2tent 활성화 함수처럼 개방된 공간 위험가 제한된 활성화 함수는 적대적 공격 하에서 표준 ReLU 기반 네트워크보다 우수한 성능을 보일 수 있는가?
- RQ3tent 활성화 함수는 계산 비용을 증가시키지 않고도 PGD 기반 적대적 훈련을 능가할 수 있는가?
- RQ4정순 예제와 블랙박스 공격 하에서 tent 활성화 네트워크의 성능은 적대적으로 훈련된 모델과 비교해 어떻게 되는가?
- RQ5왜 PGD 기반 적대적 훈련은 DeepFool과 같은 특정 공격에 대해 강건성을 향상시키지 못하는가? 그리고 tent 활성화 함수는 이 문제를 해결할 수 있는가?
주요 결과
- MNIST에서 tent 활성화를 적용한 WRN-28 네트워크는 6개의 백색 상자 공격에서 평균 91.8%의 강건 정확도를 달성하였으며, PGD 적대적 훈련(76.8%)보다 15포인트 높았다.
- CIFAR-10에서 tent 활성화를 적용한 WRN-28-10는 평균 73.5%의 강건 정확도를 기록하였고, PGD 적대적 훈련의 41.8%보다 31.7포인트 높았다.
- tent 활성화 모델은 특히 저용량 네트워크에서 높은 정순 테스트 정확도를 유지하였으며, PGD 적대적 훈련은 정순 데이터에서 성능이 크게 떨어지는 경향을 보였다.
- DeepFool 공격에 대해서는 PGD 적대적 훈련이 표준 훈련보다 강건성을 떨어뜨렸지만, tent 활성화 모델은 강건성을 유지하고 기준 모델을 능가하였다.
- 블랙박스 환경에서는 tent 활성화 모델이 PGD 훈련된 모델과 동등하거나 그 이상의 강건성을 보였으며, 특히 저용량 아키텍처에서 두드러졌다.
- tent 활성화 함수는 계산적으로 효율적이며 훈련에 추가 오버헤드가 없어, 적대적 훈련과 달리 예제당 다중 전방/역전파 단계가 필요로 하지 않는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.