[논문 리뷰] Adversarial Defense via Data Dependent Activation Function and Total Variation Minimization
이 논문은 딥 네ural 네트워크에서 적대적 로버스트니를 향상시키기 위해 데이터에 의존하는 활성화 함수—특히 다양체 수렴 함수(WNLL)—를 제안한다. 표준 소프트맥스를 이 기하학적 정보를 반영한 활성화 함수로 대체하고, 총 변동 최소화와 PGD 적대적 훈련을 결합함으로써, 강력한 IFGSM 공격 하에서 CIFAR-10에서 로버스트 정확도를 최대 38.9% 향상시켜 ResNet20에서 약 69%의 로버스트 정확도를 달성하며, 표준 모델을 크게 능가한다.
We improve the robustness of Deep Neural Net (DNN) to adversarial attacks by using an interpolating function as the output activation. This data-dependent activation remarkably improves both the generalization and robustness of DNN. In the CIFAR10 benchmark, we raise the robust accuracy of the adversarially trained ResNet20 from $\sim 46\%$ to $\sim 69\%$ under the state-of-the-art Iterative Fast Gradient Sign Method (IFGSM) based adversarial attack. When we combine this data-dependent activation with total variation minimization on adversarial images and training data augmentation, we achieve an improvement in robust accuracy by 38.9$\%$ for ResNet56 under the strongest IFGSM attack. Furthermore, We provide an intuitive explanation of our defense by analyzing the geometry of the feature space.
연구 동기 및 목표
- 자율 주행 차량 및 악성 소프트웨어 탐지와 같은 안전이 중요한 응용 분야에서의 딥 네럴 네트워크(DNN)의 적대적 공격에 대한 취약성을 해결하기 위해.
- 표준 소프트맥스 출력 활성화 함수를 데이터에 의존하고 다양체를 통합하는 함수로 대체하여 DNN의 일반화 및 로버스트니를 향상시키기 위해.
- 화이트박스 및_BLK박스 적대적 공격, 포함 전이 가능한 및 일반적인 편향을 포함한 공격에 모두 강건한 방어 프레임워크를 개발하기 위해.
- 특징 공간 내 기하학적 구조를 활용하여 활성화 설계와 후처리를 통해 로버스트니를 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 학습 데이터의 기하학적 정보를 활용하는 데이터에 의존하고 다양체를 통합하는 활성화 함수(WNLL)를 딥 네럴 네트워크의 표준 소프트맥스 출력 활성화 함수로 대체한다.
- 적대적 이미지와 학습 데이터에 총 변동 최소화(TVM)를 적용하여 편향을 단순화하고 노이즈를 감소시킨다.
- WNLL 활성화 함수를 PGD 적대적 훈련과 통합하여 모델 최적화 중 로버스트니를 향상시킨다.
- 적대적 훈련의 내부 최대화 문제를 해결하기 위해 투영된 경사 하강법(PGD)을 사용하여 가장 강력한 공격을 근사한다.
- WNLL 활성화 함수를 데이터 증강 및 TVM과 결합하여 다각도의 방어 전략을 구축한다.
- WNLL 함수의 근사 기울기를 활용하여 적대적 훈련 중에 엔드 투 엔드 백프로파게이션을 가능하게 한다.
실험 결과
연구 질문
- RQ1표준 소프트맥스와 비교해 볼 때, 데이터에 의존하고 다양체를 통합하는 활성화 함수는 DNN의 일반화 및 로버스트니를 향상시킬 수 있는가?
- RQ2특징 공간 내 잠재 공간에서의 특징 기하학적 구조는 적대적 편향 하에서 어떻게 변화하는가? 그리고 이러한 변화는 방어에 활용될 수 있는가?
- RQ3WNLL 활성화 함수를 총 변동 최소화 및 적대적 훈련과 조합했을 때, 강력한 IFGSM 공격에 대한 로버스트니는 어느 정도 향상되는가?
- RQ4제안된 방어는 전이 가능한 및 일반적인 적대적 편향에 효과적인가?
- RQ5WNLL 기반 방어는 데이터 증강 및 TVM과 같은 다른 방어와 함께 추가로 조합하여 더 큰 로버스트니 향상을 이룰 수 있는가?
주요 결과
- CIFAR-10에서 제안된 방법은 강력한 IFGSM 공격 하에서 PGD 적대적 훈련을 거친 ResNet20의 로버스트 정확도를 약 46%에서 약 69%로 향상시켰다.
- TVM 및 데이터 증강과 조합했을 때, 강력한 IFGSM 공격 하에서 ResNet56의 로버스트 정확도가 38.9% 향상되었다.
- WNLL 활성화 함수는 증가하는 IFGSM 반복 수에 따라 정확도 감소를 줄였으며, 10회 반복 시 표준 ResNet20 대비 약 23%의 성능 격차를 보였다.
- 특징 공간의 시각화 결과, WNLL는 깨끗한 이미지와 적대적 이미지 모두에서 의미 있는 기하학적 구조를 유지하는 반면, 소프트맥스는 특징 분포를 왜곡함을 보였다.
- WNLL 함수의 기하학적 안정성 덕분에, 적대적 공격이 블랙박스 환경에서 적용되더라도 방어가 효과를 유지한다.
- 기존의 방어 기법인 PGD 훈련 및 TVM과의 호환성이 있어, 추가적인 로버스트니 향상을 위한 누적 효과를 낼 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.