Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Defense via Data Dependent Activation Function and Total Variation Minimization

Bao Wang, A. T. Lin|arXiv (Cornell University)|2018. 09. 23.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 16
한 줄 요약

이 논문은 딥 네ural 네트워크에서 적대적 로버스트니를 향상시키기 위해 데이터에 의존하는 활성화 함수—특히 다양체 수렴 함수(WNLL)—를 제안한다. 표준 소프트맥스를 이 기하학적 정보를 반영한 활성화 함수로 대체하고, 총 변동 최소화와 PGD 적대적 훈련을 결합함으로써, 강력한 IFGSM 공격 하에서 CIFAR-10에서 로버스트 정확도를 최대 38.9% 향상시켜 ResNet20에서 약 69%의 로버스트 정확도를 달성하며, 표준 모델을 크게 능가한다.

ABSTRACT

We improve the robustness of Deep Neural Net (DNN) to adversarial attacks by using an interpolating function as the output activation. This data-dependent activation remarkably improves both the generalization and robustness of DNN. In the CIFAR10 benchmark, we raise the robust accuracy of the adversarially trained ResNet20 from $\sim 46\%$ to $\sim 69\%$ under the state-of-the-art Iterative Fast Gradient Sign Method (IFGSM) based adversarial attack. When we combine this data-dependent activation with total variation minimization on adversarial images and training data augmentation, we achieve an improvement in robust accuracy by 38.9$\%$ for ResNet56 under the strongest IFGSM attack. Furthermore, We provide an intuitive explanation of our defense by analyzing the geometry of the feature space.

연구 동기 및 목표

  • 자율 주행 차량 및 악성 소프트웨어 탐지와 같은 안전이 중요한 응용 분야에서의 딥 네럴 네트워크(DNN)의 적대적 공격에 대한 취약성을 해결하기 위해.
  • 표준 소프트맥스 출력 활성화 함수를 데이터에 의존하고 다양체를 통합하는 함수로 대체하여 DNN의 일반화 및 로버스트니를 향상시키기 위해.
  • 화이트박스 및_BLK박스 적대적 공격, 포함 전이 가능한 및 일반적인 편향을 포함한 공격에 모두 강건한 방어 프레임워크를 개발하기 위해.
  • 특징 공간 내 기하학적 구조를 활용하여 활성화 설계와 후처리를 통해 로버스트니를 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 학습 데이터의 기하학적 정보를 활용하는 데이터에 의존하고 다양체를 통합하는 활성화 함수(WNLL)를 딥 네럴 네트워크의 표준 소프트맥스 출력 활성화 함수로 대체한다.
  • 적대적 이미지와 학습 데이터에 총 변동 최소화(TVM)를 적용하여 편향을 단순화하고 노이즈를 감소시킨다.
  • WNLL 활성화 함수를 PGD 적대적 훈련과 통합하여 모델 최적화 중 로버스트니를 향상시킨다.
  • 적대적 훈련의 내부 최대화 문제를 해결하기 위해 투영된 경사 하강법(PGD)을 사용하여 가장 강력한 공격을 근사한다.
  • WNLL 활성화 함수를 데이터 증강 및 TVM과 결합하여 다각도의 방어 전략을 구축한다.
  • WNLL 함수의 근사 기울기를 활용하여 적대적 훈련 중에 엔드 투 엔드 백프로파게이션을 가능하게 한다.

실험 결과

연구 질문

  • RQ1표준 소프트맥스와 비교해 볼 때, 데이터에 의존하고 다양체를 통합하는 활성화 함수는 DNN의 일반화 및 로버스트니를 향상시킬 수 있는가?
  • RQ2특징 공간 내 잠재 공간에서의 특징 기하학적 구조는 적대적 편향 하에서 어떻게 변화하는가? 그리고 이러한 변화는 방어에 활용될 수 있는가?
  • RQ3WNLL 활성화 함수를 총 변동 최소화 및 적대적 훈련과 조합했을 때, 강력한 IFGSM 공격에 대한 로버스트니는 어느 정도 향상되는가?
  • RQ4제안된 방어는 전이 가능한 및 일반적인 적대적 편향에 효과적인가?
  • RQ5WNLL 기반 방어는 데이터 증강 및 TVM과 같은 다른 방어와 함께 추가로 조합하여 더 큰 로버스트니 향상을 이룰 수 있는가?

주요 결과

  • CIFAR-10에서 제안된 방법은 강력한 IFGSM 공격 하에서 PGD 적대적 훈련을 거친 ResNet20의 로버스트 정확도를 약 46%에서 약 69%로 향상시켰다.
  • TVM 및 데이터 증강과 조합했을 때, 강력한 IFGSM 공격 하에서 ResNet56의 로버스트 정확도가 38.9% 향상되었다.
  • WNLL 활성화 함수는 증가하는 IFGSM 반복 수에 따라 정확도 감소를 줄였으며, 10회 반복 시 표준 ResNet20 대비 약 23%의 성능 격차를 보였다.
  • 특징 공간의 시각화 결과, WNLL는 깨끗한 이미지와 적대적 이미지 모두에서 의미 있는 기하학적 구조를 유지하는 반면, 소프트맥스는 특징 분포를 왜곡함을 보였다.
  • WNLL 함수의 기하학적 안정성 덕분에, 적대적 공격이 블랙박스 환경에서 적용되더라도 방어가 효과를 유지한다.
  • 기존의 방어 기법인 PGD 훈련 및 TVM과의 호환성이 있어, 추가적인 로버스트니 향상을 위한 누적 효과를 낼 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.