Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Two-Step Adversarial Defense for Deep Neural Networks

Ting‐Jui Chang, Yukun He|arXiv (Cornell University)|2018. 10. 08.
Adversarial Robustness in Machine Learning참고 문헌 10인용 수 6
한 줄 요약

이 논문은 e2SAD를 제안하며, 입력당 두 개의 적대적 예제를 생성하는 효율적인 이단계 적대적 방어 기법이다. 첫 번째로 FGSM를 사용하고, 두 번째로 모델의 최대 취약성을 겨냥한 적대적 예제를 생성함으로써, 비용이 많이 드는 반복적 적대적 훈련(예: IFGSM)과 유사한 강건성을 달성하면서도 계산 비용을 크게 낮춘다. 이 방법은 하나의 단계(FGSM)와 다수의 단계(IFGSM) 공격에 대해 강력한 방어를 제공하며, 소프트 레이블과 하이퍼파라미터 튜닝을 통해 블랙박스 공격으로도 확장 가능하다.

ABSTRACT

In recent years, deep neural networks have demonstrated outstanding performance in many machine learning tasks. However, researchers have discovered that these state-of-the-art models are vulnerable to adversarial examples: legitimate examples added by small perturbations which are unnoticeable to human eyes. Adversarial training, which augments the training data with adversarial examples during the training process, is a well known defense to improve the robustness of the model against adversarial attacks. However, this robustness is only effective to the same attack method used for adversarial training. Madry et al.(2017) suggest that effectiveness of iterative multi-step adversarial attacks and particularly that projected gradient descent (PGD) may be considered the universal first order adversary and applying the adversarial training with PGD implies resistance against many other first order attacks. However, the computational cost of the adversarial training with PGD and other multi-step adversarial examples is much higher than that of the adversarial training with other simpler attack techniques. In this paper, we show how strong adversarial examples can be generated only at a cost similar to that of two runs of the fast gradient sign method (FGSM), allowing defense against adversarial attacks with a robustness level comparable to that of the adversarial training with multi-step adversarial examples. We empirically demonstrate the effectiveness of the proposed two-step defense approach against different attack methods and its improvements over existing defense strategies.

연구 동기 및 목표

  • 반복적 적대적 훈련(예: IFGSM)의 높은 계산 비용을 해결하면서도 강력한 적대적 공격에 대한 강건성을 유지하고자 한다.
  • 청결한 입력의 근처에서 모델의 취약점을 효과적으로 드러내기 위해 샘플당 두 개의 적대적 예제만을 사용하는 방어 기법을 개발하고자 한다.
  • 비용이 많이 드는 다단계 적대적 훈련(예: IFGSM)과 유사한 강건성을 확보하면서도, FGSM와 같은 단일 단계 방법과 유사한 훈련 시간을 확보하고자 한다.
  • 소프트 레이블과 하이퍼파라미터 튜닝을 통해 블랙박스 공격에 대한 강건성을 확장하고자 한다.
  • 가중치 손실 함수를 통해 하나의 단계와 다수의 단계 적대적 공격에 대한 방어를 균형 있게 확보하고자 한다.

제안 방법

  • 첫 번째 단계는 작은 변형 예산(ε₁ = 24/255)을 사용한 빠른 기울기 부호 방법(FGSM)을 통해 적대적 예제를 생성한다.
  • 두 번째 단계는 첫 번째 적대적 예제 주변에서 모델의 취약성을 최대화하는 방식으로, 이질성 측도를 활용해 탐색을 이끌어내는 두 번째 적대적 예제를 식별한다.
  • 복합 손실 함수는 원래의 교차 엔트로피 손실과 두 적대적 예제의 손실을 결합하며, 기여도를 균형 조절하기 위해 학습 가능한 가중치 λ를 사용한다.
  • 일반화와 강건성을 향상시키기 위해 레이블 스무딩(정확한 클래스 확률 = 0.75)을 적용하여, 특히 블랙박스 공격에 대해 유리한 성능을 확보한다.
  • 훈련 과정은 배치 크기 256, 20 에포크로 표준 최적화(Adam)를 사용하며, MNIST 및 SVHN 데이터셋에서 평가된다.
  • 이 방법은 기존 딥러닝 프레임워크와 호환되며, 대규모 모델과 데이터셋으로도 확장 가능하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1반복적 적대적 훈련(예: IFGSM)의 비용과 유사한 강건성을 확보하면서도 계산 비용을 극도로 낮춘 이단계 적대적 방어가 가능한가?
  • RQ2단일 단계(FGSM)와 취약성 최대화를 위한 두 번째 적대적 예제의 조합이, 하나의 단계와 다수의 단계 공격에 모두 효과적인 방어를 가능하게 하는가?
  • RQ3소프트 레이블과 하이퍼파라미터 튜닝을 사용할 경우, 이단계 방어 아키텍처에서 블랙박스 공격에 대한 강건성이 향상되는가?
  • RQ4첫 번째 및 두 번째 적대적 예제 간의 이질성이 두 번째 적대적 예제 생성을 위한 신뢰할 수 있는 신호로 사용될 수 있는가?
  • RQ5실제 데이터셋인 SVHN에서 e2SAD는 FGSM 및 IFGSM 기반 표준 적대적 훈련과 비교해 강건성과 효율성 면에서 어떻게 성과를 내는가?

주요 결과

  • SVHN 데이터셋에서 e2SAD는 청결한 데이터에 대해 테스트 정확도 0.9236를 기록했으며, FGSM 공격(ε=24/255)에 대해서는 0.7881의 정확도를 확보하여 FGSM 기반 적대적 훈련(0.7842)과 자연 모델(0.1962)을 모두 앞섰다.
  • 반복적 IFGSM 공격(k=10, ε=24/255)에 대해 e2SAD는 0.3328의 강건한 정확도를 기록했으며, FGSM 기반 훈련(0.0455)과 자연 모델(0.0628)을 크게 앞섰다.
  • k=30인 IFGSM 공격에 대해서도 e2SAD는 0.3868의 강건한 정확도를 유지했으며, IFGSM 기반 적대적 훈련(0.3146)과 자연 모델(0.0593)을 초월했다.
  • e2SAD는 k=30일 때 블랙박스 IFGSM 공격에 대해 0.3868의 강건한 정확도를 확보하여 화이트박스 설정을 초월한 효과를 입증했다.
  • 비용이 많이 드는 IFGSM 기반 적대적 훈련과 유사한 강건성을 확보하면서도, FGSM 기반 훈련 수준의 훈련 시간을 유지했다.
  • 소프트 레이블과 하이퍼파라미터 튜닝(λ=0.3)의 사용은 일반화와 강건성을 크게 향상시켰으며, 특히 블랙박스 공격 상황에서 두드러진 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.