Skip to main content
QUICK REVIEW

[논문 리뷰] Bridging the Performance Gap between FGSM and PGD Adversarial Training

Tianjin Huang, Vlado Menkovski|arXiv (Cornell University)|2020. 11. 07.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 11
한 줄 요약

이 논문은 FGSM의 강건성을 PGD 수준으로 끌어올리면서 학습 시간을 절반으로 줄이는 곡률 정규화된 적대적 훈련 방법 adv.FGSMR을 제안한다. FGSM 방향의 곡률을 최소화함으로써, FGSM과 PGD의 변형 방향을 일치시켜 CIFAR-10에서 뛰어난 강건성을 달성하고, 이동 가능한 공격에 대한 강력한 방어력을 확보한다.

ABSTRACT

Deep learning achieves state-of-the-art performance in many tasks but exposes to the underlying vulnerability against adversarial examples. Across existing defense techniques, adversarial training with the projected gradient decent attack (adv.PGD) is considered as one of the most effective ways to achieve moderate adversarial robustness. However, adv.PGD requires too much training time since the projected gradient attack (PGD) takes multiple iterations to generate perturbations. On the other hand, adversarial training with the fast gradient sign method (adv.FGSM) takes much less training time since the fast gradient sign method (FGSM) takes one step to generate perturbations but fails to increase adversarial robustness. In this work, we extend adv.FGSM to make it achieve the adversarial robustness of adv.PGD. We demonstrate that the large curvature along FGSM perturbed direction leads to a large difference in performance of adversarial robustness between adv.FGSM and adv.PGD, and therefore propose combining adv.FGSM with a curvature regularization (adv.FGSMR) in order to bridge the performance gap between adv.FGSM and adv.PGD. The experiments show that adv.FGSMR has higher training efficiency than adv.PGD. In addition, it achieves comparable performance of adversarial robustness on MNIST dataset under white-box attack, and it achieves better performance than adv.PGD under white-box attack and effectively defends the transferable adversarial attack on CIFAR-10 dataset.

연구 동기 및 목표

  • 빠르지만 약한 FGSM 적대적 훈련과 느리지만 강건한 PGD 적대적 훈련 사이의 성능 격차를 해소한다.
  • FGSM의 낮은 강건성의 근본 원인을 그 변형 방향에 따른 높은 곡률로 규명한다.
  • FGSM 방향의 곡률을 줄이는 정규화 방법을 개발하여, 학습 비용을 증가시키지 않고도 강건성을 향상시킨다.
  • 표준 벤치마크에서 PGD 수준의 강건성과 동일하거나 이를 초월하면서도 높은 학습 효율성을 유지한다.

제안 방법

  • FGSM 변형 방향에 따라 손실 함수 내 곡률을 높이지 않도록 하는 곡률 정규화 항을 제안한다.
  • 곡률 정규화를 표준 FGSM 적대적 훈련에 통합하여 adv.FGSMR 프레임워크를 구성한다.
  • 학습 중 FGSM 방향의 곡률을 추정하기 위해 헤시안 기반 곡률 추정법(Eq. 6)을 사용한다.
  • 표준 교차 엔트로피 + 곡률 정규화 항을 조합한 수정된 손실 함수를 사용해 모델을 훈련한다.
  • 일단의 FGSM 변형을 사용하지만, 곡률 제어를 통해 다단계 PGD 유사 공격에 대한 일반화 능력을 향상시킨다.
  • 표준 ResNet 아키텍처를 사용해 MNIST와 CIFAR-10에 적용하고, 화이트박스 및_BLK박스 공격 하에서 평가한다.

실험 결과

연구 질문

  • RQ1FGSM 적대적 훈련은 속도가 빠르지만 PGD 수준의 강건성을 달성하지 못하는 이유는 무엇인가?
  • RQ2FGSM 변형 방향의 곡률이 적대적 강건성의 일반화에 어떤 영향을 미치는가?
  • RQ3곡률 정규화는 FGSM 기반 적대적 훈련의 강건성을 PGD 수준으로 향상시킬 수 있는가?
  • RQ4제안된 방법은 강건성을 향상시키면서도 표준 벤치마크에서 높은 학습 효율성을 유지하는가?

주요 결과

  • adv.FGSMR는 화이트박스 PGD 공격 하에서 MNIST 데이터셋에서 PGD와 동일한 적대적 강건성을 확보한다.
  • CIFAR-10에서 adv.FGSMR는 화이트박스 PGD 및 C&W 공격 하에서 PGD를 초월하는 적대적 강건성을 확보한다.
  • adv.FGSMR는 이동 가능한 적대적 공격에 PGD와 동일한 효과로 방어하며, 블랙박스 설정에서 더 높은 변형 데이터 정확도를 기록한다.
  • adv.FGSMR로 학습할 경우, PGD(k=20) 대비 매 에포크당 학습 시간을 절반으로 줄일 수 있으며, 변형 데이터 정확도 수렴 속도는 유사하다.
  • adv.FGSMR 하에서의 곡률 값은 PGD보다 略적으로 낮아, 곡률 제어가 강건성 향상에 기여했음을 시사한다.
  • Table 6의 이동성 실험 결과에 따르면, 이 방법은 표준 훈련보다 PGD에 더 가까운 특징을 학습한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.