Skip to main content
QUICK REVIEW

[논문 리뷰] Regularizers for Single-step Adversarial Training

B S Vivek, R. Venkatesh Babu|arXiv (Cornell University)|2020. 02. 03.
Adversarial Robustness in Machine Learning참고 문헌 35인용 수 5
한 줄 요약

이 논문은 단일 스텝 적대적 훈련을 위한 세 가지 새로운 정규화 항을 제안하며, 기울기 가림을 완화하고 계산 비용이 높은 다단계 적대적 훈련과 비슷한 강건성을 달성할 수 있도록 한다. 강건한 모델의 핵심 특성인 손실 단조성과 표면의 매끄러움을 강제로 구현함으로써, 정규화 항은 효율적인 단일 스텝 FGSM 기반 훈련을 가능하게 하여 비반복적 공격과 반복적 공격 모두에 강건한 모델을 생성한다.

ABSTRACT

The progress in the last decade has enabled machine learning models to achieve impressive performance across a wide range of tasks in Computer Vision. However, a plethora of works have demonstrated the susceptibility of these models to adversarial samples. Adversarial training procedure has been proposed to defend against such adversarial attacks. Adversarial training methods augment mini-batches with adversarial samples, and typically single-step (non-iterative) methods are used for generating these adversarial samples. However, models trained using single-step adversarial training converge to degenerative minima where the model merely appears to be robust. The pseudo robustness of these models is due to the gradient masking effect. Although multi-step adversarial training helps to learn robust models, they are hard to scale due to the use of iterative methods for generating adversarial samples. To address these issues, we propose three different types of regularizers that help to learn robust models using single-step adversarial training methods. The proposed regularizers mitigate the effect of gradient masking by harnessing on properties that differentiate a robust model from that of a pseudo robust model. Performance of models trained using the proposed regularizers is on par with models trained using computationally expensive multi-step adversarial training methods.

연구 동기 및 목표

  • 기울기 가림으로 인해 발산하는 단일 스텝 적대적 훈련의 한계를 해결하기 위해.
  • 단일 스텝 방법을 통해 강건성을 달성함으로써 계산 비용과 강건성 사이의 상충 관계를 극복하기 위해.
  • 강건한 모델의 내재적 특성(예: 손실 단조성, 매끄러운 손실 표면)을 식별하고 정규화 신호로 활용하기 위해.
  • 반복적인 적대적 샘플 생성이 필요 없는 효율적인 정규화 항을 개발하여 훈련 속도를 유지하기 위해.
  • PGD, TRADES와 같은 다단계 적대적 훈련 수준의 강건성을 달성하면서도 단일 스텝 방법의 효율성을 유지하기 위해.

제안 방법

  • 단일 스텝 적대적 훈련에 강건성을 유도하는 인도크티브 비스를 삽입하는 세 가지 별도의 정규화 항인 SAT-R1, SAT-R2, SAT-R3를 제안한다.
  • SAT-R1은 배치당 하나의 샘플에 대해 반복적 FGSM(IFGSM)을 적용하여 기울기 안정성과 가림을 감소시킨다.
  • SAT-R2는 무작위로 설정된 변형 방향을 가진 수정된 FGSM(R-FGSM)을 적용하여 반복 단계 없이도 강건성을 향상시킨다.
  • SAT-R3는 두 가지 다른 변형 크기(ε_low 및 ε_high)를 사용하여, 그 기울기 부호가 동일함을 활용해 계산량을 줄인다.
  • 모든 정규화 항은 표준 FGSM 기반 적대적 훈련에 통합되어 있으며, 각 적대적 샘플당 한 번의 전파만으로 계산 비용을 유지한다.
  • 정규화 항은 변형에 대한 일관된 손실 행동을 장려함으로써 손실 단조성과 매끄러움을 강제함으로써 기울기 가림을 완화한다.

실험 결과

연구 질문

  • RQ1반복적인 기울기 계산 없이도 단일 스텝 적대적 훈련이 다단계 방법과 비슷한 강건성을 달성할 수 있는가?
  • RQ2강건한 모델의 특정 특성(예: 손실 단조성, 표면의 매끄러움) 중 어떤 것이 정규화 신호로 활용될 수 있는가?
  • RQ3효율적이고 반복적이지 않은 정규화 항을 통해 단일 스텝 적대적 훈련에서의 기울기 가림을 어떻게 완화할 수 있는가?
  • RQ4강건한 모델의 구조적 특성을 강제하는 정규화 항이 비반복적 및 반복적 공격에 대한 일반화 능력을 향상시킬 수 있는가?
  • RQ5다양한 정규화 항 설계에서 강건성과 훈련 효율성 사이의 상충 관계는 어떠한가?

주요 결과

  • 제안된 정규화 항(SAT-R1, SAT-R2, SAT-R3)을 사용해 훈련한 모델은 PGD-AT 및 TRADES와 같이 계산 비용이 높은 다단계 방법과 비슷한 강건성을 달성한다.
  • SAT-R1과 SAT-R2는 기울기 가림에 대한 더 강력한 정규화로 인해 PGD-40 및 PGD-100 공격에 대해 SAT-R3보다 더 높은 강건성을 보인다.
  • SAT-R3는 세 가지 중에서 가장 낮은 계산 비용을 기록하며, 각 적대적 샘플당 한 번의 전파만으로 계산을 유지하여 대규모 훈련에 적합하다.
  • SAT-R1/SAT-R2를 사용해 몇 에포크 동안 SAT-R3 모델을 미세조정하거나 사전학습하면 강건성이 크게 향상되며, 이는 정규화 항 신호의 이식 가능성을 보여준다.
  • 손실 표면 플롯은 정규화 항을 사용해 훈련된 모델에서 부드럽고 진동 없는 행동을 보이며, 날카움 감소와 일반화 능력 향상을 확인한다.
  • 손실 표면 플롯은 정규화 항이 효과적으로 기울기 가림을 완화했음을 입증하며, MNIST, CIFAR-10, ImageNet-Subset에서 FGSM 및 PGD 공격 모두에 대해 일관된 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.