Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Rapid and Robust Adversarial Training with One-Step Attacks

Leo Schwinn, René Raab|arXiv (Cornell University)|2020. 02. 24.
Adversarial Robustness in Machine Learning참고 문헌 32인용 수 5
한 줄 요약

이 논문은 일괄적 FGSM 공격에 노이즈 주입을 통해 향상시킨 빠르고 강건한 적대적 훈련 방법을 제안한다. 입력 데이터에 균일한 노이즈를 추가하고, 학습 가능한 픽셀 단위 노이즈 주입 레이어(PNIL)를 도입함으로써 기울기 가로막힘을 방지하고, PGD 기반 훈련과 비교해도 유사하거나 이를 초월하는 강건성을 달성하며, 계산 비용을 크게 줄였다.

ABSTRACT

Adversarial training is the most successful empirical method for increasing the robustness of neural networks against adversarial attacks. However, the most effective approaches, like training with Projected Gradient Descent (PGD) are accompanied by high computational complexity. In this paper, we present two ideas that, in combination, enable adversarial training with the computationally less expensive Fast Gradient Sign Method (FGSM). First, we add uniform noise to the initial data point of the FGSM attack, which creates a wider variety of adversaries, thus prohibiting overfitting to one particular perturbation bound. Further, we add a learnable regularization step prior to the neural network, which we call Pixelwise Noise Injection Layer (PNIL). Inputs propagated trough the PNIL are resampled from a learned Gaussian distribution. The regularization induced by the PNIL prevents the model form learning to obfuscate its gradients, a factor that hindered prior approaches from successfully applying one-step methods for adversarial training. We show that noise injection in conjunction with FGSM-based adversarial training achieves comparable results to adversarial training with PGD while being considerably faster. Moreover, we outperform PGD-based adversarial training by combining noise injection and PNIL.

연구 동기 및 목표

  • 실용적 배포를 제한하는 높은 계산 비용을 유발하는 PGD 기반 적대적 훈련 문제를 해결한다.
  • 기울기 가로막힘으로 인해 표준 FGSM 기반 훈련이 더 강력한 공격에 일반화되지 못하는 문제를 해결한다.
  • 학습 가능한 노이즈 주입을 통한 입력 수준의 데이터 증강을 도입하여 일괄적 적대적 훈련의 강건성을 향상시킨다.
  • 훈련 시간을 줄이며 PGD 성능을 따라하거나 초월하는 안정적이고 효과적인 FGSM 기반 훈련을 가능하게 한다.

제안 방법

  • 일괄적 FGSM 공격 전에 입력에 균일한 노이즈를 추가하여 변형된 공격 범위를 다양화하고 단일 공격 경계에 대한 과적합을 줄이기 위해 노이즈 강화 FGSM(NFGSM)을 도입한다.
  • 재파arameterization 기법을 사용해 학습 가능한 가우시안 분포에서 입력 특징을 재표본화하는 학습 가능한 픽셀 단위 노이즈 주입 레이어(PNIL)를 제안한다.
  • PNIL을 백프로파게이션을 통해 엔드 투 엔드로 훈련시켜, 강건성을 향상시키는 최적의 입력 분산 분포를 네트워크가 학습하도록 한다.
  • PNIL을 네트워크의 첫 번째 레이어로 사용하여 입력을 정규화하고, 공격적 변형이 네트워크를 통과하기 전에 약화시키는 효과를 얻는다.
  • NFGSM과 PNIL을 조합하여 FGSM 기반 훈련의 안정성을 높이고, 이전 일괄적 방법에서 발생하는 기울기 가로막힘 문제를 방지한다.
  • VAE와 마찬가지로 KL 발산 손실을 사용하지 않고, 대신 네트워크의 분류 손실에 의존하여 PNIL의 파라미터 학습을 이끈다.

실험 결과

연구 질문

  • RQ1입력 수준의 데이터 증강을 통해 향상된 일괄적 FGSM 기반 적대적 훈련이 다단계 PGD 훈련과 유사한 강건성을 달성할 수 있는가?
  • RQ2입력 공간에서의 노이즈 주입이 FGSM 기반 훈련의 주요 실패 원인인 기울기 가로막힘을 방지하는가?
  • RQ3학습 가능한, 미분 가능한 노이즈 레이어(PNIL)가 추론 복잡도를 증가시키지 않으면서 일반화 및 강건성을 향상시킬 수 있는가?
  • RQ4NFGSM과 PNIL의 조합은 표준 PGD 기반 훈련과 비교해 강건성과 훈련 효율성 측면에서 어떻게 성능을 내는가?
  • RQ5PNIL이 학습한 분산 분포가 관련 특징을 유지하면서 배경 노이즈를 억제하여 타겟 공격에 대한 강건성을 향상시키는가?

주요 결과

  • 입력 노이즈를 사용한 NFGSM 기반 훈련은 다양한 공격 경계에서 표준 RFGSM보다 略적으로 더 높은 강건성을 달성하며, 특히 약한 공격에 대해 유리하다.
  • PNIL은 일반적으로 표준 FGSM로 훈련된 모델가 깨지는 기울기 없는 공격(SPSA)에 대해 강건성을 크게 향상시킨다.
  • PNIL과 NFGSM으로 훈련된 모델는 일괄적 공격을 사용하고도 PGD 기반 적대적 훈련을 초월하는 강건성을 확보한다.
  • PNIL은 배경 영역에 더 높은 분산을 할당하고, 전경 객체에는 더 낮은 분산을 할당하는 방식으로 학습하여, 핵심 영역에서 공격적 노이즈를 효과적으로 걸러낸다.
  • PGD에 비해 훈련 시간을 수개월 단위로 줄여 계산 비용을 극적으로 감소시켰다. 이는 최소한의 계산 오버헤드로 단일 단계 FGSM 공격에 의존하기 때문이다.
  • PNIL은 네트워크가 기울기 마스킹을 악용할 수 없도록 하여 기울기 가로막힘을 방지함으로써 더 신뢰할 수 있고 일반화 능력이 뛰어난 강건성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.