Skip to main content
QUICK REVIEW

[논문 리뷰] Parametric Noise Injection: Trainable Randomness to Improve Deep Neural Network Robustness against Adversarial Attack

Adnan Siraj Rakin, Zhezhi He|arXiv (Cornell University)|2018. 11. 22.
Adversarial Robustness in Machine Learning인용 수 11
한 줄 요약

이 논문은 적응 가능한 스케일링 파rameter를 가진 계층별 가우시안 노이즈를 적대적 훈련 중에 주입하는 훈련 가능한 랜덤성 기법인 Parametric Noise Injection (PNI)을 제안한다. PNI는 ResNet-20에서 PGD 공격 하에 기존의 적대적 훈련 대비 정상 데이터 정확도를 1.1% 향상시키고, 변형된 데이터 정확도를 6.8% 향상시켜 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recent development in the field of Deep Learning have exposed the underlying vulnerability of Deep Neural Network (DNN) against adversarial examples. In image classification, an adversarial example is a carefully modified image that is visually imperceptible to the original image but can cause DNN model to misclassify it. Training the network with Gaussian noise is an effective technique to perform model regularization, thus improving model robustness against input variation. Inspired by this classical method, we explore to utilize the regularization characteristic of noise injection to improve DNN's robustness against adversarial attack. In this work, we propose Parametric-Noise-Injection (PNI) which involves trainable Gaussian noise injection at each layer on either activation or weights through solving the min-max optimization problem, embedded with adversarial training. These parameters are trained explicitly to achieve improved robustness. To the best of our knowledge, this is the first work that uses trainable noise injection to improve network robustness against adversarial attacks, rather than manually configuring the injected noise level through cross-validation. The extensive results show that our proposed PNI technique effectively improves the robustness against a variety of powerful white-box and black-box attacks such as PGD, C & W, FGSM, transferable attack and ZOO attack. Last but not the least, PNI method improves both clean- and perturbed-data accuracy in comparison to the state-of-the-art defense methods, which outperforms current unbroken PGD defense by 1.1 % and 6.8 % on clean test data and perturbed test data respectively using Resnet-20 architecture.

연구 동기 및 목표

  • 비정상적인 외란이 가해진 입력이 잘못 분류를 유도하는, 인식할 수 없는 외란이 가해진 적대적 예제에 대한 딥 네ural 네트워크의 취약성을 해결한다.
  • PGD 및 C&W 공격와 같은 강력한 공격에 실패하거나 고정된 노이즈 수준에 의존하는 기존 방어 방법의 한계를 극복한다.
  • 정상 데이터 정확도를 훼손하지 않으면서 일반화 가능한, 훈련 가능한 정규화 방법을 개발한다.
  • 수동적 노이즈 설정보다 훈련 가능한 노이즈 주입이 우월하며, 기울기 가로막힘의 함정을 피할 수 있음을 입증한다.
  • 이행 가능한 공격 및 블랙박스 공격을 포함한 다양한 적대적 공격에 효과적인 방어 방법을 확립한다.

제안 방법

  • 훈련 중 활성화 또는 가중치 계층에 적용되는 훈련 가능한 노이즈 주입 메커니즘인 Parametric Noise Injection (PNI)을 도입한다.
  • 노이즈 스케일링 파rameter가 종단 간 최적화되는 min-max 적대적 훈련 프레임워크 내에 PNI를 통합한다.
  • 각 계층의 학습 가능한 노이즈 스케일링 계수를 사용해 노이즈 강도를 동적으로 조정함으로써 수동 하이퍼파ram터 튜닝을 대체한다.
  • 계층 전용 훈련 가능한 파rameter를 가진 가우시안 노이즈를 네트워크 활성화 또는 가중치에 주입하여 적응 가능한 강건성 학습을 가능하게 한다.
  • PGD, FGSM 및 C&W 공격를 통해 생성된 적대적 예제를 사용해 모델을 훈련하며, 순방향 및 역방향 전파 모두에서 노이즈 주입을 적용한다.
  • 적대적 외란 하에서 네트워크 가중치와 노이즈 파ram터의 공동 최적화를 통해 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1훈련 가능한 노이즈 주입이 다양한 백색 상자 및 블랙박스 적대적 공격에 대해 딥 네럴 네트워크의 강건성을 향상시킬 수 있는가?
  • RQ2종단 간 최적화를 통해 각 계층의 노이즈 강도를 학습하는 것이 수동으로 튜닝된 고정된 노이즈 수준보다 우월한가?
  • RQ3PNI는 기존 방어 방법이 정상 데이터 정확도를 희생시키는 것과 달리, 정상 데이터 및 변형된 데이터 정확도를 동시에 향상시킬 수 있는가?
  • RQ4PNI의 강건성 향상 효과가 기울기 가로막힘 때문인지, 진정한 적대적 강건성 때문인가?
  • RQ5PGD 공격의 강도가 증가함에 따라, 예를 들어 공격 단계 수가 늘어나거나 외란 범위가 커지면 PNI는 어떻게 성능을 보이는가?

주요 결과

  • PNI는 ResNet-20에서 기존의 적대적 훈련 대비 정상 데이터 정확도를 1.1% 향상시켜 일반화 능력 향상을 입증한다.
  • PGD 백색 상자 공격 하에서 PNI는 최신 기술 수준의 손상되지 않은 PGD 방어 기법 대비 변형된 데이터 정확도를 6.8% 향상시킨다.
  • PNI는 다양한 공격, 즉 FGSM, C&W, ZOO 및 이행 가능한 공격에 대해 여러 아키텍처에서 강력한 강건성을 유지한다.
  • PNI는 [23]에서 제시한 모든 기울기 가로막힘 검사를 통과하여, 강건성이 기울기 가로막힘 때문이 아니라 진정한 적대적 강건성임을 시사한다.
  • PGD 공격 단계 수가 증가함에 따라(최대 100단계까지)도 PNI는 기존의 적대적 훈련 대비 뛰어난 성능을 유지하며, 확률적 기울기 효과를 초월한 내구성을 확인한다.
  • Table 5에서 보듯이, PNI는 블랙박스 공격 시나리오에서 활성화 수준의 노이즈 주입보다 가중치 수준의 노이즈 주입이 더 효과적임을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.