Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Generate Noise for Multi-Attack Robustness

Divyam Madaan, Jinwoo Shin|arXiv (Cornell University)|2020. 06. 22.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 메타학습 프레임워크인 대칭성과 함께 메타 노이즈 생성기(MNG-AC)를 제안한다. 이는 청소년적 노이즈를 생성하여 여러 종류의 적대적 공격에 대한 강건성을 향상시키는 노이즈 생성기를 훈련한다. 스위치 적대적 훈련을 통해 정상, 적대적, 노이즈 증강 샘플 간의 레이블 일관성을 강제함으로써 MNG-AC는 최소한의 계산 오버헤드로 상태 최강의 다중 공격 강건성을 달성한다.

ABSTRACT

Adversarial learning has emerged as one of the successful techniques to circumvent the susceptibility of existing methods against adversarial perturbations. However, the majority of existing defense methods are tailored to defend against a single category of adversarial perturbation (e.g. $\ell_\infty$-attack). In safety-critical applications, this makes these methods extraneous as the attacker can adopt diverse adversaries to deceive the system. Moreover, training on multiple perturbations simultaneously significantly increases the computational overhead during training. To address these challenges, we propose a novel meta-learning framework that explicitly learns to generate noise to improve the model's robustness against multiple types of attacks. Its key component is Meta Noise Generator (MNG) that outputs optimal noise to stochastically perturb a given sample, such that it helps lower the error on diverse adversarial perturbations. By utilizing samples generated by MNG, we train a model by enforcing the label consistency across multiple perturbations. We validate the robustness of models trained by our scheme on various datasets and against a wide variety of perturbations, demonstrating that it significantly outperforms the baselines across multiple perturbations with a marginal computational cost.

연구 동기 및 목표

  • 기존 방어 기법이 단일 유형의 적대적 공격에 대해서만 효과가 있다는 한계를 해결하기 위해, 이는 실세계의 안전 중심 시스템에는 부적절하다.
  • 여러 변형을 동시에 고려한 모델 훈련의 높은 계산 비용을 줄이기 위해.
  • 정상, 적대적, 노이즈 증강 입력 간의 레이블 일관성을 강제하여 다양한 적대적 공격에 대한 모델 일반화 및 강건성을 향상시키기 위해.
  • 표준 다중 변형 적대적 훈련 대비 훈련 오버헤드를 최소화하면서도 높은 강건성을 유지하는 확장 가능한 훈련 기법을 개발하기 위해.

제안 방법

  • 메타학습을 통해 청소년적, 확률적인 노이즈를 생성하는 메타 노이즈 생성기(MNG)를 도입하여 정상 입력을 변형한다.
  • 훈련 중에 변형 분포에서 균일하게 샘플링하는 스위치 적대적 훈련(SAT)을 적용하여 계산 비용을 감소시킨다.
  • 동일한 입력의 정상, 적대적, 노이즈 증강된 형태 간에 동일한 예측 레이블을 강제하는 적대적 일관성(AC) 손실을 적용한다.
  • 두 단계 최적화를 활용한다: 첫째, 무작위로 선택된 변형 유형의 적대적 예제에서 손실을 최소화하기 위해 메타 기울기를 사용해 노이즈 생성기 φ(t)를 업데이트한다.
  • 분류기 θ(t)는 분류 손실(Lcls)과 적대적 일관성 손실(Lac)을 함께 최적화하여 강건성과 일반화를 향상시킨다.
  • 생성된 노이즈 증강 샘플을 활용해 결정 경계를 매끄럽게 하고 데이터 포인트에서 멀리 밀어내어 여러 공격 유형에 걸쳐 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1메타학습된 노이즈 생성기가 동시에 여러 다양하고 다른 종류의 적대적 공격에 대해 모델 강건성을 향상시킬 수 있는가?
  • RQ2다중 변형 적대적 훈련의 계산 비용은 강건성 손실 없이 어떻게 줄일 수 있는가?
  • RQ3정상, 적대적, 노이즈 증강 샘플 간의 레이블 일관성을 강제하면 결정 경계가 더 매끄럽고 일반화가 향상되는가?
  • RQ4제안된 방법은 재학습 없이도 공간 변형이나 JPEG 압축과 같은 새로운 공격에 일반화 가능한가?

주요 결과

  • MNG-AC는 ℓp-노름과 공간 공격을 함께 훈련할 때, CIFAR-10과 SVHN에서 각각 26.1%와 36.6%의 상대적 강건성 정확도 향상을 달성하며, 훨씬 낮은 훈련 비용으로 베이스라인을 능가한다.
  • CIFAR10-C에서 다섯 단계의 심각도와 예상치 못한 변형(예: 탄성, JPEG)을 고려할 때 MNG-AC는 강건성을 유지하며 분포 이탈에 대한 일반화 능력을 입증한다.
  • MNG-AC의 손실 곡면은 ℓ1, ℓ2, ℓ∞ 공격에서 단일 변형으로 훈련된 모델에 비해 상당히 더 매끄럽다. 이는 전역 최적 손실에 더 잘 일치함을 시사한다.
  • 잠재 공간에서의 결정 경계 시각화 결과 MNG-AC는 베이스라인 대비 적대적 예제를 결정 경계에서 더 멀리 밀어내는 것으로 나타났다. 이는 강건성을 향상시킨다.
  • MNG-AC는 SVHN과 CIFAR-10에서 다중 변형 베이스라인과 비교해 유사하거나 더 뛰어난 강건성을 달성하였으며, 훨씬 작은 계산 예산으로도 훈련이 가능했다.
  • 공간 변형과 JPEG 기반 변형과 같은 새로운 공격에 대해 효과적으로 일반화되며, 훈련 분포를 초월한 강건성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.