Skip to main content
QUICK REVIEW

[논문 리뷰] AdvGAN++ : Harnessing latent layers for adversary generation

Puneet Mangla, Surgan Jandial|Research Archive of Indian Institute of Technology Hyderabad (Indian Institute of Technology Hyderabad)|2019. 08. 02.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 11
한 줄 요약

AdvGAN++는 원본 입력 이미지 대신 타겟 모델의 잠재 특징 맵을 사전 정보로 사용하여 적대적 예제 생성을 향상시킨다. 이는 더 효과적이고 시각적으로 현실적인 공격을 가능하게 하며, MNIST 및 CIFAR-10에서 방어 훈련 조건 하에서도 AdvGAN보다 공격 성공률가 높다. 또한 인코더-디코더 생성기의 필요성을 제거함으로써 훈련 및 추론 오버헤드를 감소시킨다.

ABSTRACT

Adversarial examples are fabricated examples, indistinguishable from the original image that mislead neural networks and drastically lower their performance. Recently proposed AdvGAN, a GAN based approach, takes input image as a prior for generating adversaries to target a model. In this work, we show how latent features can serve as better priors than input images for adversary generation by proposing AdvGAN++, a version of AdvGAN that achieves higher attack rates than AdvGAN and at the same time generates perceptually realistic images on MNIST and CIFAR-10 datasets.

연구 동기 및 목표

  • AdvGAN이 입력 이미지를 사전 정보로 사용하는 데서 비롯하는 한계를 해결하기 위해, 이는 가장 취약한 표현 방식을 활용하지 못할 수 있음.
  • 잠재 특징(적대적 편향에 더 취약한 것으로 알려진)이 효과적인 적대적 예제 생성을 위한 더 나은 사전 정보가 될 수 있는지 조사하기 위해.
  • 잠재 특징에서 적대적 이미지로의 직접 매핑을 통해 인코더-디코더 생성기 아키텍처를 대체함으로써 훈련 및 추론 오버헤드를 줄이기 위해.
  • 방어된 및 방어되지 않은 모델에서 적대적 예제의 시각적 현실성과 공격 성공률을 향상시키기 위해.

제안 방법

  • AdvGAN++의 생성기는 타겟 모델 M의 중간 레이어에서 추출한 잠재 특징 맵 f(x)와 무작위 노이즈 벡터 z를 입력으로 받아, 적대적 이미지 x_adv = G(z|f(x))를 생성한다.
  • 생성기는 GAN 손실, 타겟 모델 M을 오도시키기 위한 적대적 손실, 원본 이미지로부터의 최소 왜곡을 보장하기 위한 L2 편향 손실을 통해 훈련된다.
  • 판별기는 실제 이미지와 생성된 적대적 예제를 구분함으로써 생성기의 출력이 현실적으로 보이도록 유도한다.
  • 손실 함수는 GAN 손실, 적대적 손실 L_adv = E_x[M_t(G(z|f(x)))], 및 편향 손실 L_pert = E_x||x - G(z|f(x))||_2를 하이퍼파rameter α와 β로 가중하여 조합한다.
  • 특징 추출은 타겟 모델의 마지막 합성곱 레이어를 사용하며, 생성기는 확률적 경사 하강법을 통해 엔드 투 엔드로 훈련된다.
  • 이 방법은 AdvGAN의 인코더-디코더 구조를 피함으로써 아키텍처를 단순화하고 계산 비용을 감소시킨다.

실험 결과

연구 질문

  • RQ1심층 신경망의 중간 레이어에서 추출한 잠재 특징이 원본 입력 이미지보다 적대적 예제 생성에 더 효과적인 사전 정보가 될 수 있는가?
  • RQ2AdvGAN의 인코더-디코더 생성기를 잠재 특징에서 직접 생성하는 방식으로 대체할 경우, 공격 성공률과 시각적 품질이 향상되는가?
  • RQ3AdvGAN++는 다른 모델로의 전이성(transferability)을 어느 정도 유지하는가, 특히 블랙박스 공격 시나리오에서?
  • RQ4AdvGAN++는 FGSM, 반복적 FGSM, 앙상블 적대적 훈련과 같은 다양한 방어 훈련 전략 하에서 어떻게 성능을 발휘하는가?

주요 결과

  • LeNet-C를 사용한 MNIST에서 방어 조치 없이 AdvGAN++는 98.4%의 공격 성공률를 기록했으며, 이는 AdvGAN의 97.9%보다 높다.
  • Wide-ResNet-34-10를 사용한 CIFAR-10에서 방어 조치 없이 AdvGAN++는 99.92%의 공격 성공률를 달성했으며, 이는 AdvGAN의 99.3%를 초월한다.
  • FGSM 적대적 훈련 하에서 MNIST에서 AdvGAN++는 27.31%의 공격 성공률를 기록했으며, 이는 AdvGAN의 13.5%보다 높다.
  • CIFAR-10에서 Wide-ResNet-34-10를 사용한 반복적 FGSM 훈련 하에서 AdvGAN++는 43.2%의 공격 성공률를 기록했으며, 이는 AdvGAN의 13.94%보다 뚜렷이 뛰어나다.
  • CIFAR-10에서 AdvGAN++의 적대적 예제는 ResNet-32 모델로 89.4%의 성공률로 전이되었으며, 강력한 전이성(transferability)을 보였다.
  • 시각적 결과는 AdvGAN++가 고도의 왜곡 제약 조건 하에서도 실제 이미지와 시각적으로 구분되지 않는 적대적 예제를 생성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.