Skip to main content
QUICK REVIEW

[논문 리뷰] Rob-GAN: Generator, Discriminator, and Adversarial Attacker

Xuanqing Liu, Cho‐Jui Hsieh|arXiv (Cornell University)|2018. 07. 27.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

Rob-GAN은 생성적 적대적 프레임워크를 세 명의 플레이어(생성자, 판별자, 적대적 공격자)로 구성하여, 생성자, 판별자, 적대적 공격자를 동시에 최적화함으로써 GAN 훈련 수렴성과 분류기의 강건성을 향상시킨다. 적대적 공격을 GAN 훈련에 통합하고, GAN으로 생성된 데이터를 적대적 훈련에 활용함으로써, 더 빠른 수렴 속도, 더 높은 품질의 이미지 생성 성능, 강력한 $\infty$ll_{\infty}$ PGD 공격 하에서 ResNet18 기준 36.4%의 정확도를 달성하여 기존 최고 수준의 방어 방법을 초월한다.

ABSTRACT

We study two important concepts in adversarial deep learning---adversarial training and generative adversarial network (GAN). Adversarial training is the technique used to improve the robustness of discriminator by combining adversarial attacker and discriminator in the training phase. GAN is commonly used for image generation by jointly optimizing discriminator and generator. We show these two concepts are indeed closely related and can be used to strengthen each other---adding a generator to the adversarial training procedure can improve the robustness of discriminators, and adding an adversarial attack to GAN training can improve the convergence speed and lead to better generators. Combining these two insights, we develop a framework called Rob-GAN to jointly optimize generator and discriminator in the presence of adversarial attacks---the generator generates fake images to fool discriminator; the adversarial attacker perturbs real images to fool the discriminator, and the discriminator wants to minimize loss under fake and adversarial images. Through this end-to-end training procedure, we are able to simultaneously improve the convergence speed of GAN training, the quality of synthetic images, and the robustness of discriminator under strong adversarial attacks. Experimental results demonstrate that the obtained classifier is more robust than the state-of-the-art adversarial training approach, and the generator outperforms SN-GAN on ImageNet-143.

연구 동기 및 목표

  • 표준 GAN 훈련의 느린 수렴성과 불안정성을 해결하기 위해, 적대적 공격을 판별자의 훈련 목표에 통합한다.
  • GAN 생성자로부터 유도된 데이터 증강을 활용하여, 적대적으로 훈련된 분류기의 일반화 능력과 강건성을 향상시킨다.
  • 공통의 엔드 투 엔드 프레임워크를 통해 적대적 훈련과 GAN 훈련을 상호 보완적인 과정으로 통합한다.
  • 모드 붕괴를 완화하고 샘플 품질을 향상시키기 위한 조건부 GAN에 대한 새로운 훈련 손실을 개발한다.
  • GAN과 적대적 훈련을 결합함으로써 생성자 품질과 판별기 강건성이 동시에 향상됨을 실증적으로 검증한다.

제안 방법

  • 생성자는 가짜 이미지를 생성하고, 판별자는 진짜, 가짜, 그리고 적대적 이미지를 분류하는 세 플레이어 최소최대 게임을 제안한다.
  • 생성자, 판별자, 적대적 공격자를 번갈아가며 엔드 투 엔드 훈련 절차로 갱신하며, 판별자는 진짜, 가짜, 적대적 예제를 모두 기반으로 훈련된다.
  • AC-GAN 손실을 재구성하여 분류 손실을 진짜 이미지와 가짜 이미지로 별도의 항으로 분리함으로써, 모드 붕괴를 감소시키고 훈련 안정성을 향상시킨다.
  • 판별자 훈련 중에 $\infty$ll_{\infty}$-노름으로 제한된 적대적 공격(예: PGD)을 적용하여, 노이즈에 대한 강건성을 향상시킨다.
  • GAN로 생성된 샘플을 적대적 훈련의 데이터 증강 수단으로 활용하여, 미리 보지 않은 데이터에 대한 분류기의 일반화 능력을 향상시킨다.
  • 공통의 훈련 파이프라인을 통해 판별자는 자연스러운 이미지, 적대적 이미지, 생성된 이미지의 조합을 기반으로 훈련되며, 모든 구성 요소의 동시 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1적대적 공격을 적대적 훈련에 통합함으로써, 표준 적대적 훈련을 초월해 판별기의 강건성을 향상시킬 수 있는가?
  • RQ2적대적 공격자를 GAN 훈련에 통합함으로써, 수렴 속도를 가속화하고 생성된 이미지의 품질을 향상시킬 수 있는가?
  • RQ3제안된 손실 공식화가 조건부 GAN에서 모드 붕괴와 샘플 다양성에 어떤 영향을 미치는가?
  • RQ4생성자, 판별자, 공격자를 함께 훈련함으로써, 별도로 훈련된 GAN 또는 적대적 훈련에 비해 일반화 능력과 강건성이 얼마나 향상되는가?
  • RQ5적대적 훈련에서 GAN 생성 데이터를 증강 수단으로 사용함으로써, 강력한 공격 상황에서 분류기 정확도에 측정 가능한 향상이 발생하는가?

주요 결과

  • Rob-GAN은 $\infty$ll_{\infty}$ PGD 공격 하에서 ResNet18 기준 36.4%의 정확도를 달성하여, 기존 최고 수준의 적대적 훈련 방법 [23]의 29.6%를 상회한다.
  • 적대적 공격을 훈련 주기에 통합함으로써, GAN 훈련의 수렴 속도가 3~7배 가속화된다.
  • 143개 클래스로 구성된 ImageNet 서브셋에서 Rob-GAN은 $\delta_{\text{max}} = 0.01$ 조건 하에서 $\infty$ll_{\infty}$ PGD 공격에 대해 32.4%의 정확도를 기록하며, 베이스라인 적대적 훈련 방법을 초월한다.
  • 새로운 손실 공식화는 모드 붕괴를 크게 감소시켜, AC-GAN보다 더 선명하고 다양한 샘플을 생성함을 정성적 비교로 입증하였다.
  • 64px 및 128px ImageNet 서브셋에서 Rob-GAN은 SN-GAN을 초월하는 Inception 스코어를 확보하였으며, 단지 25~50 에포크 만에 더 뛰어난 성능을 달성하였다.
  • 적대적 공격을 GAN 훈련에 통합함으로써 수렴 속도가 가속화되고 생성자 품질이 향상되며, 최고의 성능는 신규 손실과 적대적 훈련을 동시에 적용했을 때 도달된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.