[논문 리뷰] Improving the Speed and Quality of GAN by Adversarial Training
이 논문은 아키텍처적 혁신이나 강력한 정규화 없이도 GAN 학습 속도와 이미지 품질을 향상시키는 간단하면서도 효과적인 학습 알고리즘인 FastGAN을 제안한다. 판별자에 추가적인 적대적 학습 루프를 도입함으로써, FastGAN은 순수한 ResNet 생성자와 판별자를 사용하여 CIFAR10, CIFAR100, ImageNet에서 최신 기술(SOTA) 수준의 Inception Score와 FID를 달성한다. 이는 2~4개의 GPU만을 사용하여도 달성된다. SNGAN과 SAGAN을 능가한다.
Generative adversarial networks (GAN) have shown remarkable results in image generation tasks. High fidelity class-conditional GAN methods often rely on stabilization techniques by constraining the global Lipschitz continuity. Such regularization leads to less expressive models and slower convergence speed; other techniques, such as the large batch training, require unconventional computing power and are not widely accessible. In this paper, we develop an efficient algorithm, namely FastGAN (Free AdverSarial Training), to improve the speed and quality of GAN training based on the adversarial training technique. We benchmark our method on CIFAR10, a subset of ImageNet, and the full ImageNet datasets. We choose strong baselines such as SNGAN and SAGAN; the results demonstrate that our training algorithm can achieve better generation quality (in terms of the Inception score and Frechet Inception distance) with less overall training time. Most notably, our training algorithm brings ImageNet training to the broader public by requiring 2-4 GPUs.
연구 동기 및 목표
- 제한된 계산 자원 하에서 GAN의 학습 속도, 모델 표현력, 샘플 품질 간의 상충 관계를 해결하기 위해.
- 스펙트럴 정규화, 큰 배치 학습, 또는 TTUR와 같은 계산 비용이 큰 기법에 의존하지 않으면서도 성능을 유지하거나 향상시키기 위해.
- 기본 하드웨어(2~4개의 GPU)에서도 고성능 ImageNet 학습을 가능하게 하여 고급 GAN 학습을 더 넓은 대상에게 접근 가능하게 하기 위해.
- 일반적인 ResNet 기반 생성자와 판별자가 새로운 적대적 학습 기법과 조합될 경우 강력한 성능을 낼 수 있음을 보여주기 위해.
제안 방법
- 판별자가 더 강건하고 일반화 능력을 향상시키기 위해 추가적인 적대적 학습 단계를 거치는 이중 루프 적대적 학습 전략을 도입한다.
- 기본 GAN 손실과 편향 기반 적대적 목표를 결합한 수정된 손실 함수를 사용하여 판별자의 안정성과 기울기 흐름을 향상시킨다.
- 학습 중 판별자에 대한 적대적 예제를 생성하기 위해 제한된 편향(제어 변수 $c_{ ext{max}}$)을 가진 프로젝션 기반 강력한 경로 내림걸음(PGD) 공격을 적용한다.
- 개선된 손실 함수를 판별자에 적용하여 실제 데이터와 적대적으로 편향된 가짜 샘플을 구분하도록 학습시킴으로써 일반화 능력을 향상시킨다.
- 명시적인 TTUR을 사용하지 않지만, 학습 동역학을 통해 이중 시간 척도 업데이트 규칙을 암묵적으로 활용한다.
- 자기주의 주의, 노이즈가 포함된 스케일 연결, 또는 가중치 정규화를 사용하지 않고, 생성자와 판별자 양쪽 모두에 표준 ResNet 아키텍처를 사용한다.
실험 결과
연구 질문
- RQ1스펙트럴 정규화, 자기주의 주의, 또는 큰 배치 학습 없이도 일반적인 ResNet 기반 GAN이 높은 품질의 이미지 생성을 달성할 수 있는가?
- RQ2판별자에 보조 적대적 학습 루프를 추가하면 학습 속도와 샘플 품질이 향상되는가?
- RQ3제안된 방법으로 2~4개의 GPU만으로도 고해상도 GAN을 ImageNet에서 학습시킬 수 있는가? 이는 진입 장벽을 낮춘다.
- RQ4SNGAN과 SAGAN과 비교해 볼 때, 제안된 적대적 학습 기법은 다양한 데이터셋에서 FID와 Inception Score 측면에서 어떻게 성능을 내는가?
- RQ5hyperparameter인 $c_{ ext{max}}$는 최종 생성 품질과 학습 안정성에 어떤 영향을 미치는가?
주요 결과
- FastGAN은 2개의 GPU만으로 ImageNet-143(128×128)에서 FID 14.48을 달성했으며, SNGAN(FID: 30.83)과 RobGAN(FID: 33.98)을 뛰어넘는 성능을 보였다. 학습 시간은 절반 미만으로 줄였다.
- CIFAR10에서 FastGAN은 Inception Score 8.87과 FID 17.27을 기록했으며, 기준선인 RobGAN(IS: 6.26, FID: 43.69)을 뛰어넘었고, 더 뛰어난 클래스 내 다양성을 보였다.
- CIFAR10에서 FastGAN은 1000단계당 95.5초로 SNGAN(245.1초)보다 3~4배 더 빠르게 학습되며, 더 나은 또는 동등한 지표를 달성했다.
- ImageNet-143(64×64)에서 FastGAN은 1개의 GPU로 36,100초 만에 학습을 완료했고, SNGAN은 222,000초가 소요되어 6배 빠른 속도를 기록했다. FID는 12.04(우리) 대비 29.70(SNGAN)로 더 우수했다.
- ImageNet-143에서 FastGAN의 학습 시간을 연장하면 성능이 더욱 향상되었으며(IS: 42.91, FID: 11.98) 이는 더 긴 학습 시간으로 추가 향상 가능성을 시사한다.
- 제거 분석 결과, $c_{ ext{max}} = 0.006$가 CIFAR10과 CIFAR100 양쪽에서 최적의 성능를 낼 수 있었으며, 강건성과 학습 안정성의 균형을 잘 이룩했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.