[논문 리뷰] GAN Slimming: All-in-One GAN Compression by A Unified Optimization Framework
이 논문은 생성적 적대적 네트워크(GAN)의 엔드 투 엔드 압축을 위한 최초의 통합 최적화 프레임워크인 GAN 슬리밍(GS)을 제안한다. 이는 단일 최소화 최대 목표 함수 내에서 모델 distillation, 채널 프루닝, 양자화를 동시에 최적화한다. 이는 카툰GAN의 경우 최대 47배의 압축을 달성하면서도 품질 저하를 최소화하며, 개별적으로 적용되는 압축 기법을 사용하는 기존 최고 수준의 방법들을 능가한다.
Generative adversarial networks (GANs) have gained increasing popularity in various computer vision applications, and recently start to be deployed to resource-constrained mobile devices. Similar to other deep models, state-of-the-art GANs suffer from high parameter complexities. That has recently motivated the exploration of compressing GANs (usually generators). Compared to the vast literature and prevailing success in compressing deep classifiers, the study of GAN compression remains in its infancy, so far leveraging individual compression techniques instead of more sophisticated combinations. We observe that due to the notorious instability of training GANs, heuristically stacking different compression techniques will result in unsatisfactory results. To this end, we propose the first unified optimization framework combining multiple compression means for GAN compression, dubbed GAN Slimming (GS). GS seamlessly integrates three mainstream compression techniques: model distillation, channel pruning and quantization, together with the GAN minimax objective, into one unified optimization form, that can be efficiently optimized from end to end. Without bells and whistles, GS largely outperforms existing options in compressing image-to-image translation GANs. Specifically, we apply GS to compress CartoonGAN, a state-of-the-art style transfer network, by up to 47 times, with minimal visual quality degradation. Codes and pre-trained models can be found at https://github.com/TAMU-VITA/GAN-Slimming.
연구 동기 및 목표
- 자원 제약이 있는 모바일 디바이스에 파rameter가 많은 GAN을 구현하는 데 도전하는 것.
- 여러 압축 기법을 결합할 때 자주 발생하는 훈련의 불안정성으로 인한 성능 붕괴 문제를 해결하는 것.
- GAN에 대해 distillation, 프루닝, 양자화 등의 다중 압축 방법을 동시에 최적화하는 통합 최적화 프레임워크를 개발하는 것.
- 단일 압축 기법을 히우리스틱하게 쌓는 것보다 통합 최적화가 상당히 뛰어난 성능을 내는지 확인하는 것.
- 효율적이고 엔드 투 엔드적인 압축을 통해 고품질 GAN을 실질적으로 모바일 디바이스에 구현할 수 있도록 하는 것.
제안 방법
- 모델 distillation, 채널 프루닝, 양자화를 단일 통합 최적화 목표 함수에 통합하여 GAN의 최소화 최대 손실과 함께 공동으로 훈련한다.
- 모든 압축 기법에 대해 엔드 투 엔드 최적화가 가능한 통합 가능한 미분 가능한 목표 함수를 사용한다.
- 채널 프루닝을 위해 구조적 희박성 제약 조건을 적용하고, 가중치 이진화 과정에서 성능 유지에 기여하는 양자화 인식 훈련을 통합한다.
- 교사 네트워크의 특징 맵과 출력 분포를 모방하도록 학습시켜 학생 생성자에 지식 전이 기반 distillation을 구현한다.
- GAN 성능에 필수적인 적대적 훈련 역학을 유지하기 위해 최소화 최대 훈련 목표 함수를 사용한다.
- 고수준의 의미적 콘텐츠를 유지하기 위해 distillation 과정에서 인지적 손실을 감독 신호로 활용한다.
실험 결과
연구 질문
- RQ1여러 압축 기법을 하나의 프레임워크에 효과적으로 통합할 수 있는가? 이는 훈련의 불안정성을 유발하지 않고도 가능할까?
- RQ2통합 최적화 접근 방식이 GAN에서 단일 기법을 순차적 또는 히우리스틱하게 쌓는 것보다 상당히 뛰어난 성능을 내는가?
- RQ3최소화 최대 목표 함수의 통합이 압축된 GAN의 성능에 어떤 영향을 미치는가?
- RQ4distillation, 프루닝, 양자화의 통합 최적화를 통해 FLOPs와 모델 크기를 얼마나 줄일 수 있으며, 동시에 이미지 품질은 어떻게 유지되는가?
- RQ5제안된 프레임워크는 사이클 일致성이 없는 GAN, 예를 들어 인코더-디코더 스타일의 전이 네트워크 등에도 일반화 가능한가?
주요 결과
- GAN 슬리밍은 카툰GAN에 대해 FLOPs 기준 최대 47배의 압축과 모델 크기 기준 235배의 감소를 달성했으며, 시각적 품질 저하가 최소한이었다.
- GS-8은 FLOPs 기준 47배의 감소(56.46 GFLOPs → 1.20 GFLOPs)와 모델 크기 기준 235배 감소(42.34 MB → 0.18 MB)를 달성했으며, 높은 품질의 만화화 효과를 유지했다.
- GS-32는 FLOPs 기준 42배의 압축(1.34 GFLOPs)을 달성했고, 모델 크기는 0.80 MB로 줄였으며, GD에서 수작업으로 설계된 학생 네트워크보다 FID 점수와 시각적 품질에서 뚜렷한 성능 향상을 보였다.
- distillation 이후 프루닝(D+CP) 또는 후행 양자화(postQ)와 같이 압축 기법을 단순히 나열적으로 쌓는 것은 치명적인 성능 저하를 초래했으며, 이는 통합 최적화의 필요성을 입증한다.
- distillation 과정에서 인지적 손실 대신 MSE 손실을 사용할 경우 이미지 품질이 열악해지며, 이는 고수준 의미적 감독의 중요성을 확인한다.
- 압축 프레임워크에 최소화 최대 목표 함수를 통합한 결과, 적대적 훈련을 사용하지 않는 CEC와 같은 방법보다 성능 향상이著명했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.