[논문 리뷰] Distilling portable Generative Adversarial Networks for Image Translation
이 논문은 이미지 간 번역 작업에 대해 모바일 장치에 배포하기 위해 무거운 생성적 적대적 네트워크(GAN)를 압축하기 위한 지식 정련 프레임워크를 제안한다. 대규모 교사 GAN의 출력 및 특징 수준 분포를 가벼운 학생 생성기와 판별기로 모방하도록 훈련시킴으로써, 이 방법은 최대 93% 적은 파라미터와 93% 낮은 FLOPs를 기록하면서도 높은 이미지 품질과 인지적 품질을 유지하는 최신 기술 수준의 성능을 달성한다.
Despite Generative Adversarial Networks (GANs) have been widely used in various image-to-image translation tasks, they can be hardly applied on mobile devices due to their heavy computation and storage cost. Traditional network compression methods focus on visually recognition tasks, but never deal with generation tasks. Inspired by knowledge distillation, a student generator of fewer parameters is trained by inheriting the low-level and high-level information from the original heavy teacher generator. To promote the capability of student generator, we include a student discriminator to measure the distances between real images, and images generated by student and teacher generators. An adversarial learning process is therefore established to optimize student generator and student discriminator. Qualitative and quantitative analysis by conducting experiments on benchmark datasets demonstrate that the proposed method can learn portable generative models with strong performance.
연구 동기 및 목표
- 높은 계산 및 메모리 비용으로 인해 모바일 장치에 무거운 GAN을 구현하는 데 어려움이 존재하는 문제를 해결하기 위해.
- 이전에는 분류 모델에만 사용된 지식 정련을 생성 모델, 특히 이미지 간 번역을 위한 GAN에 확장하기 위해.
- 교사 GAN으로부터 학생 GAN으로 지식을 전달하여 생성기와 판별기를 동시에 압축하기 위해.
- 인지적 손실, L1 손실, 트리플릿 손실을 포함한 복합적인 손실 함수와 함께 적대적 훈련을 통해 경량 학생 모델의 성능을 향상시키기 위해.
- 쌍체계(pix2pix)와 비쌍체계(CycleGAN) 이미지 번역 작업 전반에 걸쳐 일반화 능력을 입증하기 위해.
제안 방법
- 학생 생성기는 교사 생성기의 출력 이미지와 특징 표현을 일치시키기 위해 L1 손실과 인지적 손실을 사용하여 훈련된다.
- 학생 판별기는 실제 이미지와 교사 및 학생 생성기로부터 생성된 이미지를 구분하도록 도입된다.
- 학생 GAN은 최소 최대 적대적 목적함수를 통해 최적화되어, 학생이 교사로부터 데이터 분포를 학습할 수 있도록 한다.
- 학생 생성기의 총 손실은 L1, 인지적, 그리고 교사로부터 온 지식 정련 손실을 포함한다.
- 학생 판별기의 총 손실은 실제 이미지와 교사 및 학생 네트워크로부터 생성된 이미지 기반의 적대적 손실을 포함한다.
- 이 프레임워크는 쌍체계(pix2pix)와 비쌍체계(CycleGAN) 이미지 번역 작업에 모두 적용되었으며, 일관된 성능 향상이 관찰되었다.
실험 결과
연구 질문
- RQ1지식 정련이 분류 모델 외에도 이미지 간 번역을 위한 GAN을 압축하는 데 효과적으로 적용될 수 있는가?
- RQ2학생 판별기를 함께 훈련시키는 것이 압축된 학생 생성기의 생성 품질을 향상시키는가?
- RQ3매우 적은 파라미터와 FLOPs를 갖는 학생 GAN이 이미지 번역 작업에서 무거운 교사 GAN의 성능을 따라잡을 수 있는가?
- RQ4L1, 인지적, 트리플릿 손실과 같은 다양한 손실 구성 요소가 정련된 학생 모델의 성능에 어떤 기여를 하는가?
- RQ5제안된 방법이 쌍체계 및 비쌍체계 이미지 번역 프레임워크를 포함한 다양한 GAN 아키텍처에 일반화 가능한가?
주요 결과
- 제안된 방법은 학생 생성기의 파라미터 수를 715.65K로 줄여 교사의 11.38M에서 93.7% 감소시키고, FLOPs는 47.19G에서 3.19G로 93.2% 감소시켰다.
- 말→용마리 및 여름→겨울 번역 작업에서, 정련된 학생 GAN은 교사 GAN과 유사한 이미지 품질을 달성했으며, 초기 학습 모델과 일반 정련 모델보다 뛰어난 성능을 보였다.
- 절단 실험 결과, L1, 인지적, 트리플릿 손실을 적대적 훈련과 함께 조합하면 FID와 LPIPS 점수가 가장 높게 나타나 각 구성 요소의 효과를 입증했다.
- 비쌍체계 CycleGAN 환경에서, 학생 모델의 파라미터 수가 교사의 1/16에 불과했음에도 불구하고 유사한 성능을 기록하여 강력한 일반화 능력을 입증했다.
- 학생 판별기는 생성된 이미지의 현실감을 크게 향상시켜 블러를 줄이고 품질을 향상시켰으며, 학생 판별기가 없는 모델에 비해 뚜렷한 개선 효과를 보였다.
- Cityscapes 데이터셋에서 이 방법은 52.22의 FID 점수를 기록하여 기준 학생 모델(53.15)과 일반 정련 모델(52.50)을 모두 뛰어넘었으며, 파라미터 수가 훨씬 적은 수준에서 성능을 달성했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.