[论文解读] Distilling portable Generative Adversarial Networks for Image Translation
本文提出了一种知识蒸馏框架,用于压缩重型生成对抗网络(GANs),以实现在图像到图像翻译任务中在移动设备上的部署。通过训练一个轻量级学生生成器和判别器,使其模仿大型教师 GAN 的输出分布和特征级分布,该方法在参数量减少高达 93%、浮点运算量(FLOPs)降低 93% 的同时,仍保持了较高的图像保真度和感知质量,实现了当前最优性能。
Despite Generative Adversarial Networks (GANs) have been widely used in various image-to-image translation tasks, they can be hardly applied on mobile devices due to their heavy computation and storage cost. Traditional network compression methods focus on visually recognition tasks, but never deal with generation tasks. Inspired by knowledge distillation, a student generator of fewer parameters is trained by inheriting the low-level and high-level information from the original heavy teacher generator. To promote the capability of student generator, we include a student discriminator to measure the distances between real images, and images generated by student and teacher generators. An adversarial learning process is therefore established to optimize student generator and student discriminator. Qualitative and quantitative analysis by conducting experiments on benchmark datasets demonstrate that the proposed method can learn portable generative models with strong performance.
研究动机与目标
- 为解决由于计算和内存成本过高,难以在移动设备上部署重型 GAN 的挑战。
- 将知识蒸馏——此前仅用于分类任务——扩展至生成模型,特别是用于图像到图像翻译的 GAN。
- 通过从教师 GAN 向学生 GAN 转移知识,联合压缩生成器和判别器。
- 通过引入感知损失、L1 损失和三元组损失,结合对抗训练,提升轻量级学生模型的性能。
- 在成对(pix2pix)和无配对(CycleGAN)图像翻译任务中均展示方法的泛化能力。
提出的方法
- 使用 L1 损失和感知损失训练学生生成器,以匹配教师生成器的输出图像和特征表示。
- 引入学生判别器,用于区分真实图像与来自教师和学生生成器的生成图像。
- 通过最小最大对抗目标优化学生 GAN,使学生能够从教师网络学习数据分布。
- 学生生成器的总损失包括来自教师网络的 L1 损失、感知损失和知识蒸馏损失。
- 学生判别器的总损失包括基于真实图像以及来自教师和学生网络生成图像的对抗损失。
- 该框架在成对(pix2pix)和无配对(CycleGAN)图像翻译任务中均应用,且性能提升一致。
实验结果
研究问题
- RQ1知识蒸馏能否有效应用于压缩用于图像到图像翻译的 GAN,而不仅限于分类模型?
- RQ2联合训练学生判别器是否能提升压缩后学生生成器的生成质量?
- RQ3一个参数量和浮点运算量显著减少的学生 GAN 能否在图像翻译任务中达到与重型教师 GAN 相当的性能?
- RQ4不同损失组件(L1、感知、三元组)如何分别贡献于蒸馏后学生模型的性能?
- RQ5所提方法是否能在不同 GAN 架构之间泛化,如成对与无配对图像翻译框架?
主要发现
- 所提方法实现了仅 715.65K 参数和 3.19G FLOPs 的学生生成器,相较于教师模型的 11.38M 参数和 47.19G FLOPs,分别减少了 93.7% 和 93.2%。
- 在 horse→zebra 和 summer→winter 翻译任务中,蒸馏后的学生 GAN 实现了与教师 GAN 相当的图像质量,优于从零开始训练的模型和普通蒸馏方法。
- 消融实验证明,结合 L1、感知和三元组损失与对抗训练可获得最高的 FID 和 LPIPS 分数,验证了各组件的有效性。
- 在无配对的 CycleGAN 设置中,参数量仅为教师模型 1/16 的学生模型实现了相似性能,证明了强大的泛化能力。
- 学生判别器显著提升了生成图像的真实感,相比无学生判别器的模型,减少了模糊并提升了保真度。
- 在 Cityscapes 数据集上,该方法实现了 52.22 的 FID 分数,优于基线学生模型(53.15)和普通蒸馏方法(52.50),且参数量远低于后者。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。