[论文解读] MFAGAN: A Compression Framework for Memory-Efficient On-Device Super-Resolution GAN
MFAGAN 提出了一种面向设备端超分辨率的内存高效生成对抗网络(GAN)框架,通过引入多尺度特征聚合生成器、轻量化 PatchGAN 判别器以及结合知识蒸馏与硬件感知神经架构搜索的两阶段压缩流水线,实现相较于 ESRGAN 最多 8.3 倍的内存减少和 42.9 倍的计算量减少,仅造成轻微的感知质量下降,在高通骁龙 865 上实现约 70ms 的实时推理延迟。
Generative adversarial networks (GANs) have promoted remarkable advances in single-image super-resolution (SR) by recovering photo-realistic images. However, high memory consumption of GAN-based SR (usually generators) causes performance degradation and more energy consumption, hindering the deployment of GAN-based SR into resource-constricted mobile devices. In this paper, we propose a novel compression framework extbf{M}ulti-scale extbf{F}eature extbf{A}ggregation Net based extbf{GAN} (MFAGAN) for reducing the memory access cost of the generator. First, to overcome the memory explosion of dense connections, we utilize a memory-efficient multi-scale feature aggregation net as the generator. Second, for faster and more stable training, our method introduces the PatchGAN discriminator. Third, to balance the student discriminator and the compressed generator, we distill both the generator and the discriminator. Finally, we perform a hardware-aware neural architecture search (NAS) to find a specialized SubGenerator for the target mobile phone. Benefiting from these improvements, the proposed MFAGAN achieves up to extbf{8.3}$ imes$ memory saving and extbf{42.9}$ imes$ computation reduction, with only minor visual quality degradation, compared with ESRGAN. Empirical studies also show $\sim$ extbf{70} milliseconds latency on Qualcomm Snapdragon 865 chipset.
研究动机与目标
- 解决在内存与能效受限的移动设备上部署基于 GAN 的超分辨率模型时面临的高内存与高计算成本挑战。
- 克服基于 GAN 的超分辨率模型在压缩用于移动部署时出现的训练不稳定与内存爆炸问题。
- 开发一种硬件感知的压缩框架,在目标移动硬件上实现模型效率、推理速度与感知质量之间的平衡。
- 通过架构创新与模型压缩,实现最小视觉质量损失的实时设备端推理。
提出的方法
- 设计一种内存高效的多尺度特征聚合模块(MFAM),替代密集连接,降低生成器中的内存访问开销。
- 引入轻量化 PatchGAN 判别器,提升训练稳定性与感知质量,尤其在与压缩生成器配合时表现更优。
- 采用两阶段压缩流水线:首先对生成器与判别器同时进行知识蒸馏,以稳定压缩模型的训练;随后应用基于神经架构搜索(NAS)的通道剪枝,进一步减少内存占用。
- 通过硬件感知的进化搜索,为特定移动芯片(如高通骁龙 865)定制子生成器,优化延迟与内存效率。
- 在移动设备上使用 TensorFlow Lite 部署最终模型,验证真实场景下的推理性能。
- 通过知识蒸馏平衡学生判别器与压缩生成器,避免模式崩溃,维持高质量图像生成。

实验结果
研究问题
- RQ1是否可通过内存高效的生成器架构在不牺牲感知质量的前提下降低基于 GAN 的超分辨率模型中的内存访问开销?
- RQ2与标准判别器相比,轻量化 PatchGAN 判别器在压缩生成器训练中是否具有更好的训练稳定性?
- RQ3当同时对生成器与判别器进行知识蒸馏时,知识蒸馏是否能有效稳定压缩 GAN 的训练?
- RQ4硬件感知的神经架构搜索在多大程度上可优化移动端平台上的模型效率与推理延迟?
- RQ5在压缩的设备端 GAN 中,内存减少、计算量节省与视觉质量之间的权衡关系如何?
主要发现
- MFAGAN 相较于 ESRGAN 实现最多 8.3 倍的内存访问开销减少与 42.9 倍的 FLOPs 减少,PSNR 仅下降 0.29 dB(32.59 vs. 31.13),LPIPS 提升 0.0118(0.0514 vs. 0.0632)。
- 在高通骁龙 865 GPU 上,MFAGAN 实现 4× 超分辨率的 70ms 推理延迟,相较 ESRGAN 的 1150ms 实现 16.4 倍加速。
- 与原始 ESRGAN 判别器相比,PatchGAN 判别器显著提升了训练稳定性与 PSNR 表现,尤其在搭配轻量化 MFANet 生成器时效果更佳。
- 两阶段压缩流水线(先蒸馏后 NAS 剪枝)成功稳定了训练过程并实现了高效模型压缩,优于先前的 GAN 压缩方法(如 AGD)。
- MFAGAN 在基准数据集上的 PSNR 与 LPIPS 表现均优于当前最先进方法,同时内存与计算需求大幅降低。
- 视觉对比结果表明,MFAGAN 有效保留了清晰的边缘与丰富的纹理,在头发与织物纹理等复杂细节上,感知质量与 ESRGAN 或其他 SOTA 方法相当或更优。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。