[论文解读] Towards Compact Single Image Super-Resolution via Contrastive Self-distillation
该论文提出了一种对比自蒸馏(CSD)框架,以同时压缩和加速单图像超分辨率(SISR)模型。通过从教师网络构建一个通道分割的学生网络(CSSR-NET),并应用一种新颖的对比损失以实现显式知识迁移,CSD在仅损失0.13 dB PSNR和0.0039 SSIM的情况下,实现了EDSR模型高达4倍的模型压缩和1.77倍的推理速度提升,适用于×4超分尺度。
Convolutional neural networks (CNNs) are highly successful for super-resolution (SR) but often require sophisticated architectures with heavy memory cost and computational overhead, significantly restricts their practical deployments on resource-limited devices. In this paper, we proposed a novel contrastive self-distillation (CSD) framework to simultaneously compress and accelerate various off-the-shelf SR models. In particular, a channel-splitting super-resolution network can first be constructed from a target teacher network as a compact student network. Then, we propose a novel contrastive loss to improve the quality of SR images and PSNR/SSIM via explicit knowledge transfer. Extensive experiments demonstrate that the proposed CSD scheme effectively compresses and accelerates several standard SR models such as EDSR, RCAN and CARN. Code is available at https://github.com/Booooooooooo/CSD.
研究动机与目标
- 解决基于深度CNN的SISR模型计算和内存开销高的问题,以促进其在资源受限设备上的部署。
- 克服标准蒸馏中隐式知识迁移的局限性,后者导致压缩后学生网络性能欠佳。
- 通过使用正样本和负样本的对比学习,显式传递知识,提升压缩SISR模型的质量。
- 开发一种通用且运行时友好的压缩与加速方法,适用于多种现有SISR架构。
提出的方法
- 通过从预训练的教师网络中提取部分通道,构建一个通道分割的超分辨率网络(CSSR-Net),实现直接模型压缩。
- 通过重建损失联合训练学生网络(CSSR-Net)和教师网络,以实现隐式知识迁移。
- 引入一种基于VGG特征空间中L1距离的对比损失,以显式传递知识:拉近学生输出与教师输出的距离,同时推远其与负样本(如模糊图像)的距离。
- 将真实高分辨率(HR)图像作为正样本,将合成的模糊图像作为负样本,以定义对比目标,从而约束优化空间。
- 采用一种动态更新策略,从对比损失中分离教师网络的梯度,以防止性能崩溃并维持教师网络质量。
- 优化负样本数量(设定为10),在性能与计算成本之间实现平衡。
实验结果
研究问题
- RQ1对比自蒸馏是否能有效提升压缩SISR模型的性能,超越隐式蒸馏?
- RQ2在对比学习中使用负样本如何影响压缩SISR网络中重建图像的质量与清晰度?
- RQ3在自蒸馏中,SISR模型压缩、推理速度与图像质量之间的最优权衡是什么?
- RQ4所提出的CSD框架是否能在不同SISR架构(如EDSR、RCAN和CARN)上实现泛化?
- RQ5对比损失公式的选择(如基于L1的损失与InfoNCE损失)对最终PSNR和SSIM性能有何影响?
主要发现
- 所提出的CSD框架在EDSR上实现了4倍模型压缩率和1.77倍推理加速,且在×4超分尺度下,Urban100数据集上的PSNR仅下降0.13 dB,SSIM损失为0.0039。
- 在DIV2K数据集上,基于CSD的EDSR+模型达到29.13 dB PSNR和0.8416 SSIM,优于基于InfoNCE的CSD(29.10 dB,0.8402 SSIM)和使用感知损失的J-T方法。
- 在对比损失中使用L1距离相比InfoNCE损失表现更优,在DIV2K和Urban100上分别实现0.0014和0.0041的SSIM增益。
- 采用自蒸馏的CSSR-Net优于仅使用真实HR图像作为正样本的基线方法,表明教师网络的知识显著提升了性能。
- CSD的更新策略(分离教师梯度)相比联合更新两网络或移除重建损失的策略,显著提升了性能。
- 增加负样本数量可提升性能至某一临界点,但会带来更高的内存和训练成本;10个负样本被确定为性能与效率之间的最优平衡点。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。