Skip to main content
QUICK REVIEW

[论文解读] Single Image Super-Resolution Using Multi-Scale Convolutional Neural Network

Xiaoyi Jia, Xiangmin Xu|arXiv (Cornell University)|May 15, 2017
Advanced Image Processing Techniques参考文献 17被引用 6
一句话总结

该论文提出了一种多尺度超分辨率(MSSR)网络,通过并行的多尺度路径捕捉不同感受野尺寸的特征,从而在多种图像结构中实现更优的细节重建。该模型在多个基准测试中实现了最先进性能,仅用一个训练好的网络即可处理多种放大倍数,PSNR和SSIM指标均优于以往方法,同时保持了较高的推理速度。

ABSTRACT

Methods based on convolutional neural network (CNN) have demonstrated tremendous improvements on single image super-resolution. However, the previous methods mainly restore images from one single area in the low resolution (LR) input, which limits the flexibility of models to infer various scales of details for high resolution (HR) output. Moreover, most of them train a specific model for each up-scale factor. In this paper, we propose a multi-scale super resolution (MSSR) network. Our network consists of multi-scale paths to make the HR inference, which can learn to synthesize features from different scales. This property helps reconstruct various kinds of regions in HR images. In addition, only one single model is needed for multiple up-scale factors, which is more efficient without loss of restoration quality. Experiments on four public datasets demonstrate that the proposed method achieved state-of-the-art performance with fast speed.

研究动机与目标

  • 为解决现有基于CNN的超分辨率方法中单尺度感受野的局限性,该局限性限制了其处理多样化图像细节的能力。
  • 实现单一模型在无需重新训练的情况下,有效处理多种放大倍数(如x2、x3、x4),从而提高效率。
  • 通过整合来自不同尺寸感受野的多尺度上下文信息,增强特征表示能力。
  • 通过结合多路径结构与残差学习及多尺度训练,提升重建质量与推理速度。

提出的方法

  • MSSR网络采用两个并行子网络:大尺度路径(Module-L)和小尺度路径(Module-S),两者具有不同的深度和感受野。
  • 网络使用三条并行分支,感受野分别为13、27和41,以从双三次插值的低分辨率输入中捕捉多尺度特征。
  • 多尺度分支提取的特征经过拼接后,通过带有残差学习的重建模块进行处理,以优化高分辨率输出。
  • 模型采用多尺度损失函数进行端到端训练,以鼓励在不同放大倍数下实现精确重建。
  • 权重初始化遵循He et al. (2015)的方法,训练过程中采用学习率衰减和批量归一化以提升稳定性。
  • 通过避免使用转置卷积层并采用高效的卷积操作,对网络架构进行优化,以提升推理速度。

实验结果

研究问题

  • RQ1单一深度学习模型是否能在不为每种放大倍数单独训练的情况下,有效处理多种放大倍数?
  • RQ2引入多尺度感受野是否能提升在多样化图像内容下的超分辨率质量?
  • RQ3多路径CNN架构是否能比单尺度模型更好地捕捉结构与纹理细节?
  • RQ4与最先进超分辨率网络相比,所提出的MSSR方法在性能与速度方面表现如何?

主要发现

  • 所提出的MSSR模型在四个公开数据集(Set5、Set14、B100、Urban100)上,针对x2、x3和x4放大倍数,均取得了最先进PSNR和SSIM指标。
  • 在Set5数据集上,MSSR在x2、x3和x4下的PSNR分别为37.62 dB、33.82 dB和31.42 dB,优于VDSR和FSRCNN。
  • 在Urban100数据集上,MSSR在x2、x3和x4下的PSNR分别为30.84 dB、27.20 dB和25.19 dB,显示出在复杂纹理与边缘区域的优越性能。
  • 与以往方法相比,该模型实现了显著更快的推理速度,相比VDSR和FSRCNN提速数十倍。
  • 视觉结果表明,MSSR在边缘和细纹理等高频区域能生成更清晰的线条与更锐利的文本。
  • 该模型在不同放大倍数间泛化能力良好,仅需一个模型即可支持所有尺度,显著降低了训练与内存开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。