Skip to main content
QUICK REVIEW

[论文解读] Perceptual Extreme Super Resolution Network with Receptive Field Block

Taizhang Shang, Qiuju Dai|arXiv (Cornell University)|May 26, 2020
Advanced Image Processing Techniques参考文献 34被引用 7
一句话总结

该论文提出RFB-ESRGAN,一种感知极端超分辨率网络,通过引入感受野模块(RFB)实现多尺度特征提取,并采用子像素与最近邻插值交替的上采样策略,在减少计算量的同时保持细节。该方法在NTIRE 2020感知极端超分辨率挑战赛中取得第一名,PSNR、SSIM、LPIPS和PI指标均达到当前最先进水平。

ABSTRACT

Perceptual Extreme Super-Resolution for single image is extremely difficult, because the texture details of different images vary greatly. To tackle this difficulty, we develop a super resolution network with receptive field block based on Enhanced SRGAN. We call our network RFB-ESRGAN. The key contributions are listed as follows. First, for the purpose of extracting multi-scale information and enhance the feature discriminability, we applied receptive field block (RFB) to super resolution. RFB has achieved competitive results in object detection and classification. Second, instead of using large convolution kernels in multi-scale receptive field block, several small kernels are used in RFB, which makes us be able to extract detailed features and reduce the computation complexity. Third, we alternately use different upsampling methods in the upsampling stage to reduce the high computation complexity and still remain satisfactory performance. Fourth, we use the ensemble of 10 models of different iteration to improve the robustness of model and reduce the noise introduced by each individual model. Our experimental results show the superior performance of RFB-ESRGAN. According to the preliminary results of NTIRE 2020 Perceptual Extreme Super-Resolution Challenge, our solution ranks first among all the participants.

研究动机与目标

  • 为解决×16上采样倍数下的感知极端超分辨率问题,由于图像间差异性高,恢复精细纹理与细节极具挑战。
  • 通过引入一种新型感受野模块(RFB),使用小卷积核替代大卷积核,提升超分辨率网络中特征的可区分性与多尺度表征能力。
  • 通过交替使用子像素卷积与最近邻插值,降低上采样阶段的计算复杂度。
  • 通过在不同训练迭代中训练的10个模型进行集成学习,提升模型鲁棒性并减少噪声。

提出的方法

  • 网络架构基于ESRGAN,将标准残差块替换为感受野模块(RFB),利用小卷积核捕捉多尺度特征。
  • RFB通过空洞卷积在多个感受野下提取粗粒度与细粒度特征,且显著控制参数量增长。
  • 上采样阶段交替使用子像素卷积与最近邻插值,以平衡特征质量与计算效率。
  • 模型采用生成对抗网络(GAN)框架,结合感知损失与相对判别器,后者预测样本的相对真实度而非绝对真实性。
  • 测试阶段应用模型集成推理,融合10个在不同训练迭代中训练的模型预测结果,以抑制噪声并提升稳定性。
  • 训练流程使用DIV8K数据集,通过中心裁剪生成1000×1000的子图像用于评估,损失函数包括L1损失、感知损失、对抗损失及基于LPIPS的损失。

实验结果

研究问题

  • RQ1使用小卷积核的感受野模块(RFB)是否能在极端超分辨率任务中有效提取多尺度特征,同时降低计算成本?
  • RQ2在超分辨率流程中交替使用子像素卷积与最近邻插值,是否能提升特征质量并减少参数量?
  • RQ3在多个训练迭代中进行模型集成,是否能显著降低噪声并提升感知超分辨率结果的鲁棒性?
  • RQ4在NTIRE 2020挑战赛基准上,RFB-ESRGAN在感知质量、PSNR、SSIM、LPIPS和PI指标上与现有SOTA方法相比表现如何?

主要发现

  • RFB-ESRGAN在NTIRE 2020感知极端超分辨率挑战赛中得分最高,位列所有参赛者第一名。
  • 在DIV8K数据集中1,401–1,500张测试图像上,模型达到PSNR 24.03、SSIM 0.54、LPIPS 0.345与PI 4.27,表现出优异的感知与结构保真度。
  • 消融实验表明,与无RFB的基线模型相比,RFB显著提升了纹理细节恢复能力,尤其在头发、毛发等精细结构上表现更优。
  • 交替上采样策略有效减少了伪影,相比仅使用子像素或最近邻插值,视觉真实感更佳。
  • 模型集成有效抑制了噪声,提升了视觉质量,表现为噪声水平降低,且对比图像中纹理更自然。
  • RFB、混合上采样与集成学习三者结合,使模型在所有指标上均表现卓越,显著优于现有方法,在感知质量与重建精度方面均实现领先。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。