[论文解读] Image Denoising and Super-Resolution using Residual Learning of Deep Convolutional Network
本文提出SuRDCNN,一种深度残差卷积神经网络,通过单一统一架构联合执行图像超分辨率与去噪。通过学习噪声低分辨率输入与干净高分辨率目标之间的残差,该模型在联合超分辨率与去噪任务中实现最先进性能,即使在噪声类型与水平未知的情况下仍优于先前模型(如SRCNN与VDSR),在PSNR与视觉质量方面表现更优。
Image super-resolution and denoising are two important tasks in image processing that can lead to improvement in image quality. Image super-resolution is the task of mapping a low resolution image to a high resolution image whereas denoising is the task of learning a clean image from a noisy input. We propose and train a single deep learning network that we term as SuRDCNN (super-resolution and denoising convolutional neural network), to perform these two tasks simultaneously . Our model nearly replicates the architecture of existing state-of-the-art deep learning models for super-resolution and denoising. We use the proven strategy of residual learning, as supported by state-of-the-art networks in this domain. Our trained SuRDCNN is capable of super-resolving image in the presence of Gaussian noise, Poisson noise or any random combination of both of these noises.
研究动机与目标
- 解决现有超分辨率与去噪模型仅能分别处理单一任务的局限性。
- 开发一种单一深度学习模型,能够在不同噪声条件下同时执行图像超分辨率与去噪。
- 利用残差学习提升在复杂、噪声多、低分辨率输入上的训练稳定性和性能。
- 实现无需事先知晓噪声类型或水平的端到端噪声模式学习。
- 构建一种计算高效、单次处理的图像质量增强解决方案。
提出的方法
- 所提出的SuRDCNN是一个20层深度卷积神经网络,采用3×3卷积核,每层包含64个特征图(首层为3个,对应RGB通道),并在每个卷积层后应用批量归一化。
- 网络使用tanh激活函数,并采用均方误差(MSE)损失进行训练,以最小化预测残差图像与真实残差图像之间的差异。
- 模型不直接学习从低分辨率到高分辨率的映射,而是学习输入图像与原始干净图像之间的残差,通过残差学习实现稳定训练。
- 推理阶段,模型以双三次插值后的噪声低分辨率图像作为输入,预测残差并减去该残差,从而重建出去噪且超分的输出图像。
- 训练数据由32×32图像块构成,噪声水平与类型随机变化(高斯、泊松或混合),以模拟真实世界图像退化。
- 模型在16GB GPU上使用随机梯度下降训练,学习率为2×10⁻⁹,共训练50个周期,约4小时收敛。
实验结果
研究问题
- RQ1单一深度神经网络是否能有效同时执行图像超分辨率与去噪,即使噪声类型与水平未知?
- RQ2与端到端映射相比,残差学习在联合超分辨率与去噪任务中如何提升性能与训练稳定性?
- RQ3在无先验噪声信息的情况下,具有小卷积核与深度的深层网络在多大程度上能学习复杂噪声模式(如高斯、泊松)?
- RQ4在联合退化任务中,所提出的SuRDCNN是否在PSNR与视觉质量方面优于现有最先进模型(如SRCNN与VDSR)?
- RQ5该模型是否能泛化至未见过的噪声水平与类型,展现出超越其训练分布的鲁棒性?
主要发现
- 在'Plane'图像上,SuRDCNN的PSNR达到28.25 dB,较双三次插值(27.91 dB)提升0.34 dB,证明其在超分辨率与去噪方面均具有效能。
- 在'Zebra'图像上,PSNR由双三次插值的20.96 dB提升至SuRDCNN处理后的22.06 dB,即使在信噪比较低时也表现出显著增强。
- 在'Scenery'图像上,PSNR由21.33 dB提升至23.13 dB,表明其在具有复杂纹理与噪声的自然场景中表现强劲。
- 在'Tiger'(24.47 dB → 24.36 dB)与'Lizard'(23.04 dB → 24.19 dB)图像上,模型保持高性能,显示其在多样化图像内容中的一致性提升。
- SRCNN在相同噪声数据上训练600个周期后仍无法学习,凸显SuRDCNN的深层残差架构在处理复杂未知噪声时的优越性。
- 当高斯与泊松噪声均处于最大水平时,模型的最小输入PSNR约为22 dB,表明其对高噪声退化具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。