Skip to main content
QUICK REVIEW

[论文解读] Chaining Identity Mapping Modules for Image Denoising

Saeed Anwar, Cong Phouc Huynh|arXiv (Cornell University)|Dec 8, 2017
Image and Signal Denoising Methods参考文献 53被引用 14
一句话总结

本文提出了一种完全卷积的深度神经网络——身份映射模块链(CIMM),用于图像去噪,该网络采用残差学习与恒等快捷连接,并结合空洞卷积,以保持梯度流动并扩大感受野。该模型在合成数据集(BSD68)和真实世界数据集(DND)上均取得了最先进性能,优于以往的CNN模型和经典方法(如BM3D),在真实世界图像上实现了1.43 dB的PSNR增益,且无需噪声水平估计。

ABSTRACT

We propose to learn a fully-convolutional network model that consists of a Chain of Identity Mapping Modules (CIMM) for image denoising. The CIMM structure possesses two distinctive features that are important for the noise removal task. Firstly, each residual unit employs identity mappings as the skip connections and receives pre-activated input in order to preserve the gradient magnitude propagated in both the forward and backward directions. Secondly, by utilizing dilated kernels for the convolution layers in the residual branch, in other words within an identity mapping module, each neuron in the last convolution layer can observe the full receptive field of the first layer. After being trained on the BSD400 dataset, the proposed network produces remarkably higher numerical accuracy and better visual image quality than the state-of-the-art when being evaluated on conventional benchmark images and the BSD68 dataset.

研究动机与目标

  • 开发一种基于深度学习的图像去噪模型,使其在合成与真实世界噪声图像上均具有良好的泛化能力。
  • 解决现有CNN模型需要噪声水平估计,且易产生过度平滑或过度对比度伪影的问题。
  • 通过身份映射与预激活单元,改善深层网络中的梯度流动与特征传播。
  • 通过空洞卷积扩展每层的有效感受野,同时不增加参数量或计算成本。
  • 构建一种模块化、端到端的去噪框架,无需依赖预处理或后处理步骤。

提出的方法

  • 网络架构为五模块、五层深度的全卷积神经网络,共26个可学习层,采用带有恒等快捷连接的残差单元。
  • 每个残差单元采用预激活批量归一化与ReLU,确保训练过程中梯度流动的稳定性。
  • 在残差分支中应用空洞卷积,以扩展感受野,使最终层的每个神经元能够观察到完整的输入图像上下文。
  • 网络在BSD400数据集上使用预测图像与真实干净图像之间的均方误差损失进行端到端训练。
  • 模型在无需任何噪声水平输入的前提下,在合成数据集(BSD68)与真实世界数据集(达姆施塔特噪声数据集)上进行评估。
  • 该架构避免在每层后都使用批量归一化,转而依赖预激活与身份映射来稳定训练。

实验结果

研究问题

  • RQ1一个结合身份映射与空洞卷积的模块化全卷积网络,是否能在合成与真实世界图像上去噪任务中超越现有基于CNN的方法与经典去噪方法?
  • RQ2预激活与身份快捷连接的使用是否能提升深层去噪网络的训练稳定性和测试性能?
  • RQ3空洞卷积能否在不增加参数量或不依赖噪声水平信息的前提下,有效扩展感受野?
  • RQ4在真实世界噪声图像上,该方法与SOTA模型(如DnCNN与BM3D)相比,在PSNR与视觉质量方面表现如何?
  • RQ5该模型是否能在无需显式噪声水平估计或外部先验知识的情况下,泛化至真实世界噪声?

主要发现

  • 在BSD68合成数据集上,所提方法达到36.04 dB的PSNR,优于DnCNN(32.43 dB)与BM3D(34.61 dB),在该基准上较最先进方法高出0.1 dB。
  • 在真实世界达姆施塔特噪声数据集(DND)上,该方法达到36.04 dB的PSNR与0.9136的SSIM,显著优于所有其他方法,包括WNNM(34.44 dB)与DenoiseNet(35.08 dB)。
  • 在DND数据集上,该模型相较BM3D实现了1.43 dB的PSNR增益,表明其在真实世界噪声上去噪性能更优,而这一优势在经典方法中通常难以实现。
  • 视觉效果上,所提方法能有效去除噪声,同时保留图像的精细结构,避免了DnCNN与BM3D中常见的过度平滑或过度对比度伪影。
  • 与BM3D及其他经典算法不同,该方法无需事先知晓噪声水平,因此在真实世界部署中更具实用性。
  • 消融实验证实,身份映射、预激活与空洞卷积的组合对性能至关重要,各组件均对梯度稳定性和特征传播有贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。