Skip to main content
QUICK REVIEW

[论文解读] DMCNN: Dual-Domain Multi-Scale Convolutional Neural Network for Compression Artifacts Removal

Xiaoshuai Zhang, Wenhan Yang|arXiv (Cornell University)|Jun 8, 2018
Image and Signal Denoising Methods参考文献 16被引用 10
一句话总结

该论文提出 DMCNN,一种双域多尺度卷积神经网络,通过扩张卷积扩大感受野并结合多尺度监督,提升 JPEG 伪影去除效果,同时融合像素域与 DCT 域的先验信息。该方法在标准基准测试中达到最先进性能,在 PSNR、SSIM 和 PSNR-B 指标上均优于以往基于 CNN 的方法。

ABSTRACT

JPEG is one of the most commonly used standards among lossy image compression methods. However, JPEG compression inevitably introduces various kinds of artifacts, especially at high compression rates, which could greatly affect the Quality of Experience (QoE). Recently, convolutional neural network (CNN) based methods have shown excellent performance for removing the JPEG artifacts. Lots of efforts have been made to deepen the CNNs and extract deeper features, while relatively few works pay attention to the receptive field of the network. In this paper, we illustrate that the quality of output images can be significantly improved by enlarging the receptive fields in many cases. One step further, we propose a Dual-domain Multi-scale CNN (DMCNN) to take full advantage of redundancies on both the pixel and DCT domains. Experiments show that DMCNN sets a new state-of-the-art for the task of JPEG artifact removal.

研究动机与目标

  • 为解决现有基于 CNN 的 JPEG 伪影去除方法感受野过小的问题,该问题限制了对条带状等大尺度伪影的有效恢复。
  • 通过利用像素域与 DCT 域中的冗余性,结合领域特定先验,提升图像恢复质量。
  • 通过扩张卷积与多尺度监督实现全局上下文建模,增强网络捕捉长程依赖关系的能力。
  • 设计端到端可训练架构,结合双域中的自编码器结构,实现联合优化。
  • 在基准数据集上实现卓越性能,尤其在压缩率较高、伪影最严重的场景下表现更优。

提出的方法

  • DMCNN 架构包含两个并行的自编码器分支——一个在像素域运行,一个在 DCT 域运行——每个分支均用于学习压缩图像的分层表征。
  • 在两个分支中均采用扩张卷积,显著扩大感受野而不增加参数量,从而实现对全局图像模式的建模。
  • 在三个尺度(原始、下采样、最粗糙)上应用多尺度损失函数,对不同抽象层次的特征学习进行监督,提升细节恢复能力。
  • 最终输出为输入图像、DCT 分支预测结果与像素分支预测结果的加权和,权重可学习或固定,以平衡各部分贡献。
  • 残差学习采用改进的残差块结构,DCT 与 IDCT 层固定,并使用标准 DCT 矩阵系数初始化,以保留领域特定的归纳偏置。
  • 模型使用 Adam 优化器进行训练,配合动态学习率衰减策略,并采用课程学习策略,从较低质量因子(QF=20)开始,逐步过渡至 QF=10。

实验结果

研究问题

  • RQ1扩大 CNN 的感受野是否能显著提升对条带状等大尺度 JPEG 伪影的去除效果?
  • RQ2结合像素域与 DCT 域的特征是否能实现比单域方法更优的伪影抑制与细节恢复?
  • RQ3多尺度监督与扩张卷积是否能协同增强网络对全局图像结构的建模能力?
  • RQ4所提出的双域多尺度架构在 PSNR、SSIM 和视觉质量方面与现有最先进方法相比表现如何?
  • RQ5集成固定 DCT 层是否能在保持 JPEG 压缩归纳偏置的同时提升性能?

主要发现

  • 在 LIVE1 数据集上,QF=10 时 DMCNN 达到 29.73 dB 的 PSNR,较之前最先进方法 DDCN 提升 0.14 dB。
  • 在 BSDS500 测试集上,QF=10 时 DMCNN 达到 29.67 dB 的 PSNR,优于 DDCN(29.59 dB)及其他领先方法。
  • 在 LIVE1 数据集上,QF=10 时 DMCNN 达到 29.55 dB 的 PSNR-B,表明其在保留高频细节与减少块效应方面表现更优。
  • 主观评估结果确认,DMCNN 生成的图像更符合视觉偏好,尤其在恢复平滑渐变与消除条带效应方面表现更佳。
  • 消融实验表明,大感受野(通过扩张卷积实现)、多尺度监督与双域学习的结合是性能提升的关键因素。
  • 在 QF=20 训练的模型在 QF=10 上泛化良好,在 LIVE1 数据集上达到 32.09 dB 的 PSNR,高于所有对比方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。