[论文解读] SDWNet: A Straight Dilated Network with Wavelet Transformation for Image Deblurring
SDWNet 提出了一种轻量级、端到端的卷积神经网络用于图像去模糊,用空洞卷积和基于小波的频域增强替代了传统的编码器-解码器结构。通过使用多速率空洞卷积在不进行上采样或下采样的情况下捕捉大感受野,并通过小波重建模块恢复高频细节,SDWNet 在 GoPro 数据集上实现了 SOTA 的 PSNR(31.36)和 SSIM(0.967),参数量仅 7.2M,计算量为 181.31 GFLOPs。
Image deblurring is a classical computer vision problem that aims to recover a sharp image from a blurred image. To solve this problem, existing methods apply the Encode-Decode architecture to design the complex networks to make a good performance. However, most of these methods use repeated up-sampling and down-sampling structures to expand the receptive field, which results in texture information loss during the sampling process and some of them design the multiple stages that lead to difficulties with convergence. Therefore, our model uses dilated convolution to enable the obtainment of the large receptive field with high spatial resolution. Through making full use of the different receptive fields, our method can achieve better performance. On this basis, we reduce the number of up-sampling and down-sampling and design a simple network structure. Besides, we propose a novel module using the wavelet transform, which effectively helps the network to recover clear high-frequency texture details. Qualitative and quantitative evaluations of real and synthetic datasets show that our deblurring method is comparable to existing algorithms in terms of performance with much lower training requirements. The source code and pre-trained models are available at https://github.com/FlyEgle/SDWNet.
研究动机与目标
- 解决现有图像去模糊方法依赖重复上采样与下采样所带来的纹理损失问题,并改善收敛性。
- 通过避免对抗性训练,克服基于 GAN 的去模糊方法的不稳定性和高复杂度。
- 通过用更简单的端到端设计替代粗糙到精细或多阶段架构,降低模型复杂度与训练难度。
- 通过在空间域中整合小波变换以实现频域特征增强,提升高频细节恢复能力。
- 设计一种轻量级、高效的网络,在保持高性能的同时,最大限度减少参数量与 FLOPs。
提出的方法
- 提出一种使用多种空洞率的空洞卷积模块,以在不进行下采样或上采样的情况下扩展感受野。
- 采用空洞卷积并逐步增加空洞率,以捕捉不同空间尺度下的非局部相似特征。
- 引入小波重建模块,通过离散小波变换(DWT)与逆小波变换(IDWT)在频域中执行去模糊。
- 通过从经过小波变换的特征中重建最终输出,结合空间域与频域特征,以增强高频细节。
- 采用混合损失函数,结合 Charbonnier 损失与 SSIM 损失,并引入可学习超参数 λ 以平衡重建精度与感知质量。
- 设计一种简单、单路径的架构,不使用跳跃连接或多阶段优化,从而降低训练复杂度与参数量。
实验结果
研究问题
- RQ1轻量级、端到端的 CNN 架构是否能在不使用编码器-解码器或多阶段结构的情况下实现具有竞争力的去模糊性能?
- RQ2用空洞卷积替代重复的上采样与下采样是否能减少纹理损失并改善图像去模糊中的特征表示?
- RQ3基于小波变换的频域处理是否能有效增强去模糊图像中的高频细节?
- RQ4与现有 SOTA 方法相比,空洞卷积与小波重建的结合在 PSNR、SSIM 和模型效率方面表现如何?
- RQ5为实现最佳去模糊性能,网络深度、宽度、激活函数与损失加权的最优配置是什么?
主要发现
- SDWNet 在 GoPro 测试集上实现了 31.36 的 PSNR 与 0.967 的 SSIM,优于 DeblurGAN-v2(PSNR:29.55,SSIM:0.934),并以显著更少的参数量匹配或超越其他 SOTA 方法。
- 该模型仅使用 7.2M 参数与 181.31 GFLOPs 的计算量,相比 DeblurGAN-v2(60.9M 参数,411.34 GFLOPs)及其他复杂架构,效率显著更高。
- 消融实验表明,使用 ELU 激活函数与双线性上采样优于 ReLU 与转置卷积,当所有组件均包含时,PSNR 从 27.36 提升至 28.36。
- 最优损失超参数 λ 确定为 1,可有效平衡 Charbonnier 损失与 SSIM 损失,以最大化 PSNR 与 SSIM。
- 小波重建模块(WRM)在高频细节恢复中贡献显著,当将 WRM 添加到基线模型时,PSNR 提升了 1.0 dB。
- 当深度 d=16 且宽度 w=32 时,模型性能最佳,其中宽度对性能的影响大于深度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。