Skip to main content
QUICK REVIEW

[论文解读] Y-net: Multi-scale feature aggregation network with wavelet structure similarity loss function for single image dehazing

Hao-Hsiang Yang, Chao-Han Huck Yang|arXiv (Cornell University)|Mar 31, 2020
Image Enhancement Techniques参考文献 20被引用 6
一句话总结

该论文提出 Y-Net,一种用于单幅图像去雾的多尺度特征聚合 U-Net 变体,通过结合 1×1 卷积融合多尺度特征并引入基于小波的结构相似性(W-SSIM)损失函数,性能优于当前最先进方法。W-SSIM 损失通过在多尺度小波子带中应用 SSIM,提升感知质量,增强细节保留并减少伪影。

ABSTRACT

Single image dehazing is the ill-posed two-dimensional signal reconstruction problem. Recently, deep convolutional neural networks (CNN) have been successfully used in many computer vision problems. In this paper, we propose a Y-net that is named for its structure. This network reconstructs clear images by aggregating multi-scale features maps. Additionally, we propose a Wavelet Structure SIMilarity (W-SSIM) loss function in the training step. In the proposed loss function, discrete wavelet transforms are applied repeatedly to divide the image into differently sized patches with different frequencies and scales. The proposed loss function is the accumulation of SSIM loss of various patches with respective ratios. Extensive experimental results demonstrate that the proposed Y-net with the W-SSIM loss function restores high-quality clear images and outperforms state-of-the-art algorithms. Code and models are available at https://github.com/dectrfov/Y-net.

研究动机与目标

  • 通过端到端学习解决单幅图像去雾的病态问题,无需对大气光或透射率施加显式先验。
  • 通过聚合 CNN 编码器-解码器网络不同层级的多尺度特征,提升图像恢复质量。
  • 通过设计基于离散小波变换与 SSIM 的新型损失函数,增强感知质量并减少伪影。
  • 在合成数据集上展示优于基于先验与深度学习方法的性能。

提出的方法

  • 提出一种 Y 形网络架构,利用 1×1 卷积将编码器与解码器路径中的多尺度特征图进行聚合,形成最终输出。
  • 采用步幅卷积与最大池化实现下采样,转置卷积实现上采样,类似 U-Net,但将最终跳跃连接替换为多尺度融合。
  • 引入小波结构相似性(W-SSIM)损失函数,通过递归应用离散小波变换(DWT)将图像分解为不同尺度与频率的子带。
  • 在高频子带(LH、HL、HH)与低频子带(LL)上计算 SSIM,通过可调权重优先保留高频细节并抑制伪影。
  • 采用三重迭代的递归 DWT 过程,使用 Haar 小波,以自适应比例(x = r², y = r(1−r), z = (1−r)²)累积 SSIM 损失,确保多尺度一致性。
  • 使用 Adam 优化器在 RESIDE 数据集上训练网络,批量大小为 32,输入分辨率为 480×480,初始学习率为 0.0001。
Fig. 1 : The overview of our proposed Y-net. The clear image is composed of multi-scale feature maps from the hazy image. The digits under the blocks mean the numbers of channels.
Fig. 1 : The overview of our proposed Y-net. The clear image is composed of multi-scale feature maps from the hazy image. The digits under the blocks mean the numbers of channels.

实验结果

研究问题

  • RQ1与标准跳跃连接相比,U-Net 类架构中的多尺度特征聚合是否能显著提升去雾性能?
  • RQ2基于小波的 SSIM 损失函数是否在图像去雾中优于标准 L2 或 SSIM 损失,从而实现更好的感知质量与更少伪影?
  • RQ3所提出的 W-SSIM 损失函数是否能在无需显式深度或透射率先验的情况下,增强多频带特征学习?
  • RQ4W-SSIM 与 L2 损失组合相较于单一损失,在去雾图像的 PSNR 与 SSIM 指标上表现如何?

主要发现

  • 所提出的 Y-Net 在 RESIDE 合成数据集上达到 PSNR 26.61 与 SSIM 0.947,优于所有对比方法,包括 AOD-Net、MBE 与 W-U-Net。
  • 仅使用 W-SSIM 损失时,相比标准 L2 损失,PSNR 提升 0.30,SSIM 提升 0.012;当与 L2 损失结合时,PSNR 达到 26.61,SSIM 达到 0.947。
  • 在 FADE 感知质量评估指标上,所提方法在 River、People 与 Willow 数据集上分别获得 1.77、2.37 与 0.592 的评分,显著优于所有基线方法。
  • 视觉结果表明,仅所提方法能有效去除河面雾气,未引入噪声或伪影,而 MBE 等方法则产生斑点噪声。
  • W-SSIM 损失函数成功保留了高频细节并抑制了光晕效应,这在所有测试图像中均体现为 SSIM 与感知评分的提升。
  • 消融实验证实,W-SSIM 损失优于 L2 或标准 SSIM 损失,表明其能有效引导网络生成更优的感知重建结果。
Y-net: Multi-scale feature aggregation network with wavelet structure similarity loss function for single image dehazing

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。