[论文解读] Progressive Feature Fusion Network for Realistic Image Dehazing
该论文提出了一种渐进式特征融合网络(PFF-Net),一种端到端的U-Net类深度学习模型,无需依赖经典的气溶胶散射模型,直接学习从有雾图像到清晰图像的高度非线性映射。通过在编码器-解码器架构中采用渐进式特征融合,PFF-Net在SOTS和NTIRE2018基准测试中取得了当前最优性能,高效利用GPU内存,成功实现4K分辨率图像的去雾处理,且感知质量优异。
Single image dehazing is a challenging ill-posed restoration problem. Various prior-based and learning-based methods have been proposed. Most of them follow a classic atmospheric scattering model which is an elegant simplified physical model based on the assumption of single-scattering and homogeneous atmospheric medium. The formulation of haze in realistic environment is more complicated. In this paper, we propose to take its essential mechanism as "black box", and focus on learning an input-adaptive trainable end-to-end dehazing model. An U-Net like encoder-decoder deep network via progressive feature fusions has been proposed to directly learn highly nonlinear transformation function from observed hazy image to haze-free ground-truth. The proposed network is evaluated on two public image dehazing benchmarks. The experiments demonstrate that it can achieve superior performance when compared with popular state-of-the-art methods. With efficient GPU memory usage, it can satisfactorily recover ultra high definition hazed image up to 4K resolution, which is unaffordable by many deep learning based dehazing algorithms.
研究动机与目标
- 解决传统单图像去雾方法依赖于简化气溶胶散射模型所导致的局限性,该模型假设为单次散射且介质均匀。
- 克服基于流水线的方法中分别估计透射率和大气光时产生的误差放大问题。
- 开发一种端到端可训练的模型,直接学习从有雾图像到清晰图像的非线性映射,关注输出质量而非中间物理变量。
- 实现在超高清(4K)有雾图像上的高效处理,这些图像因内存限制而使许多现有基于深度学习的去雾模型难以处理。
提出的方法
- 提出一种具有跳跃连接的U-Net类编码器-解码器架构,以保留空间细节并实现有效的特征重用。
- 通过将不同编码器阶段的特征与对应解码器特征拼接,引入渐进式特征融合,以增强表征学习能力。
- 在编码器和解码器中均采用残差块,以实现稳定训练并改善梯度流动。
- 使用预测图像与真实清晰图像之间的标准L1损失,对整个网络进行端到端训练,直接最小化重建误差。
- 采用渐进式训练策略:先在DIV2K上预训练,然后在RESIDE上微调,不使用数据增强。
- 通过直接处理完整的4K图像实现高分辨率推理,避免了大多数先前方法所采用的基于图像块的训练策略。
实验结果
研究问题
- RQ1一种端到端的深度学习模型是否能在不依赖气溶胶散射模型中间变量的前提下,超越传统基于流水线的方法在单图像去雾任务中的表现?
- RQ2渐进式特征融合在超高清分辨率下的去雾任务中,对提升特征表征能力有多有效?
- RQ3仅使用简单残差块的轻量化U-Net类架构是否能实现SOTA性能,而无需复杂模块(如密集块)或集成推理?
- RQ4该网络在架构和训练复杂度极低的情况下,对真实世界4K分辨率有雾图像的泛化能力如何?
- RQ5直接端到端学习输入到输出的映射是否能带来比中间变量估计更好的感知质量与定量指标?
主要发现
- 在SOTS基准测试中,PFF-Net的PSNR达到24.78,SSIM达到0.8923,显著优于先前的SOTA方法(如GFN:PSNR为22.30,SSIM为0.88)。
- 在NTIRE2018去雾挑战赛的I-HAZE赛道中,PFF-Net未使用数据增强或针对该数据集的微调,仍取得第6名,获得荣誉提名。
- PFF-Net成功在推理阶段直接处理4K分辨率的有雾图像,而大多数现有基于深度学习的去雾模型因内存限制无法实现此功能。
- 定性结果表明,PFF-Net生成的去雾图像在场景细节、自然色彩饱和度和高感知质量方面表现优异,尤其在真实世界有雾图像上。
- 在RESIDE上的微调过程中,PFF-Net仅用8个epoch即实现收敛,表明其训练动态稳定且高效。
- 尽管仅使用简单残差块且未采用集成推理,PFF-Net仍超越了依赖密集块和多尺度测试策略的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。