[论文解读] Classification-driven Single Image Dehazing
本文提出了一种统一的端到端CNN架构,通过整合去雾子网络(DNet)、基于分类的条件生成对抗网络(CCGAN)和分类子网络(CNet),联合优化图像去雾与图像分类。该方法通过利用高层语义反馈提升视觉质量与下游任务性能,在CUB-200-2011和Caltech-256数据集上显著提升了去雾指标(PSNR、SSIM)与分类准确率,优于当前最先进方法。
Most existing dehazing algorithms often use hand-crafted features or Convolutional Neural Networks (CNN)-based methods to generate clear images using pixel-level Mean Square Error (MSE) loss. The generated images generally have better visual appeal, but not always have better performance for high-level vision tasks, e.g. image classification. In this paper, we investigate a new point of view in addressing this problem. Instead of focusing only on achieving good quantitative performance on pixel-based metrics such as Peak Signal to Noise Ratio (PSNR), we also ensure that the dehazed image itself does not degrade the performance of the high-level vision tasks such as image classification. To this end, we present an unified CNN architecture that includes three parts: a dehazing sub-network (DNet), a classification-driven Conditional Generative Adversarial Networks sub-network (CCGAN) and a classification sub-network (CNet) related to image classification, which has better performance both on visual appeal and image classification. We conduct comprehensive experiments on two challenging benchmark datasets for fine-grained and object classification: CUB-200-2011 and Caltech-256. Experimental results demonstrate that the proposed method outperforms many recent state-of-the-art single image dehazing methods in terms of image dehazing metrics and classification accuracy.
研究动机与目标
- 解决现有去雾方法仅优化像素级指标(如PSNR、SSIM)而未考虑高层视觉任务性能的局限性。
- 探究引入分类反馈是否能提升去雾图像的视觉质量与语义保真度。
- 开发一种端到端深度学习框架,联合优化图像去雾与图像分类。
- 证明在分类引导下生成的去雾图像在下游任务(如图像分类)中保持更优性能。
提出的方法
- 该框架由三部分组成:用于图像恢复的去雾子网络(DNet)、用于增强真实感与细节的基于分类的条件生成对抗网络(CCGAN),以及提供高层监督的分类子网络(CNet)。
- CCGAN子网络被训练为生成不仅在感知上逼真,而且在高层分类性能上也经过优化的去雾图像。
- 整个网络通过组合损失函数进行端到端训练:使用像素级重建损失(MSE)进行去雾,以及使用分类损失进行CNet训练。
- 分类子网络(CNet)在去雾输出上进行训练,以确保语义一致性,并引导DNet生成保留判别性特征的图像。
- 基于分类的生成对抗网络组件将CNet的特征图作为生成器的条件输入,使生成器能够生成既视觉上合理又语义准确的去雾图像。
- 该模型在合成雾化图像上进行训练,但经过定性对比验证,对真实世界雾化图像也具有良好的泛化能力。
实验结果
研究问题
- RQ1将高层分类反馈整合是否能超越标准像素级指标,在视觉质量与语义保真度方面提升去雾图像质量?
- RQ2基于分类的生成对抗网络架构是否相比标准生成对抗网络或无生成对抗网络监督,能带来更好的去雾性能与更高的分类准确率?
- RQ3对去雾与分类损失进行联合优化,如何影响去雾图像在下游视觉任务中的性能?
- RQ4尽管在合成数据上进行训练,该提出的统一架构在真实世界雾化图像上的泛化能力如何?
- RQ5DNet、CCGAN与CNet各组件对去雾与分类整体性能提升的独立贡献程度如何?
主要发现
- 在CUB-200-2011数据集上,完整模型(DNet+CCGAN+CNet)的PSNR达到21.2995,SSIM达到0.8541,优于所有消融实验变体与当前最先进方法。
- 在CUB-200-2011上,完整模型在ResNet下的分类准确率达到67.7%,显著高于54.4%的基线(仅DNet)与59.7%的DNet+CNet组合。
- 在Caltech-256上,完整模型在ResNet下的分类准确率达到82.6%,优于81.9%的基线(仅DNet)与82.5%的DNet+CCGAN组合。
- 消融研究证实,基于分类的生成对抗网络(CCGAN)与分类子网络(CNet)均能独立提升去雾指标与分类准确率。
- 在真实雾化图像上的定性结果表明,所提方法生成的输出更清晰、失真更少,相比当前最先进方法,颜色失真最小且去雾效果更佳。
- 尽管在合成数据上进行训练,该模型对真实世界雾化图像仍表现出良好的泛化能力,展现出鲁棒性与实际应用潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。