[论文解读] Hybrid Local-Global Transformer for Image Dehazing.
本文提出HyLoG-ViT,一种用于单幅图像去雾的混合局部-全局视觉Transformer,通过卷积实现特征融合,结合局部与全局注意力路径,降低计算成本并提升特征表示能力。该架构采用共享编码器与三个解码器(分别用于反射率、光照和无雾图像预测),并引入互补特征选择模块,在同质、非同质及夜间去雾基准上实现最先进性能。
Recently, the Vision Transformer (ViT) has shown impressive performance on high-level and low-level vision tasks. In this paper, we propose a new ViT architecture, named Hybrid Local-Global Vision Transformer (HyLoG-ViT), for single image dehazing. The HyLoG-ViT block consists of two paths, the local ViT path and the global ViT path, which are used to capture local and global dependencies. The hybrid features are fused via convolution layers. As a result, the HyLoG-ViT reduces the computational complexity and introduces locality in the networks. Then, the HyLoG-ViT blocks are incorporated within our dehazing networks, which jointly learn the intrinsic image decomposition and image dehazing. Specifically, the network consists of one shared encoder and three decoders for reflectance prediction, shading prediction, and haze-free image generation. The tasks of reflectance and shading prediction can produce meaningful intermediate features that can serve as complementary features for haze-free image generation. To effectively aggregate the complementary features, we propose a complementary features selection module (CFSM) to select the useful ones for image dehazing. Extensive experiments on homogeneous, non-homogeneous, and nighttime dehazing tasks reveal that our proposed Transformer-based dehazing network can achieve comparable or even better performance than CNNs-based dehazing models.
研究动机与目标
- 解决标准视觉Transformer在图像去雾中高效捕捉局部与全局图像依赖关系的局限性。
- 在保持低层次视觉任务代表性特征学习的同时,降低自注意力机制的计算复杂度。
- 通过联合学习固有图像分解(反射率与光照)和无雾图像生成,提升去雾性能。
- 设计一种机制,有效选择并聚合来自多个预测头的互补特征,以增强去雾效果。
- 在包括夜间和非同质雾天图像在内的多样化去雾场景中,实现优于或相当的性能,与基于CNN的模型相比。
提出的方法
- 提出HyLoG-ViT模块,将特征处理分为两条并行路径:局部ViT路径用于局部特征提取,全局ViT路径用于长距离依赖建模。
- 使用卷积层融合来自局部与全局路径的特征,结合局部归纳偏置与全局上下文感知能力。
- 设计一个去雾网络,包含共享编码器和三个解码器:一个用于反射率预测,一个用于光照预测,一个用于无雾图像生成。
- 引入互补特征选择模块(CFSM),动态选择并聚合来自反射率与光照头的最有用特征,用于无雾图像重建。
- 采用多任务学习目标端到端训练网络,联合优化反射率、光照与去雾损失。
- 利用固有图像分解作为监督信号,提升最终去雾输出的质量与鲁棒性。
实验结果
研究问题
- RQ1混合局部-全局Transformer架构是否能通过平衡局部与全局特征学习,在图像去雾中超越标准视觉Transformer?
- RQ2与直接端到端去雾相比,整合固有图像分解(反射率与光照)是否能提升去雾图像的质量与泛化能力?
- RQ3互补特征选择模块是否能有效识别并利用来自多个预测头的最具信息量的特征,以增强去雾性能?
- RQ4与现有基于CNN和Transformer的模型相比,所提出的HyLoG-ViT在保持或提升去雾准确率的同时,能在多大程度上降低计算复杂度?
- RQ5该模型在多样化去雾场景(包括非同质与夜间雾天图像)中的泛化能力如何?
主要发现
- 所提出的HyLoG-ViT在同质与非同质去雾的标准基准上,性能与最先进基于CNN的去雾模型相当或更优。
- 该网络在夜间去雾任务中表现出色,这是许多现有模型难以应对的挑战性场景。
- 使用固有图像分解(反射率与光照预测)提供了有意义的中间特征,显著提升了最终无雾图像的质量。
- 互补特征选择模块(CFSM)有效提升了特征利用效率,通过聚焦最相关特征,进一步改善了去雾结果。
- 混合局部-全局设计相比标准全局自注意力机制,显著降低了计算复杂度,使模型更加高效。
- 大量消融实验验证了各组件的有效性,包括双路径架构与结合CFSM的多解码器框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。