Skip to main content
QUICK REVIEW

[论文解读] SpA-Former: Transformer image shadow detection and removal via spatial attention

Xiao Zhang, Chao Chen Gu|ArXiv.org|Jun 22, 2022
Video Surveillance and Tracking Methods被引用 15
一句话总结

SpA-Former 提出了一种基于 Transformer 的单阶段、端到端神经网络,用于联合图像阴影检测与去除,通过空间注意力机制和傅里叶变换残差块捕捉长距离依赖关系,并同时保留低频和高频细节。该方法在 ISTD 数据集上实现了最先进性能,PSNR 达到 33.51,RMSE 为 6.86,且可在标准 GPU 硬件上进行训练。

ABSTRACT

In this paper, we propose an end-to-end SpA-Former to recover a shadow-free image from a single shaded image. Unlike traditional methods that require two steps for shadow detection and then shadow removal, the SpA-Former unifies these steps into one, which is a one-stage network capable of directly learning the mapping function between shadows and no shadows, it does not require a separate shadow detection. Thus, SpA-former is adaptable to real image de-shadowing for shadows projected on different semantic regions. SpA-Former consists of transformer layer and a series of joint Fourier transform residual blocks and two-wheel joint spatial attention. The network in this paper is able to handle the task while achieving a very fast processing efficiency. Our code is relased on https://github.com/zhangbaijin/SpA-Former-shadow-removal

研究动机与目标

  • 为解决两阶段阴影去除方法的局限性,即需要单独的检测与去除步骤,导致计算成本高且对多样化语义区域适应性差。
  • 克服阴影去除中的挑战,包括伪影、光照不一致,以及 CNN 在建模长距离空间依赖关系方面的不足。
  • 将阴影检测与去除统一为一个高效、单阶段的神经网络,直接学习从带阴影图像到无阴影图像的映射关系。
  • 通过集成空间注意力机制与傅里叶变换残差块,提升性能,更好地保留局部细节并建模长距离上下文信息。

提出的方法

  • 网络采用基于 Transformer 的编码器-解码器架构,利用自注意力机制建模图像中跨区域的长距离依赖关系。
  • 引入双轮联合空间注意力模块,通过双路径注意力学习机制,聚焦于空间上相关的区域,增强特征表示能力。
  • 设计了一种新颖的傅里叶变换残差(FTR)块,通过将空间特征转换到频域,实现对低频与高频分量的联合建模,以支持残差学习。
  • 该架构可端到端训练,无需后处理,可直接从单张输入图像预测输出无阴影图像。
  • 采用 L1 损失与感知损失相结合的方式进行模型训练,以保持结构与语义的一致性。

实验结果

研究问题

  • RQ1单阶段深度学习框架能否在无需单独检测或精炼步骤的情况下,有效统一阴影检测与去除?
  • RQ2与标准 CNN 相比,空间注意力与傅里叶残差块的集成如何提升阴影去除性能?
  • RQ3基于 Transformer 的架构在多大程度上能够建模带阴影图像中的长距离依赖关系,从而提升重建质量?
  • RQ4所提方法是否能在消费级 GPU 上实现最先进性能的同时保持快速推理速度?

主要发现

  • SpA-Former 在 ISTD 数据集上实现了 33.51 的 PSNR,优于先前方法(如 DSC、DHAN 和 SID)。
  • 模型的 RMSE 为 6.86,显著低于基线模型(7.87),表明像素级重建精度得到提升。
  • Transformer、FTR 块与双轮空间注意力的结合实现了最佳性能,相比基线模型 PSNR 提升 2.5%。
  • 消融实验证实,FTR 块与空间注意力均对性能有显著贡献,完整模型在阴影区域达到最高的 SSIM(0.982)。
  • 该网络可在单张 1080Ti GPU 上部署,表明其具有高效率与较低的硬件门槛,适用于实际应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。