[论文解读] CRFormer: A Cross-Region Transformer for Shadow Removal
CRFormer 提出了一种用于去阴影的新型跨区域变换器,通过单向、区域感知的交叉注意力机制,将非阴影区域的上下文特征传递至阴影区域,且无需图像分块处理。通过结合混合 CNN-Transformer 架构与双编码器及优化解码器,CRFormer 在 ISTD、AISTD、SRD 和视频去阴影数据集上实现了最先进性能,RMSE 最低降低 17.1,SSIM 提升至 0.854。
Aiming to restore the original intensity of shadow regions in an image and make them compatible with the remaining non-shadow regions without a trace, shadow removal is a very challenging problem that benefits many downstream image/video-related tasks. Recently, transformers have shown their strong capability in various applications by capturing global pixel interactions and this capability is highly desirable in shadow removal. However, applying transformers to promote shadow removal is non-trivial for the following two reasons: 1) The patchify operation is not suitable for shadow removal due to irregular shadow shapes; 2) shadow removal only needs one-way interaction from the non-shadow region to the shadow region instead of the common two-way interactions among all pixels in the image. In this paper, we propose a novel cross-region transformer, namely CRFormer, for shadow removal which differs from existing transformers by only considering the pixel interactions from the non-shadow region to the shadow region without splitting images into patches. This is achieved by a carefully designed region-aware cross-attention operation that can aggregate the recovered shadow region features conditioned on the non-shadow region features. Extensive experiments on ISTD, AISTD, SRD, and Video Shadow Removal datasets demonstrate the superiority of our method compared to other state-of-the-art methods.
研究动机与目标
- 为解决图像和视频中阴影导致视觉质量下降并影响下游任务的挑战。
- 克服 CNN 在建模长距离依赖关系方面的局限性,以及基于图像块的变换器在处理不规则阴影形状时的不足。
- 设计一种单向注意力机制,选择性地将非阴影区域的上下文信息传递至阴影区域,避免受受损阴影特征的干扰。
- 在无需图像分块处理的前提下实现高保真度去阴影,保留精细细节并最小化色彩失真。
- 在包括具有动态阴影的视频序列在内的多样化数据集上,展示模型的泛化能力与鲁棒性。
提出的方法
- 提出一种混合 CNN-Transformer 框架,采用双编码器从阴影图像及其阴影掩码中提取非对称特征。
- 核心创新在于区域感知的交叉注意力机制,仅基于非阴影区域特征,从非阴影区域向阴影区域计算注意力。
- 变换器层中的跨区域对齐模块通过整个非阴影区域的上下文线索,迭代优化阴影区域特征。
- 使用单个基于 CNN 的解码器从融合特征中重建去阴影图像,随后通过轻量级 U 形 RefineNet 进行后处理。
- 采用 L1 损失与感知损失的组合进行端到端训练,以保持结构与语义保真度。
- 架构避免图像分块处理,支持直接处理全分辨率图像,更好地处理不规则阴影边界。
实验结果
研究问题
- RQ1从非阴影区域到阴影区域的单向注意力机制是否能优于标准的双向自注意力机制在去阴影任务中的表现?
- RQ2避免图像分块处理是否能提升在具有不规则阴影形状图像上的性能?
- RQ3能否有效利用整个非阴影区域的上下文信息,同时避免因受损阴影特征引入的噪声?
- RQ4与原始自注意力机制相比,所提出的区域感知交叉注意力在去阴影质量与鲁棒性方面表现如何?
- RQ5该模型在包括复杂阴影动态变化的视频序列在内的多样化数据集上,其泛化能力达到何种程度?
主要发现
- CRFormer 在视频去阴影数据集上实现了最低的 RMSE(17.1),优于所有先前的最先进方法。
- 在视频去阴影数据集上,SSIM 提升至 0.854,表明其在感知质量与结构保持方面表现更优。
- 区域感知交叉注意力机制相比原始注意力机制将 RMSE 降低了 7.7%,显著提升了阴影区域的恢复效果。
- 使用两个跨区域对齐模块可获得最优性能,超过该数量后性能增益递减且 FLOPs 显著增加。
- CRFormer 在未见视频数据上表现出强大的泛化能力,在 VSR 基准测试中优于所有监督与无监督基线方法。
- 定性结果表明,色彩失真减少,伪影更少,尤其在复杂阴影区域表现更优,如图 4 中红色框所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。