[论文解读] Stripformer: Strip Transformer for Fast Image Deblurring
Stripformer 提出了一种面向动态场景中快速图像去模糊的令牌与参数高效 Transformer 架构,通过交错的片内与片间自注意力机制,捕捉具有不同方向与强度的区域特定模糊模式。与原始 Transformer 相比,其在 GoPro、HIDE 和 RealBlur 数据集上实现了最先进性能,同时显著降低了 FLOPs 与推理时间。
Images taken in dynamic scenes may contain unwanted motion blur, which significantly degrades visual quality. Such blur causes short- and long-range region-specific smoothing artifacts that are often directional and non-uniform, which is difficult to be removed. Inspired by the current success of transformers on computer vision and image processing tasks, we develop, Stripformer, a transformer-based architecture that constructs intra- and inter-strip tokens to reweight image features in the horizontal and vertical directions to catch blurred patterns with different orientations. It stacks interlaced intra-strip and inter-strip attention layers to reveal blur magnitudes. In addition to detecting region-specific blurred patterns of various orientations and magnitudes, Stripformer is also a token-efficient and parameter-efficient transformer model, demanding much less memory usage and computation cost than the vanilla transformer but works better without relying on tremendous training data. Experimental results show that Stripformer performs favorably against state-of-the-art models in dynamic scene deblurring.
研究动机与目标
- 解决动态场景图像中非均匀、区域特定的运动模糊问题,该问题难以通过传统先验或标准 CNN 建模。
- 在保持全局与局部特征建模能力的同时,克服原始 Transformer 在图像去模糊任务中高内存与高计算成本的缺点。
- 设计一种混合 Transformer 架构,通过结构化标记化与注意力机制高效捕捉模糊方向与强度。
- 在不依赖 ImageNet 等大规模预训练数据集的情况下,实现最先进去模糊性能。
- 在保持基准数据集上高 PSNR 的同时,确保推理时间、参数量与 FLOPs 的模型高效性。
提出的方法
- 引入片内自注意力(Intra-SA),用于建模图像水平与垂直条带内的像素级依赖关系,捕捉局部模糊特征。
- 实现片间自注意力(Inter-SA),用于建模条带之间的相关性,编码水平与垂直方向上的全局区域级模糊模式。
- 通过交错堆叠片内与片间自注意力模块,逐步揭示多尺度下的模糊强度与方向。
- 采用条件位置编码(CPE)以支持任意输入尺寸,并优于固定位置编码的性能。
- 在训练过程中引入对比损失,以增强特征判别能力,提升去模糊质量。
- 通过避免完整特征图自注意力机制,设计出参数与内存高效的架构,使 1280×720 图像的 FLOPs 降低至约 6.9G。
实验结果
研究问题
- RQ1具有结构化条带标记的混合 Transformer 架构是否能在降低计算成本的同时,优于标准 Transformer 在图像去模糊任务中的表现?
- RQ2片内与片间自注意力机制在捕捉非均匀运动模糊的方向性与强度变化方面,效果如何?
- RQ3所提出的注意力设计在无需大规模预训练数据的情况下,对去模糊性能的提升程度如何?
- RQ4片内与片间自注意力的组合相较于 Swin 或 CCNet 等其他高效注意力机制,在去模糊任务中的表现如何?
- RQ5条件位置编码与对比损失的结合是否能进一步提升真实世界模糊数据集上的去模糊性能?
主要发现
- 在 GoPro 数据集上,Stripformer 实现了 33.08 的 PSNR,超越了此前最先进方法,包括 DeblurGAN-v2、SRN、MPRNet 与 MIMO。
- 在 HIDE 数据集上,Stripformer 实现了 31.03 的 PSNR,优于所有对比方法,包括 Swin 与 Twins,且仅使用 20M 参数。
- 该模型将 1280×720 图像的 FLOPs 降低至 6.9G,推理时间缩短至 48ms,显著低于 IPT(32G FLOPs),同时保持更优性能。
- 消融实验表明,片内与片间自注意力的结合可获得最佳性能,CPE 与对比损失进一步提升结果。
- 所提出的注意力机制在 GoPro 与 HIDE 数据集上的 PSNR 表现优于 Swin、CCNet 与 Twins,证明其在建模模糊方向与强度方面的有效性。
- Stripformer 在无需 ImageNet 预训练的情况下实现 SOTA 结果,证明其在去模糊任务中具备数据高效性与强归纳偏置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。