Skip to main content
QUICK REVIEW

[论文解读] SnowFormer: Context Interaction Transformer with Scale-awareness for Single Image Desnowing

Sixiang Chen, Ye Tian|arXiv (Cornell University)|Aug 20, 2022
Image Enhancement Techniques被引用 7
一句话总结

SnowFormer 是一种用于单张图像去雪的新型基于 Transformer 的架构,通过利用感知尺度的查询以及通过多头交叉注意力实现的局部-全局上下文交互,有效建模多样的雪天退化。它在六个合成及真实世界数据集上实现了最先进性能,并具备良好的计算效率。

ABSTRACT

Due to various and complicated snow degradations, single image desnowing is a challenging image restoration task. As prior arts can not handle it ideally, we propose a novel transformer, SnowFormer, which explores efficient cross-attentions to build local-global context interaction across patches and surpasses existing works that employ local operators or vanilla transformers. Compared to prior desnowing methods and universal image restoration methods, SnowFormer has several benefits. Firstly, unlike the multi-head self-attention in recent image restoration Vision Transformers, SnowFormer incorporates the multi-head cross-attention mechanism to perform local-global context interaction between scale-aware snow queries and local-patch embeddings. Second, the snow queries in SnowFormer are generated by the query generator from aggregated scale-aware features, which are rich in potential clean cues, leading to superior restoration results. Third, SnowFormer outshines advanced state-of-the-art desnowing networks and the prevalent universal image restoration transformers on six synthetic and real-world datasets. The code is released in \url{https://github.com/Ephemeral182/SnowFormer}.

研究动机与目标

  • 解决现有方法难以有效建模真实图像中复杂、不规则且多尺度的雪天退化问题。
  • 克服基于 CNN 和原始 Vision Transformer 方法在捕捉局部退化模式与全局干净线索方面的局限性。
  • 通过感知尺度的无参查询实现高效的局部-全局上下文交互,提升恢复质量。
  • 通过带有位置编码的退化感知注意力优化头,逐步细化尾部特征中的残余雪天退化。
  • 与先前的通用图像恢复 Transformer 相比,实现性能、模型复杂度与推理速度之间的优越权衡。

提出的方法

  • 引入局部交互(LI),通过分块自注意力建模块内退化相似性,增强对局部退化模式的感知能力。
  • 通过多尺度特征聚合生成感知尺度的查询,实现全局上下文感知,且无需额外参数。
  • 在感知尺度的查询与局部分块嵌入之间使用多头交叉注意力,实现高效的局部-全局上下文交互。
  • 通过最大池化与逐元素相加的方式实现感知尺度的特征聚合,以保留多样的空间雪天信息。
  • 引入带有退化感知位置编码的注意力优化头,逐步优化尾部特征中的残余雪天退化。
  • 设计无参查询机制,避免原始自注意力带来的高计算开销,同时保持全局上下文整合能力。

实验结果

研究问题

  • RQ1通过交叉注意力实现的局部-全局上下文交互,是否能超越 CNN 或标准 Vision Transformer 在单张图像去雪任务中的表现?
  • RQ2与可学习查询或同层查询相比,从多尺度特征中生成感知尺度查询在提升恢复性能方面有何优势?
  • RQ3通过局部交互建模模块内退化相似性,对局部退化感知能力的提升程度如何?
  • RQ4所提出的注意力优化头是否能有效减少复杂区域中的残余雪天退化?
  • RQ5该模型是否能在计算成本和参数量显著低于现有通用图像恢复 Transformer 的前提下,实现最先进性能?

主要发现

  • SnowFormer 在 CSD 数据集上达到最高的 PSNR 39.45 dB 和 SSIM 0.983,优于所有先前的 SOTA 方法。
  • 消融实验证实,结合模块内注意力的局部交互(LI)相比无 LI 的基线模型,PSNR 提升 2.53 dB。
  • 采用感知尺度查询的局部-全局上下文交互(LGCI)实现 39.45 dB 的 PSNR,显著优于可学习查询(38.03 dB)和同层查询(38.36 dB)。
  • 结合最大池化与逐元素相加的感知尺度特征聚合方法表现最佳,相比拼接方式提升 1.3 dB,相比仅使用最大池化提升 0.44 dB。
  • SnowFormer 仅需 8.38M 参数与 19.44 GFLOPs,计算效率具有竞争力,优于参数与 FLOPs 显著更高的方法。
  • 在六个多样化数据集(包括真实场景)上,SnowFormer 均持续取得 SOTA 结果,展现出对合成与真实雪天退化的强大鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。