[论文解读] N-Gram in Swin Transformers for Efficient Lightweight Image Super-Resolution
本文在Swin Transformer中引入N-Gram上下文,以实现高效轻量级图像超分辨率,通过在相邻局部窗口间采用滑动窗口自注意力机制扩展感受野。通过应用通道压缩的分组卷积生成uni-Gram嵌入,并将其与缩放余弦注意力机制结合,所提出的NGswin模型在减少FLOPs的同时实现了最先进性能,而SwinIR-NG进一步在多个数据集上提升了轻量级超分辨率基准表现。
While some studies have proven that Swin Transformer (Swin) with window self-attention (WSA) is suitable for single image super-resolution (SR), the plain WSA ignores the broad regions when reconstructing high-resolution images due to a limited receptive field. In addition, many deep learning SR methods suffer from intensive computations. To address these problems, we introduce the N-Gram context to the low-level vision with Transformers for the first time. We define N-Gram as neighboring local windows in Swin, which differs from text analysis that views N-Gram as consecutive characters or words. N-Grams interact with each other by sliding-WSA, expanding the regions seen to restore degraded pixels. Using the N-Gram context, we propose NGswin, an efficient SR network with SCDP bottleneck taking multi-scale outputs of the hierarchical encoder. Experimental results show that NGswin achieves competitive performance while maintaining an efficient structure when compared with previous leading methods. Moreover, we also improve other Swin-based SR methods with the N-Gram context, thereby building an enhanced model: SwinIR-NG. Our improved SwinIR-NG outperforms the current best lightweight SR approaches and establishes state-of-the-art results. Codes are available at https://github.com/rami0205/NGramSwin.
研究动机与目标
- 为解决标准窗口自注意力(WSA)在Swin Transformer中感受野受限的问题,该问题限制了高分辨率图像重建中的上下文利用。
- 降低基于深度学习的超分辨率模型中的计算复杂度,尤其针对参数预算受限的实际部署场景。
- 通过一种新型N-Gram机制,利用相邻局部窗口的空间上下文,提升轻量级超分辨率的性能。
- 通过在SwinIR-light和HNCT等现有Swin-based超分辨率模型中应用N-Gram上下文,验证其泛化能力。
提出的方法
- 将N-Gram定义为Swin Transformer中相邻局部窗口之间的交互,其中来自相邻窗口的uni-Gram嵌入通过滑动-WSA处理,以扩展有效感受野。
- 引入通道压缩的分组卷积,以生成低维uni-Gram嵌入,降低N-Gram交互的计算成本。
- 提出NGswin,一种高效的SR网络,包含分层编码器(含补丁下采样)、非对称小解码器,以及融合多尺度特征的SCDP瓶颈结构。
- 在N-Gram Swin Transformer块(NSTBs)中采用Swin V2中的缩放余弦注意力机制,以提升注意力效率与表征能力。
- 将N-Gram上下文应用于现有Swin-based模型,构建SwinIR-NG,其在不显著增加模型大小的前提下提升了性能。
- 采用SCDP瓶颈(像素重排、拼接、深度可分离卷积、逐点投影)高效融合编码器输出的多尺度特征,以提升重建效果。

实验结果
研究问题
- RQ1在Swin Transformer中扩展窗口自注意力的感受野,是否能在不增加计算成本的前提下提升图像超分辨率性能?
- RQ2所提出的源自相邻局部窗口的N-Gram上下文,在捕捉图像恢复任务中的长程空间依赖关系方面有多高效?
- RQ3N-Gram机制是否可泛化应用于改进现有Swin Transformer-based超分辨率模型?
- RQ4SCDP瓶颈与分层编码器-解码器设计对轻量级超分辨率中的模型效率与性能有何影响?
- RQ5N-Gram上下文是否在多样化的基准数据集上均带来图像质量与定量指标的显著可见提升?
主要发现
- NGswin在Set5、Set14、BSD100、Urban100和Manga109数据集上表现优异,×2超分任务仅需82.39G FLOPs,效率优于以往领先方法。
- SwinIR-NG作为SwinIR-light的增强版本,引入N-Gram上下文后,在轻量级超分辨率任务中达到最先进水平,×2超分在Set5上达到38.10/0.9610的PSNR和SSIM指标。
- N-Gram上下文使HNCT在Set5上×2超分任务的PSNR提升0.02 dB(38.10 vs. 38.08),×3和×4任务分别提升0.01 dB,且FLOPs仅略有增加。
- SCDP瓶颈对性能贡献显著,当添加至默认架构时,Set5上×2超分的PSNR提升0.05 dB(38.05 vs. 38.08)。
- 视觉对比显示,NGswin与SwinIR-NG在纹理和场景文字等复杂区域生成了更清晰的边缘与更锐利的纹理,优于基线模型。
- SwinIR-NG在ST-VQA测试集上提升了场景文字检测性能,表明其对需要高分辨率输入的下游视觉任务具有潜在优势。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。