[论文解读] Efficient Mixed Transformer for Single Image Super-Resolution
本文提出高效混合Transformer(EMT),一种用于单图像超分辨率(SISR)的轻量化Transformer架构,通过无参数的像素混合器(PM)增强局部特征聚合,并利用条纹窗口自注意力(SWSA)提升全局建模效率。EMT在保持更低复杂度的前提下实现了最先进性能,在Set5、Urban100和BSD100等基准数据集上实现了×4超分的优越表现。
Recently, Transformer-based methods have achieved impressive results in single image super-resolution (SISR). However, the lack of locality mechanism and high complexity limit their application in the field of super-resolution (SR). To solve these problems, we propose a new method, Efficient Mixed Transformer (EMT) in this study. Specifically, we propose the Mixed Transformer Block (MTB), consisting of multiple consecutive transformer layers, in some of which the Pixel Mixer (PM) is used to replace the Self-Attention (SA). PM can enhance the local knowledge aggregation with pixel shifting operations. At the same time, no additional complexity is introduced as PM has no parameters and floating-point operations. Moreover, we employ striped window for SA (SWSA) to gain an efficient global dependency modelling by utilizing image anisotropy. Experimental results show that EMT outperforms the existing methods on benchmark dataset and achieved state-of-the-art performance. The Code is available at https://github.com/Fried-Rice-Lab/FriedRiceLab.
研究动机与目标
- 解决基于Transformer的SISR方法中局部建模不足与高计算复杂度的问题。
- 在不增加参数量或FLOPs的前提下,提升局部特征聚合能力。
- 通过利用图像的各向异性结构,改进全局依赖建模效率。
- 在轻量化SISR中实现性能与模型复杂度之间的更好权衡。
- 实现SISR模型在移动设备与嵌入式设备上的高效部署。
提出的方法
- 提出混合Transformer块(MTB),通过交替使用全局(GTL)与局部(LTL)Transformer层,实现全局与局部建模的平衡。
- 引入无参数、无FLOPs的像素混合器(PM),通过通道分离与像素移位机制,增强局部特征聚合。
- 采用条纹窗口自注意力(SWSA),利用图像各向异性特性,以更低计算量高效建模长程依赖。
- 采用三阶段架构:浅层特征提取、通过堆叠MTB进行深层特征提取,以及通过跳跃连接实现重建。
- 在PM中应用通道特征混合与像素移位,以扩展局部感受野,且不增加额外参数。
- 通过将部分自注意力层替换为PM来控制模型复杂度,同时保持性能。
实验结果
研究问题
- RQ1通过选择性自注意力与局部感知器组成的混合Transformer块,能否提升SISR中的局部特征学习?
- RQ2无参数的像素混合器(PM)是否能在不增加FLOPs或参数量的前提下,增强局部知识聚合?
- RQ3通过利用图像各向异性,条纹窗口注意力能否提升全局依赖建模效率?
- RQ4在MTB中,全局与局部层的最优配比为何,才能实现SISR性能与复杂度的最佳平衡?
- RQ5所提出的EMT能否在模型复杂度低于现有轻量化SISR方法的前提下,实现最先进性能?
主要发现
- 在×4超分设置下,EMT在Set5、Set14、Urban100、BSD100和Manga109上均达到SOTA性能,Set5的PSNR为32.559,Urban100为26.741。
- 采用2GTL(全局Transformer层)的MTB在相同参数量下实现最佳性能-复杂度权衡,优于4GTL与6GTL变体。
- 像素混合器(PM)降低了平均注意力距离(MAD),并提高了局部注意力使用率,尤其在深层网络中表现显著,且未增加参数或FLOPs。
- 在相同参数约束下,EMT结合PM在Manga109上实现31.329的PSNR,优于恒等映射基线(31.296)。
- 采用条纹窗口的SWSA相比方形窗口,在全局建模效率与性能上均有提升,尤其在深层网络阶段表现更优。
- 消融实验表明,PM显著提升了纹理与细节恢复能力,如Urban100与Manga109上的定性结果所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。