[论文解读] Enriched CNN-Transformer Feature Aggregation Networks for Super-Resolution
本文提出ACT(聚合CNN-Transformer),一种混合超分辨率网络,通过协同结合CNN进行局部特征提取和视觉Transformer进行长距离依赖建模。通过引入跨尺度标记注意力(CSTA)模块,使Transformer分支能够实现多尺度标记推理,ACT在多个基准测试中达到最先进性能,尤其在具有重复纹理和复杂结构的图像中表现卓越。
Recent transformer-based super-resolution (SR) methods have achieved promising results against conventional CNN-based methods. However, these approaches suffer from essential shortsightedness created by only utilizing the standard self-attention-based reasoning. In this paper, we introduce an effective hybrid SR network to aggregate enriched features, including local features from CNNs and long-range multi-scale dependencies captured by transformers. Specifically, our network comprises transformer and convolutional branches, which synergetically complement each representation during the restoration procedure. Furthermore, we propose a cross-scale token attention module, allowing the transformer branch to exploit the informative relationships among tokens across different scales efficiently. Our proposed method achieves state-of-the-art SR results on numerous benchmark datasets.
研究动机与目标
- 解决纯基于Transformer的超分辨率网络在捕捉局部和多尺度特征方面的局限性。
- 克服标准自注意力机制在处理局部模式和标记边界伪影方面的不足。
- 通过在特征学习过程中融合来自专用CNN和Transformer分支的互补特征,提升图像重建质量。
- 开发一种高效机制,以在不显著增加计算成本的前提下,利用标记之间的多尺度关系。
- 在标准超分辨率基准上展示卓越性能,特别是在具有高块重复性的场景中。
提出的方法
- 设计双分支架构,分别通过独立的CNN分支和Transformer分支处理局部与非局部特征。
- 引入跨尺度标记注意力(CSTA)模块,实现跨多尺度的特征重标记化,使Transformer能够学习多尺度标记之间的关系。
- 通过在最终重建前拼接两个分支的中间特征,实现后期特征融合。
- 采用受重标记化技术启发的多尺度重标记化策略,在Transformer分支中生成更具丰富性与尺度感知能力的表征。
- 研究位置嵌入在Transformer分支中对超分辨率任务的必要性,发现当结合多尺度建模时,其重要性显著降低。
- 通过跳跃连接和残差学习优化网络,以稳定训练并改善特征传播。
实验结果
研究问题
- RQ1通过融合互补优势,混合CNN-Transformer架构是否能在图像超分辨率任务中超越纯基于Transformer的方法?
- RQ2跨尺度注意力机制在多尺度图像标记间关系建模方面是否能有效提升超分辨率中的特征表征能力?
- RQ3局部CNN特征的融合是否能缓解基于Transformer的超分辨率网络中因标记化导致的伪影?
- RQ4所提方法在具有高自相似性或重复模式的图像上,性能提升程度如何?
- RQ5在基于Transformer的超分辨率框架中使用多尺度注意力时,模型复杂度与性能之间的权衡如何?
主要发现
- ACT在多个基准数据集(包括Urban100和DIV80)的全部评估缩放因子(×2、×3、×4)上均达到最先进PSNR和SSIM得分。
- 在Urban100数据集上,ACT在所有缩放因子下均比SwinIR高出超过0.3 dB的PSNR,证明CSTA模块在处理高重复性场景中的有效性。
- 该方法显著提升了视觉质量,能够准确重建细粒度细节,如文字和复杂纹理——例如在“MisutenaideDaisy”图像中成功恢复出可读字符。
- ACT减少了模糊伪影,并在窗户和建筑立面等结构中保持了锐利边缘,如在“barbara”和“img092”图像的定性对比中所示。
- 尽管性能顶尖,ACT仍保持了具有竞争力的模型大小与FLOPs,参数量为46M,FLOPs为22G,优于参数量更大的IPT模型(114M参数)。
- 消融实验确认,双分支设计与CSTA模块对性能提升至关重要,其中Transformer分支专注于高频细节,CNN分支则聚焦于结构边缘。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。