[论文解读] Cross-receptive Focused Inference Network for Lightweight Image Super-Resolution
本文提出了一种轻量级混合CNN-Transformer架构——交叉感受野聚焦推理网络(CFIN),用于单图像超分辨率任务。该网络通过动态融合跨尺度与上下文信息,增强特征表示能力。通过集成交叉尺度信息聚合模块(CIAM)与交叉感受野引导的Transformer(CFGT),CFIN在计算成本和模型规模更低的前提下,实现了SOTA性能,优于纯CNN与纯Transformer基线模型在基准数据集上的表现。
Recently, Transformer-based methods have shown impressive performance in single image super-resolution (SISR) tasks due to the ability of global feature extraction. However, the capabilities of Transformers that need to incorporate contextual information to extract features dynamically are neglected. To address this issue, we propose a lightweight Cross-receptive Focused Inference Network (CFIN) that consists of a cascade of CT Blocks mixed with CNN and Transformer. Specifically, in the CT block, we first propose a CNN-based Cross-Scale Information Aggregation Module (CIAM) to enable the model to better focus on potentially helpful information to improve the efficiency of the Transformer phase. Then, we design a novel Cross-receptive Field Guided Transformer (CFGT) to enable the selection of contextual information required for reconstruction by using a modulated convolutional kernel that understands the current semantic information and exploits the information interaction within different self-attention. Extensive experiments have shown that our proposed CFIN can effectively reconstruct images using contextual information, and it can strike a good balance between computational cost and model performance as an efficient model. Source codes will be available at https://github.com/IVIPLab/CFIN.
研究动机与目标
- 为解决现有基于Transformer的SISR方法在高效特征提取过程中对上下文信息动态建模能力不足的问题。
- 在保持高图像恢复质量的前提下,降低计算复杂度与模型规模。
- 通过设计互补的混合架构,弥合CNN在局部特征提取与Transformer在全局建模之间的差距。
- 通过轻量化、参数高效的结构设计,实现资源受限设备上的高效部署。
提出的方法
- 提出一种由级联CT模块组成的混合网络架构,每个模块均集成了基于CNN的交叉尺度信息聚合模块(CIAM),用于早期特征优化。
- 引入一种交叉感受野引导的Transformer(CFGT),利用调制卷积核自适应选择基于当前语义内容的相关特征。
- 在Transformer内部采用动态注意力机制,通过跨自注意力交互引导特征选择,增强长距离依赖建模能力。
- 通过级联CT模块逐步优化特征,实现局部细节保持与全局上下文融合之间的平衡。
- 设计CIAM在Transformer阶段前聚合多尺度特征,提升效率并聚焦于相关信息。
- 通过平衡参数量、FLOPs与推理速度,优化模型复杂度,在计算开销极小的前提下实现高性能。
实验结果
研究问题
- RQ1混合CNN-Transformer架构能否有效结合局部与全局特征建模,实现轻量级SISR?
- RQ2在图像重建过程中,如何动态选择并聚焦上下文信息以提升性能?
- RQ3在Transformer注意力机制中引入调制卷积核,能否基于语义上下文增强特征选择能力?
- RQ4所提出的CFIN是否在模型效率与性能之间实现了优于纯CNN或纯Transformer基线的更好权衡?
- RQ5在适用于移动设备部署的低计算预算下,模型是否仍能保持高性能?
主要发现
- 在Set5(×4)数据集上,CFIN实现了32.49 dB的最高PSNR,优于纯CNN与纯Transformer模型。
- 在Urban100(×2)数据集上,CFIN达到26.39 dB的PSNR与0.7946的SSIM,展现出卓越性能与极低计算成本。
- 模型在参数量(699K)、FLOPs(11.45G)与推理时间(0.035s)之间实现了良好平衡,效率优于同类模型。
- 消融实验验证,CFIN中CNN与Transformer的结合优于单一组件,证实其互补性。
- CFIN在所有基准数据集(Set5、Set14、Urban100、Manga109)上均达到SOTA性能,PSNR与SSIM持续提升。
- 模型可在单张NVIDIA RTX 2080Ti GPU上运行并保持快速推理,适用于移动与边缘计算场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。