Skip to main content
QUICK REVIEW

[论文解读] Efficient Image Super-Resolution with Feature Interaction Weighted Hybrid Network

Wenjie Li, Juncheng Li|arXiv (Cornell University)|Dec 29, 2022
Advanced Image Processing Techniques被引用 5
一句话总结

本文提出了一种轻量化、高效的图像超分辨率网络——特征交互加权混合网络(FIWHN),通过一种新型的宽残差蒸馏交互模块(WDIB)将卷积神经网络(CNN)与Transformer组件相结合,引入特征交互机制。通过采用宽卷积与相同残差加权单元、自校准融合机制以及特征混洗加权组,FIWHN有效减少了中间特征损失,在更低的浮点运算量(FLOPs)和参数量下实现了最先进性能,在DIV2K和RealSR等基准数据集上优于先前方法。

ABSTRACT

Lightweight image super-resolution aims to reconstruct high-resolution images from low-resolution images using low computational costs. However, existing methods result in the loss of middle-layer features due to activation functions. To minimize the impact of intermediate feature loss on reconstruction quality, we propose a Feature Interaction Weighted Hybrid Network (FIWHN), which comprises a series of Wide-residual Distillation Interaction Block (WDIB) as the backbone. Every third WDIB forms a Feature Shuffle Weighted Group (FSWG) by applying mutual information shuffle and fusion. Moreover, to mitigate the negative effects of intermediate feature loss, we introduce Wide Residual Weighting units within WDIB. These units effectively fuse features of varying levels of detail through a Wide-residual Distillation Connection (WRDC) and a Self-Calibrating Fusion (SCF). To compensate for global feature deficiencies, we incorporate a Transformer and explore a novel architecture to combine CNN and Transformer. We show that our FIWHN achieves a favorable balance between performance and efficiency through extensive experiments on low-level and high-level tasks. Codes will be available at \url{https://github.com/IVIPLab/FIWHN}.

研究动机与目标

  • 解决现有基于深度学习的单图像超分辨率(SISR)方法中存在的高计算成本与中间特征损失问题。
  • 在保持模型效率的同时,减轻深度残差网络中因激活函数导致的特征损失。
  • 通过混合CNN-Transformer架构,融合多尺度与全局特征,提升特征表征能力。
  • 通过最小化模型大小与FLOPs,实现在资源受限设备上的有效部署。
  • 通过提升图像重建质量,改善语义分割与人脸识别等下游视觉任务的性能。

提出的方法

  • 提出宽残差蒸馏交互模块(WDIB)作为核心构建单元,结合网格状宽残差块与基于注意力的跳跃连接。
  • 引入宽卷积残差加权(WCRW)与宽相同残差加权(WIRW)单元,在激活前保留并补偿中间特征。
  • 采用宽残差蒸馏连接(WRDC)框架,结合特征分流蒸馏与跳跃连接,增强特征融合与泛化能力。
  • 设计自校准融合(SCF)单元,动态加权并融合不同精细程度的特征。
  • 通过在每三个WDIB之间混合并重加权特征,构建特征混洗加权组(FSWG),提升组级别特征交互。
  • 将轻量化Transformer模块集成到CNN主干网络中,以捕捉长距离依赖关系,补充局部CNN表征。

实验结果

研究问题

  • RQ1混合CNN-Transformer架构能否在降低计算成本的同时实现更优的SISR性能?
  • RQ2在深度残差网络中,如何缓解ReLU激活导致的中间特征损失?
  • RQ3通过跨不同表征层级的特征交互与交叉融合,能否提升重建质量与模型泛化能力?
  • RQ4所提出的架构在真实世界与基准数据集上的轻量化SISR模型中,性能优越程度如何?
  • RQ5FIWHN增强的图像重建能力是否能提升语义分割与人脸识别等下游视觉任务的性能?

主要发现

  • 在×2缩放下,FIWHN在RealSR数据集上达到33.96 dB的PSNR与0.927的SSIM,优于第二名方法ESRT(×3缩放下高0.19 dB)。
  • 在DIV2K数据集上,FIWHN在×4缩放下实现34.01 dB的PSNR与0.937的SSIM,表现达到最先进水平。
  • 与EDSR相比,FIWHN将FLOPs降低30%,参数量减少25%,可在单张NVIDIA RTX 2080Ti GPU上训练,而其他模型需双卡支持。
  • 视觉对比显示,FIWHN在纹理恢复与边缘锐化方面优于FDIWN与双三次插值方法,伪影更少,与真实高分辨率图像更接近。
  • 在CamVid数据集的语义分割任务中,FIWHN重建图像的分割结果更接近真实标签,尤其在细粒度结构(如电线杆)上表现更优。
  • 该方法在人脸超分辨率与真实世界超分辨率基准上均取得优异性能,验证了其在多样化图像分布下的鲁棒性与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。