Skip to main content
QUICK REVIEW

[论文解读] Super Resolution Using Segmentation-Prior Self-Attention Generative Adversarial Network

Yuxin Zhang, Zuquan Zheng|arXiv (Cornell University)|Mar 7, 2020
Advanced Image Processing Techniques参考文献 38被引用 8
一句话总结

本文提出 SPSAGAN,一种通过加权融合模块将分割先验与自注意力机制相结合的超分辨率方法,以提升纹理真实感与长程特征建模能力。通过融合语义引导与全局注意力,并引入轻量级残差嵌套稀疏模块(RRSB),该方法在多个基准测试中实现了最先进的感知质量,同时提升了效率。

ABSTRACT

Convolutional Neural Network (CNN) is intensively implemented to solve super resolution (SR) tasks because of its superior performance. However, the problem of super resolution is still challenging due to the lack of prior knowledge and small receptive field of CNN. We propose the Segmentation-Piror Self-Attention Generative Adversarial Network (SPSAGAN) to combine segmentation-priors and feature attentions into a unified framework. This combination is led by a carefully designed weighted addition to balance the influence of feature and segmentation attentions, so that the network can emphasize textures in the same segmentation category and meanwhile focus on the long-distance feature relationship. We also propose a lightweight skip connection architecture called Residual-in-Residual Sparse Block (RRSB) to further improve the super-resolution performance and save computation. Extensive experiments show that SPSAGAN can generate more realistic and visually pleasing textures compared to state-of-the-art SFTGAN and ESRGAN on many SR datasets.

研究动机与目标

  • 解决现有超分辨率方法因感受野较小且缺乏先验知识,导致难以捕捉长程依赖关系与语义一致性的局限性。
  • 通过将语义分割先验整合进基于 GAN 的框架,以指导同一类别内的纹理生成,从而提升视觉质量。
  • 通过引入自注意力机制,建模图像中长程空间依赖关系,增强特征表示能力。
  • 通过设计轻量级跳跃连接结构(RRSB),剪枝残差块中的冗余连接,优化网络效率。
  • 与 SFTGAN 和 ESRGAN 等最先进方法相比,展示出更优的感知质量与计算效率。

提出的方法

  • 提出一种分割先验自注意力(SPSA)层,通过可学习的加权加法,将分割概率图与自注意力图相结合,以平衡类别特定关注与长程特征关系。
  • 将 SPSA 模块集成至基于 GAN 的超分辨率框架中,利用感知损失与对抗损失提升视觉真实感。
  • 通过剪枝 RRDB 架构中不必要的跳跃连接,设计残差嵌套稀疏块(RRSB),在保持性能的同时减少冗余。
  • 使用感知损失、对抗损失与新型注意力损失的组合进行网络训练,以优化特征重建与纹理生成。
  • 利用预训练的语义分割模型生成概率图,使生成器在超分辨率过程中获得语义类别条件。
  • 采用多尺度训练策略,通过渐进式细化稳定训练过程并提升泛化能力。

实验结果

研究问题

  • RQ1将分割先验与自注意力机制相结合,是否能提升单图像超分辨率中纹理的真实感与一致性?
  • RQ2分割图与特征注意力图的加权融合,如何影响网络对相关区域的关注能力与语义结构的保持能力?
  • RQ3在残差块中剪枝冗余跳跃连接,在不降低图像质量的前提下,能在多大程度上提升性能并降低计算成本?
  • RQ4SPSAGAN 与 SFTGAN、ESRGAN 及其他最先进方法相比,在视觉质量与感知保真度方面表现如何?
  • RQ5在无真实分割标签的分布外类别图像上,所提方法是否能生成更自然的纹理?

主要发现

  • 在 OST 数据集上的用户偏好研究中,SPSAGAN 显著优于 SFTGAN 与 ESRGAN,视觉质量方面获得更高比例的第一名投票(p < 0.05)。
  • 在 OST 数据集上,SPSAGAN 在用户偏好测试中获得 Rank 1 投票的比例达到 38.9%,高于 SRResNet(27.8%)与 SAN(25.6%)。
  • 在纹理质量对比中,SPSAGAN 在 30 张 OST 图像上获得 68.9% 的投票,认为其纹理比 SFTGAN、ESRGAN 与 NatSR 更自然、更具感知友好性。
  • 消融研究显示,添加特征注意力可提升纹理清晰度并减少伪影,而分割注意力则增强了结构一致性与规则性。
  • RRSB 模块将 OST 数据集上每张图像的推理时间从 0.368 秒降低至 0.296 秒(GTX 1080Ti),实现 19.6% 的加速,同时提升了视觉质量。
  • 完整 SPSAGAN 模型在 OST 数据集上取得了最高的 PSNR(33.12)、SSIM(0.918)与 PI(0.876),在所有指标上均优于 ESRGAN 与 SFTGAN。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。