Skip to main content
QUICK REVIEW

[论文解读] Global Learnable Attention for Single Image Super-Resolution

Jian-Nan Su, Min Gan|arXiv (Cornell University)|Dec 2, 2022
Advanced Image Processing Techniques被引用 5
一句话总结

本文提出全局可学习注意力(GLA),一种用于单图像超分辨率(SISR)的新注意力机制,可在训练过程中自适应地重新加权非局部纹理相似度,使模型在修复严重受损区域时优先关注低相似度但更准确的纹理。GLA 通过超比特局部敏感哈希(SB-LSH)实现线性计算复杂度,在多种退化类型(模糊、噪声)下实现最先进性能,并集成于深度可学习相似性网络(DLSN)中,该网络在基准数据集上的表现优于现有方法。

ABSTRACT

Self-similarity is valuable to the exploration of non-local textures in single image super-resolution (SISR). Researchers usually assume that the importance of non-local textures is positively related to their similarity scores. In this paper, we surprisingly found that when repairing severely damaged query textures, some non-local textures with low-similarity which are closer to the target can provide more accurate and richer details than the high-similarity ones. In these cases, low-similarity does not mean inferior but is usually caused by different scales or orientations. Utilizing this finding, we proposed a Global Learnable Attention (GLA) to adaptively modify similarity scores of non-local textures during training instead of only using a fixed similarity scoring function such as the dot product. The proposed GLA can explore non-local textures with low-similarity but more accurate details to repair severely damaged textures. Furthermore, we propose to adopt Super-Bit Locality-Sensitive Hashing (SB-LSH) as a preprocessing method for our GLA. With the SB-LSH, the computational complexity of our GLA is reduced from quadratic to asymptotic linear with respect to the image size. In addition, the proposed GLA can be integrated into existing deep SISR models as an efficient general building block. Based on the GLA, we constructed a Deep Learnable Similarity Network (DLSN), which achieves state-of-the-art performance for SISR tasks of different degradation types (e.g. blur and noise). Our code and a pre-trained DLSN have been uploaded to GitHub† for validation.

研究动机与目标

  • 解决现有 SISR 方法中假设高相似度非局部纹理始终更具信息量的局限性,即使在它们并不准确时亦如此。
  • 使深度 SISR 模型能够有效利用低相似度非局部纹理,这些纹理可能在修复严重受损区域时包含更丰富、更准确的细节。
  • 通过引入超比特局部敏感哈希(SB-LSH)将 SISR 中非局部注意力的计算复杂度从二次方降低为线性。
  • 设计一种通用、高效的注意力模块(GLA),可轻松集成到现有深度 SISR 架构中。
  • 在多种退化类型(包括模糊、噪声和真实世界伪影)下验证所提方法的鲁棒性与有效性。

提出的方法

  • 提出一种全局可学习注意力(GLA)模块,在训练过程中学习修改查询特征与非局部特征之间的相似度得分,而非依赖于点积等固定函数。
  • 引入一种可学习的注意力机制,能够根据非局部特征与修复受损查询区域的相关性动态调整其重要性,即使相似度得分较低亦可实现。
  • 采用超比特局部敏感哈希(SB-LSH)将 GLA 的计算复杂度从 O(n²) 降低至关于图像尺寸的渐近 O(n)。
  • 通过将 GLA 集成到深度 SISR 主干网络中,设计一种深度可学习相似性网络(DLSN),支持端到端训练并实现改进的特征融合。
  • 使用感知损失与对抗性损失的组合进行模型训练,以增强视觉质量与细节恢复能力。
  • 采用可学习的相似度重加权机制,使网络能够发现并优先选择初始相似度较低但更准确的非局部纹理。

实验结果

研究问题

  • RQ1在 SISR 中修复严重受损图像区域时,非局部纹理的相似度得分较低,是否仍能提供比高相似度纹理更准确、更详细的信息?
  • RQ2在训练过程中学习重新加权相似度得分是否能提升 SISR 性能,相比使用固定相似度函数?
  • RQ3能否在保持性能的同时,将 SISR 中非局部注意力的计算复杂度从二次方降低为线性?
  • RQ4所提出的 GLA 模块能否作为通用组件有效集成到现有深度 SISR 模型中?
  • RQ5所提方法在多种退化类型(包括模糊、噪声和真实世界伪影)下的表现如何?

主要发现

  • 所提出的 DLSN 在 Set14 数据集上 ×3 缩放且存在噪声退化的情况下达到最先进性能,优于 FSRCNN、EDSR 和 RCAN 在所有噪声水平(10–25)下的表现。
  • 在噪声退化下,DLSN 在噪声水平 10 时达到 PSNR 28.91/0.7903,水平 15 时为 28.20/0.7671,水平 20 时为 27.62/0.7463,水平 25 时为 27.09/0.7279,始终优于所有基线模型。
  • 在模糊下采样退化下,DLSN 生成了最符合视觉审美的结果,纹理准确,优于 EDSR 和其他最先进模型的定性比较结果。
  • 在具有 JPEG 伪影的真实世界历史图像上,DLSN 有效重建了锐利边缘和结构化细节(如文字),而 DRLN 和 MS-LapSRN 未能保持笔画完整性。
  • GLA 模块使模型能够聚焦于信息量丰富的低相似度纹理,例如在高相似度区域具有误导性时,仍可修复受损的头发或建筑细节。
  • 尽管具有优势,当输入区域完全被破坏时,该模型仍无法幻化出精细细节,这一局限性与其他最先进 SISR 方法相同。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。