Skip to main content
QUICK REVIEW

[论文解读] ESSAformer: Efficient Transformer for Hyperspectral Image Super-resolution

Mingjin Zhang, Chengqi Zhang|arXiv (Cornell University)|Jul 26, 2023
Advanced Image Fusion Techniques被引用 4
一句话总结

本文提出 ESSAformer,一种用于高光谱图像超分的新型高效 Transformer 架构,通过基于光谱相关系数(SCC)的谱感知、核化自注意力机制替代标准自注意力机制。利用 SCC 对光谱偏移和缩放的不变性,并通过 Mercer 核定理重构注意力机制,ESSAformer 实现线性复杂度,支持在小数据集上从零开始训练,且在推理速度和性能上均达到当前最优水平。

ABSTRACT

Single hyperspectral image super-resolution (single-HSI-SR) aims to restore a high-resolution hyperspectral image from a low-resolution observation. However, the prevailing CNN-based approaches have shown limitations in building long-range dependencies and capturing interaction information between spectral features. This results in inadequate utilization of spectral information and artifacts after upsampling. To address this issue, we propose ESSAformer, an ESSA attention-embedded Transformer network for single-HSI-SR with an iterative refining structure. Specifically, we first introduce a robust and spectral-friendly similarity metric, \ie, the spectral correlation coefficient of the spectrum (SCC), to replace the original attention matrix and incorporates inductive biases into the model to facilitate training. Built upon it, we further utilize the kernelizable attention technique with theoretical support to form a novel efficient SCC-kernel-based self-attention (ESSA) and reduce attention computation to linear complexity. ESSA enlarges the receptive field for features after upsampling without bringing much computation and allows the model to effectively utilize spatial-spectral information from different scales, resulting in the generation of more natural high-resolution images. Without the need for pretraining on large-scale datasets, our experiments demonstrate ESSA's effectiveness in both visual quality and quantitative results.

研究动机与目标

  • 为解决基于 CNN 的方法在捕捉高光谱图像超分辨率(HSI-SR)中长程空间-光谱依赖关系方面的局限性。
  • 克服标准视觉 Transformer 在 HSI-SR 中因需要大规模数据集和二次方复杂度注意力机制而产生的数据与计算瓶颈。
  • 设计一种对光谱振幅变化(如阴影或遮挡引起)具有鲁棒性的自注意力机制,支持在小数据集上实现有效训练。
  • 在保持或提升视觉与定量性能的前提下,实现具有线性计算复杂度的高分辨率 HSI 恢复。

提出的方法

  • 引入光谱相关系数(SCC)作为鲁棒、谱感知的相似性度量,替代点积注意力,为光谱在平移和缩放下的不变性提供归纳偏差。
  • 提出 ESSA(基于 SCC 核的自注意力),通过非线性平方指数核重构自注意力机制,利用核化方法实现线性复杂度。
  • 利用 Mercer 定理将 SCC 表达为变换特征的点积,通过重新排序注意力操作(先相乘键和值)实现高效计算。
  • 设计一种迭代细化架构,通过交替进行下采样与上采样操作,捕捉多尺度空间-光谱表征。
  • 采用轻量化、参数高效的结构设计,支持无需大规模预训练即可从零开始有效训练。
  • 将 ESSA 模块集成至视觉 Transformer 主干网络,构建专用于单幅 HSI-SR 的 ESSAformer 架构。

实验结果

研究问题

  • RQ1基于光谱相关系数(SCC)的自注意力机制是否能在无需大规模预训练的情况下,提升 HSI-SR 的数据效率与鲁棒性?
  • RQ2如何在保持高分辨率 HSI 中长程依赖建模能力的前提下,将标准自注意力的二次方复杂度降低至线性复杂度?
  • RQ3在 HSI-SR 基准测试中,EASSA 注意力机制是否在 PSNR、SAM 和推理速度方面优于标准多头自注意力及其他线性注意力变体?
  • RQ4所提出的 ESSAformer 是否能在小规模与大规模 HSI-SR 数据集(包括 ICVL 和 NTIRE)上均实现最先进性能?
  • RQ5在光谱失真(如遮挡或照度变化)条件下,EASSA 注意力机制如何保持注意力稳定性?

主要发现

  • 在 Chikusei 4× 数据集上,ESSAformer 实现 PSNR 40.7648 和 SAM 2.2126,优于先前 SOTA 方法如 SwinIR 和 RLFN。
  • 在大规模 ICVL 数据集上,ESSAformer 实现 PSNR 39.5158 和 SAM 1.9130,在两项指标上均超越 RLFN 和 SwinIR。
  • 在 NTIRE2022 数据集上,ESSAformer 实现 PSNR 37.8432 和 SAM 1.2202,展现出在大规模基准上的强大泛化能力。
  • 在 NTIRE2020 上,ESSAformer 推理速度比 SwinIR 快超过 2 倍,同时保持相近的 PSNR,表明其在效率-性能权衡上的优越性。
  • 注意力图分析显示,ESSA 在光谱噪声(如偏移和缩放)下仍能聚焦于判别性特征,而标准 MHSA 则发生崩溃,证实其鲁棒性。
  • 使用 ESSA 训练的模型收敛更快且损失更低,表明其在训练效率与稳定性方面优于通道注意力机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。