Skip to main content
QUICK REVIEW

[论文解读] HSR-Diff:Hyperspectral Image Super-Resolution via Conditional Diffusion Models

Chanyue Wu, Dong Wang|arXiv (Cornell University)|Jun 21, 2023
Image and Signal Denoising Methods被引用 6
一句话总结

HSR-Diff 提出了一种用于高光谱图像超分的条件扩散模型,通过条件扩散建模,利用条件去噪 Transformer(CDFormer)对低分辨率高光谱图像和高分辨率多光谱图像特征进行迭代去噪,逐步生成高分辨率 HSI。该方法在四个公开数据集上实现了最先进性能,通过渐进式学习和基于自注意力的全局建模,展现出卓越的重建质量和细节保持能力。

ABSTRACT

Despite the proven significance of hyperspectral images (HSIs) in performing various computer vision tasks, its potential is adversely affected by the low-resolution (LR) property in the spatial domain, resulting from multiple physical factors. Inspired by recent advancements in deep generative models, we propose an HSI Super-resolution (SR) approach with Conditional Diffusion Models (HSR-Diff) that merges a high-resolution (HR) multispectral image (MSI) with the corresponding LR-HSI. HSR-Diff generates an HR-HSI via repeated refinement, in which the HR-HSI is initialized with pure Gaussian noise and iteratively refined. At each iteration, the noise is removed with a Conditional Denoising Transformer (CDF ormer) that is trained on denoising at different noise levels, conditioned on the hierarchical feature maps of HR-MSI and LR-HSI. In addition, a progressive learning strategy is employed to exploit the global information of full-resolution images. Systematic experiments have been conducted on four public datasets, demonstrating that HSR-Diff outperforms state-of-the-art methods.

研究动机与目标

  • 为解决高光谱成像中空间分辨率低的问题,该问题限制了其在计算机视觉任务中的应用。
  • 克服传统 HSI 超分方法依赖手工设计先验或存在光谱失真与优化不稳定性的问题。
  • 探索条件扩散模型在 HSI 超分中的潜力,利用迭代去噪实现高保真图像生成。
  • 通过引入渐进式学习策略和分层特征条件去噪网络,提升 HSI 超分中的全局特征建模能力。

提出的方法

  • HSR-Diff 以纯高斯噪声初始化高分辨率 HSI,并通过由条件扩散建模引导的去噪过程逐步优化。
  • 使用条件去噪 Transformer(CDFormer)在每一步中去除噪声,其条件基于从 HR-MSI 和 LR-HSI 提取的分层特征图。
  • CDFormer 采用双流架构,分别编码来自 HR-MSI 和 LR-HSI 的空间-光谱特征,通过自注意力机制实现跨模态特征融合与长距离依赖建模。
  • 渐进式学习策略首先在小图像块(如 128² 或 64²)上训练 CDFormer,以确保训练效率,随后在全分辨率图像上继续训练,以捕捉全局统计特性。
  • 模型通过最小化一个定义良好的损失函数,采用端到端方式训练,避免了 GAN 方法中常见的优化不稳定性。
  • 该框架在四个公开数据集(CAVE、PaviaU、Chikusei 和 HypSen)上进行评估,定量指标包括 PSNR、SSIM、SAM 和 ERGAS。

实验结果

研究问题

  • RQ1条件扩散模型能否有效应用于高光谱图像超分,以生成高保真度的 HR-HSI?
  • RQ2与基于 CNN 的架构相比,使用带有自注意力机制的条件去噪 Transformer(CDFormer)是否能提升全局特征建模能力?
  • RQ3渐进式学习如何增强去噪网络在捕捉长距离空间-光谱依赖关系方面的能力?
  • RQ4所提出方法能否在无 HR-HSI 监督的真实世界数据集(如 HypSen)上实现良好泛化?

主要发现

  • 在 CAVE 数据集上 32× 放大时,HSR-Diff 实现 PSNR 44.33、SSIM 0.9951、SAM 3.71 和 ERGAS 0.179,优于所有对比方法。
  • 在 PaviaU 数据集上 4× 放大时,HSR-Diff 实现 PSNR 46.47、SSIM 0.9977、SAM 1.45 和 ERGAS 1.053,展现出在真实世界数据上的强大性能。
  • 在 Chikusei 数据集上 4× 放大时,HSR-Diff 实现 PSNR 57.34 和 ERGAS 0.324,表明其具有极高的重建精度和极低的失真。
  • 消融实验证实,采用自注意力机制的 CDFormer 在性能上优于 U-Net 和基于 CNN 的变体,证明了注意力机制在全局建模中的有效性。
  • 与固定图像块训练相比,渐进式学习在 CAVE 上使 PSNR 提升 1.16 dB,在 PaviaU 上提升 1.41 dB,表明其在捕捉全局统计特性方面的价值。
  • 在真实世界 HypSen 数据集上的泛化实验表明,HSR-Diff 即使在仅用合成数据训练的情况下,仍能生成视觉上更优越、细节更丰富的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。