Skip to main content
QUICK REVIEW

[论文解读] HDNet: High-resolution Dual-domain Learning for Spectral Compressive Imaging

Xiaowan Hu, Yuanhao Cai|arXiv (Cornell University)|Mar 4, 2022
Photoacoustic and Ultrasonic Imaging被引用 12
一句话总结

HDNet 提出了一种用于从压缩测量中重建高光谱图像(HSI)的高分辨率双域学习框架,结合细粒度像素级时空注意力与动态频域损失,以减少感知差异。通过联合优化时空域与频域保真度,该方法在模拟和真实数据集上均实现了最先进性能,显著提升了视觉质量与定量指标。

ABSTRACT

The rapid development of deep learning provides a better solution for the end-to-end reconstruction of hyperspectral image (HSI). However, existing learning-based methods have two major defects. Firstly, networks with self-attention usually sacrifice internal resolution to balance model performance against complexity, losing fine-grained high-resolution (HR) features. Secondly, even if the optimization focusing on spatial-spectral domain learning (SDL) converges to the ideal solution, there is still a significant visual difference between the reconstructed HSI and the truth. Therefore, we propose a high-resolution dual-domain learning network (HDNet) for HSI reconstruction. On the one hand, the proposed HR spatial-spectral attention module with its efficient feature fusion provides continuous and fine pixel-level features. On the other hand, frequency domain learning (FDL) is introduced for HSI reconstruction to narrow the frequency domain discrepancy. Dynamic FDL supervision forces the model to reconstruct fine-grained frequencies and compensate for excessive smoothing and distortion caused by pixel-level losses. The HR pixel-level attention and frequency-level refinement in our HDNet mutually promote HSI perceptual quality. Extensive quantitative and qualitative evaluation experiments show that our method achieves SOTA performance on simulated and real HSI datasets. Code and models will be released at https://github.com/caiyuanhao1998/MST

研究动机与目标

  • 解决基于深度学习的 HSI 重建中因像素级损失偏好低频分量而导致的视觉质量差距问题。
  • 克服现有方法在自注意力机制中因分辨率权衡而难以保留高分辨率光谱-空间细节的局限性。
  • 降低重建 HSI 与真实 HSI 之间在频域的差异,即使像素级重建良好,该差异仍会导致感知伪影。
  • 设计一种互补的双域学习机制,联合优化时空域与频域表征,以提升 HSI 重建性能。
  • 通过联合优化分辨率与频域保真度,在模拟与真实 HSI 数据集上均实现最先进性能。

提出的方法

  • 引入高分辨率(HR)时空注意力模块,通过避免自注意力操作中的维度压缩,保持细粒度高分辨率特征。
  • 实现高效特征融合(EFF)机制,在不损失分辨率的前提下融合 HR 空间与光谱注意力特征。
  • 对重建 HSI 与真实 HSI 应用离散傅里叶变换(DFT),以计算频域表征并用于监督。
  • 设计可学习系数 α 的动态频域损失(FDL),自适应惩罚高频分量的欠拟合,提升细纹理的重建效果。
  • 采用基于块的频谱计算(p=3),以优化局部频域表征,避免频域监督中的全局偏差。
  • 端到端训练模型,采用结合像素级重建损失与频域损失的多损失目标函数,α=2 用于平衡 SSIM、PSNR 与 LFD。

实验结果

研究问题

  • RQ1与标准自注意力机制相比,高分辨率时空注意力是否能更有效地保留 HSI 重建中的细粒度光谱-空间细节?
  • RQ2动态频域监督在多大程度上减少了重建 HSI 与真实 HSI 光谱之间的差异,尤其是在高频分量中?
  • RQ3在时空域与频域中联合优化,如何在像素级重建指标之外进一步提升感知质量?
  • RQ4所提出的双域学习框架是否能泛化到真实世界 HSI 数据集,即使缺乏真实标签用于监督?
  • RQ5频域惩罚强度与重建质量之间的最优平衡是什么?其对视觉与定量性能有何影响?

主要发现

  • 在 CAVE 数据集上,HDNet 的 PSNR(34.34)与 SSIM(0.9572)均高于对比方法,且在 α=2 时 LFD 显著降低至 13.3238。
  • 在真实 HSI 数据上,尽管缺乏真实标签用于定量评估,HDNet 仍生成了视觉上更优的结果,表现出更锐利的高频纹理与更少的失真,优于 TSA-Net 与 DGSMP。
  • 频率距离系数 α=2 在 PSNR、SSIM 与 LFD 之间实现了最佳权衡,其感知质量与频域保真度优于 α=1 与 α=3。
  • 基于块的频谱分析(p=3)实现了最优频域表征与优化,因 p>3 会导致对局部偏差的过拟合,从而引起性能下降。
  • 视觉对比显示,HDNet 在频域空间中重建的光谱最接近真实值,显著减少了如棋盘状伪影与光谱偏移等现象。
  • HR 时空注意力与动态 FDL 监督的结合实现了相互增强:分辨率提升支持更好的频域对齐,反之亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。