Skip to main content
QUICK REVIEW

[论文解读] Spectrum-to-Kernel Translation for Accurate Blind Image Super-Resolution

Guangpin Tao, Xiaozhong Ji|arXiv (Cornell University)|Oct 23, 2021
Advanced Image Processing Techniques参考文献 37被引用 7
一句话总结

该论文提出了一种新颖的盲图像超分辨率框架,通过在低分辨率图像的频域谱上直接估计模糊核,利用Spectrum-to-Kernel(S2K)网络实现。通过结合频域特征表示与面向超分辨率的条件生成对抗网络(CGAN)优化,该方法在2×和4×上分别实现了平均1.39dB和0.48dB的性能提升,达到当前最优水平。

ABSTRACT

Deep-learning based Super-Resolution (SR) methods have exhibited promising performance under non-blind setting where blur kernel is known. However, blur kernels of Low-Resolution (LR) images in different practical applications are usually unknown. It may lead to significant performance drop when degradation process of training images deviates from that of real images. In this paper, we propose a novel blind SR framework to super-resolve LR images degraded by arbitrary blur kernel with accurate kernel estimation in frequency domain. To our best knowledge, this is the first deep learning method which conducts blur kernel estimation in frequency domain. Specifically, we first demonstrate that feature representation in frequency domain is more conducive for blur kernel reconstruction than in spatial domain. Next, we present a Spectrum-to-Kernel (S$2$K) network to estimate general blur kernels in diverse forms. We use a Conditional GAN (CGAN) combined with SR-oriented optimization target to learn the end-to-end translation from degraded images' spectra to unknown kernels. Extensive experiments on both synthetic and real-world images demonstrate that our proposed method sufficiently reduces blur kernel estimation error, thus enables the off-the-shelf non-blind SR methods to work under blind setting effectively, and achieves superior performance over state-of-the-art blind SR methods, averagely by 1.39dB, 0.48dB on commom blind SR setting (with Gaussian kernels) for scales $2 imes$ and $4 imes$, respectively.

研究动机与目标

  • 解决真实图像中模糊核未知且各向异性的盲图像超分辨率挑战。
  • 克服非盲超分辨率模型在训练与推理阶段退化过程不匹配导致的性能下降问题。
  • 通过利用模糊核在频域中的形状结构,而非空间域,提升核估计的准确性。
  • 开发一种稳健的端到端框架,使现成的非盲超分辨率模型在盲设置下仍能有效运行。
  • 在合成与真实世界图像数据集上均展示出优越的视觉与定量性能。

提出的方法

  • 理论分析表明,频域表示比空间域特征更有利于模糊核重建,尤其适用于稀疏核。
  • 提出一种Spectrum-to-Kernel(S2K)映射网络,将退化低分辨率图像的傅里叶幅度谱映射为插值后的空间模糊核。
  • 采用条件生成对抗网络(CGAN),结合多分量损失函数:L1损失用于像素级重建,频谱一致性损失(Ls)用于保持核形状,正则化损失(Lreg)用于稳定训练。
  • 采用基于低分辨率图像离散傅里叶变换(DFT)的频域输入表示,聚焦于幅度谱以捕捉核结构。
  • 将估计的核整合到现有非盲超分辨率模型中,实现端到端的盲超分辨率推理,确保与最终超分辨率质量优化对齐。
  • 使用配对的低分辨率图像及其对应的真值核进行S2K网络训练,无需显式的空间核监督。

实验结果

研究问题

  • RQ1低分辨率图像的频域表示是否比空间域表示更能提供鲁棒且准确的模糊核估计?
  • RQ2在频域中直接从谱到核的映射是否优于在空间域中进行模糊核估计的盲超分辨率方法?
  • RQ3优化目标的选择(如L1、频谱一致性、正则化)如何影响核估计与下游超分辨率性能?
  • RQ4所提出的S2K框架是否能跨多种模糊核(如高斯、运动、圆形)泛化,而无需针对特定核进行设计?
  • RQ5频域核估计在多大程度上提升了现成非盲超分辨率模型在盲设置下的性能?

主要发现

  • S2K网络在盲图像超分辨率任务中达到当前最优性能,在标准基准测试中,2×和4×上分别实现平均1.39dB和0.48dB的PSNR提升。
  • 与空间域方法相比,频域中的核估计显著降低了误差,尤其在复杂或任意核情况下表现更优。
  • 即使参数量更少,频域方法仍保持较强的超分辨率性能(分别仅下降1.55dB和0.63dB),而空间域方法则出现严重退化(分别下降9.45dB和10.08dB)。
  • 消融实验证实,结合L1、频谱一致性(Ls)与正则化(Lreg)损失可获得最佳的核估计与超分辨率结果。
  • 在真实历史图像与Canon拍摄图像上的视觉对比显示,S2K生成的纹理更清晰,边缘更锐利,伪影更少,优于先前方法。
  • 该方法在多种退化类型上具有良好的泛化能力,即使核估计误差在图像中空间分布不均,仍能保持高保真度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。