[论文解读] ResDiff: Combining CNN and Diffusion Model for Image Super-Resolution
ResDiff 提出了一种用于单图像超分的新型扩散模型,该模型结合了预训练的CNN以恢复低频内容,以及专注于预测高频残差的频率引导扩散模型。通过利用CNN的预测结果和残差空间来引导噪声去噪,ResDiff加速了收敛速度,提升了生成样本的质量与多样性,在基准数据集上的表现优于以往基于扩散的方法。
Adapting the Diffusion Probabilistic Model (DPM) for direct image super-resolution is wasteful, given that a simple Convolutional Neural Network (CNN) can recover the main low-frequency content. Therefore, we present ResDiff, a novel Diffusion Probabilistic Model based on Residual structure for Single Image Super-Resolution (SISR). ResDiff utilizes a combination of a CNN, which restores primary low-frequency components, and a DPM, which predicts the residual between the ground-truth image and the CNN predicted image. In contrast to the common diffusion-based methods that directly use LR images to guide the noise towards HR space, ResDiff utilizes the CNN's initial prediction to direct the noise towards the residual space between HR space and CNN-predicted space, which not only accelerates the generation process but also acquires superior sample quality. Additionally, a frequency-domain-based loss function for CNN is introduced to facilitate its restoration, and a frequency-domain guided diffusion is designed for DPM on behalf of predicting high-frequency details. The extensive experiments on multiple benchmark datasets demonstrate that ResDiff outperforms previous diffusion based methods in terms of shorter model convergence time, superior generation quality, and more diverse samples.
研究动机与目标
- 为解决直接扩散建模在超分任务中的低效性,即同时恢复低频与高频分量。
- 通过减少对仅来自低分辨率空间的随机噪声生成的依赖,提升样本质量和多样性。
- 通过利用CNN的初始预测作为结构先验,加速训练收敛。
- 通过在扩散过程中引入频域引导,增强高频细节的生成能力。
- 在包括人脸和通用场景在内的多样化数据集上展示模型的泛化能力。
提出的方法
- ResDiff 使用预训练的CNN(SimpleSR)生成初始低分辨率预测,以恢复主要的低频分量。
- 扩散模型的条件输入为真实高分辨率图像与CNN预测结果之间的残差空间,而非直接基于低分辨率图像。
- 在CNN上应用基于频域的损失函数,以提高低频恢复的准确性。
- 引入频域引导扩散(FD-guided Diffusion)模块,包含用于自适应去噪的FD信息分割器和高频引导的交叉注意力模块。
- FD信息分割器将噪声图像中的高频与低频分量分离,以实现针对性去噪。
- 高频引导交叉注意力模块增强了扩散模型对细粒度纹理和高频细节的预测能力。
实验结果
研究问题
- RQ1基于CNN的初始预测是否能提升基于扩散模型的超分效率与质量?
- RQ2通过HR图像与CNN预测图像之间的残差空间引导扩散过程,是否能实现更快的收敛速度和更优的样本质量?
- RQ3与标准扩散条件相比,扩散模型中引入频域引导是否能增强高频细节的生成能力?
- RQ4ResDiff在性能与多样性方面相较于现有基于扩散和非扩散的SISR方法表现如何?
- RQ5ResDiff在包括人脸和通用图像基准在内的多样化数据集上,其泛化能力达到何种程度?
主要发现
- 在Urban100数据集上,ResDiff在4倍超分设置下达到27.94的PSNR和42.35的FID,优于所有先前的基于扩散的方法。
- 在DIV2K数据集上,ResDiff达到27.43的PSNR和42.35的FID,两项指标均显著优于SR3及其他扩散基线方法。
- 消融实验表明,FD信息分割器与高频引导交叉注意力模块各自对PSNR和SSIM的提升有贡献,完整模型在FFHQ数据集上实现26.73的PSNR与0.818的SSIM。
- ResDiff的收敛速度优于以往基于扩散的方法,训练时间相比直接从噪声生成HR图像的方法最多减少50%。
- 该模型生成的样本更具多样性,表现为更低的FID分数(如Urban100上的42.35)以及感知评估指标显示的模式崩溃减少。
- 即使采用简单的双线性插值基线,残差结构仍能提升性能,证明了残差设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。