[论文解读] Image Super-Resolution with Text Prompt Diffusion
本文提出 PromptSR,一种新颖的图像超分辨率方法,通过利用文本提示作为退化先验,在合成与真实世界场景中均提升了重建质量。通过使用基于预训练语言模型(如 T5、CLIP)文本嵌入的扩散模型进行训练,并基于基于分箱的退化表示生成的图文数据集,PromptSR 在真实世界基准上实现了最先进性能,优于 Real-ESRGAN、SwinIR-GAN 和 DiffBIR 等方法,在感知与美学指标上表现更优。
Image super-resolution (SR) methods typically model degradation to improve reconstruction accuracy in complex and unknown degradation scenarios. However, extracting degradation information from low-resolution images is challenging, which limits the model performance. To boost image SR performance, one feasible approach is to introduce additional priors. Inspired by advancements in multi-modal methods and text prompt image processing, we introduce text prompts to image SR to provide degradation priors. Specifically, we first design a text-image generation pipeline to integrate text into the SR dataset through the text degradation representation and degradation model. By adopting a discrete design, the text representation is flexible and user-friendly. Meanwhile, we propose the PromptSR to realize the text prompt SR. The PromptSR leverages the latest multi-modal large language model (MLLM) to generate prompts from low-resolution images. It also utilizes the pre-trained language model (e.g., T5 or CLIP) to enhance text comprehension. We train the PromptSR on the text-image dataset. Extensive experiments indicate that introducing text prompts into SR, yields impressive results on both synthetic and real-world images. Code: https://github.com/zhengchen1999/PromptSR.
研究动机与目标
- 解决在复杂且未知退化条件下图像超分辨率(SR)泛化能力有限的挑战。
- 通过引入外部先验,克服仅从低分辨率(LR)图像中提取退化信息的困难。
- 探索利用自然语言描述表示退化模式的可行性,并提升 SR 性能。
- 开发一个统一框架,整合文本与图像生成,以训练鲁棒的 SR 模型。
- 通过描述性文本提示实现对真实世界退化的零样本或少样本适应。
提出的方法
- 提出一种基于分箱的离散化方法,将退化类型(如模糊、噪声)表示为抽象且灵活的文本描述。
- 设计一种图文生成流程,通过退化模型将合成的 HR-LR 图像对与相应的退化文本提示进行配对。
- 训练一种基于低分辨率图像和预训练语言模型(T5、CLIP)文本嵌入的扩散模型,以生成高分辨率输出。
- 通过交叉注意力机制将文本嵌入注入扩散模型,以引导去噪过程。
- 在训练过程中冻结预训练语言模型,仅在生成的图文数据集上微调扩散模型。
- 利用多种损失函数(如 L1、感知损失、对抗损失)优化扩散模型,以实现高保真、逼真的图像生成。
实验结果
研究问题
- RQ1在复杂且未知的退化场景中,文本提示能否有效作为退化先验以提升图像超分辨率性能?
- RQ2基于分箱的退化文本表示与端到端学习的表示相比,在泛化性和灵活性方面表现如何?
- RQ3当与基于扩散的 SR 结合时,预训练语言模型(如 T5、CLIP)在建模退化先验方面能带来多大程度的增强?
- RQ4引入文本引导是否能在真实世界图像超分辨率基准上带来可测量的感知质量与真实感提升?
- RQ5所提方法是否能在无需针对特定退化类型进行微调的情况下,泛化到多样化的现实世界退化?
主要发现
- 在 RealSR 基准上,PromptSR 在 ST-LPIPS(0.1937)、CNNIQA(0.6376)和 NIMA(4.8917)方面表现最佳,表明其具有更优的感知与美学质量。
- 在 RealSR 数据集上,PromptSR 在 LPIPS 和 DISTS 等关键感知指标上优于 Real-ESRGAN+(PSNR: 25.62)、SwinIR-GAN(PSNR: 26.54)和 DiffBIR(PSNR: 27.42)。
- 视觉对比显示,与引入模糊的 Stable Diffusion 或引入伪影的 FeMaSR 相比,PromptSR 生成了更清晰的纹理并减少了伪影。
- 在图6的第三个示例中,PromptSR 成功恢复了四根不同的吉他弦,而其他方法则产生模糊或错误的结果。
- 该方法在真实世界数据(包括 Real45 数据集)上泛化良好,无需显式微调即可有效应对多样且未知的退化,展现出强鲁棒性。
- 消融实验证实,文本提示引导显著提升了重建保真度,尤其在具有挑战性的现实世界场景中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。