[论文解读] Implicit Diffusion Models for Continuous Super-Resolution
本文提出了一种用于连续图像超分的隐式扩散模型(IDM),通过将去噪扩散与隐式神经表示相结合,生成高保真、分辨率连续的结果。通过引入具有可学习缩放因子的尺度自适应条件机制,IDM 动态平衡低分辨率输入特征与生成细节,实现无需固定放大倍数约束的端到端训练,在自然图像和人脸图像超分基准上达到最先进性能。
Image super-resolution (SR) has attracted increasing attention due to its wide applications. However, current SR methods generally suffer from over-smoothing and artifacts, and most work only with fixed magnifications. This paper introduces an Implicit Diffusion Model (IDM) for high-fidelity continuous image super-resolution. IDM integrates an implicit neural representation and a denoising diffusion model in a unified end-to-end framework, where the implicit neural representation is adopted in the decoding process to learn continuous-resolution representation. Furthermore, we design a scale-controllable conditioning mechanism that consists of a low-resolution (LR) conditioning network and a scaling factor. The scaling factor regulates the resolution and accordingly modulates the proportion of the LR information and generated features in the final output, which enables the model to accommodate the continuous-resolution requirement. Extensive experiments validate the effectiveness of our IDM and demonstrate its superior performance over prior arts.
研究动机与目标
- 解决现有超分模型产生的输出过度平滑且受限于固定放大倍数的局限性。
- 实现在无需微调或级联架构的情况下,实现高保真、连续分辨率的图像超分。
- 将隐式神经表示与扩散模型结合,实现分辨率连续的特征学习。
- 设计一种尺度自适应条件机制,动态调节推理过程中低分辨率特征与生成细节的贡献。
- 在多种放大倍数下,于定量指标与感知质量方面均实现最先进性能。
提出的方法
- 模型以去噪扩散过程作为核心生成机制,通过迭代优化潜在表示,逐步逼近高分辨率图像。
- 隐式神经表示嵌入 U-Net 解码器中,通过基于坐标的 MLP 参数化,将图像建模为空间坐标的连续函数。
- 引入一种尺度自适应条件机制,由低分辨率条件网络与可学习缩放因子组成,用于动态控制输出分辨率。
- 缩放因子通过自适应 MLP 调节编码的低分辨率特征与生成的去噪特征之间的特征融合,实现连续分辨率控制。
- 整个框架以端到端方式训练,无需额外先验或两阶段训练,与以往生成式超分方法不同。
- 模型在多种放大倍数(如 8×)上进行训练,并在推理时泛化至分布内与分布外的尺度。
实验结果
研究问题
- RQ1基于扩散的模型能否在不被固定放大倍数限制的情况下实现高保真、连续分辨率的图像超分?
- RQ2如何有效将隐式神经表示集成到扩散模型中,以实现分辨率连续的生成?
- RQ3可学习缩放因子在动态平衡低分辨率先验与生成的高频细节中起什么作用?
- RQ4端到端、无先验的框架能否在保真度与泛化能力方面超越现有的两阶段或引入先验的生成式超分模型?
- RQ5该模型在超出训练范围的分布外放大倍数(如 9× 和 10×)下表现如何?
主要发现
- IDM 在自然图像与人脸图像超分基准上均达到最先进性能,PSNR 与 SSIM 均优于先前方法,相比以往生成式方法在 PSNR 上提升 0.50 dB,SSIM 提升 0.03。
- 在 CelebA-HQ 数据集上,IDM 的 LPIPS 分数优于 LIIF 与 SR3,表明即使在 PSNR 较低时仍具备更优的感知一致性。
- 当在 8× 超分任务上进行训练时,IDM 能有效泛化至分布外放大倍数(如 9× 与 10×),保持高感知质量与结构保真度。
- 消融实验表明,缩放因子对于控制低分辨率先验与生成细节之间的平衡至关重要,若省略或替换为简单条件机制,性能将显著下降。
- 所提出的低分辨率条件网络在定性比较中优于直接上采样与基于编码器的条件机制,生成更清晰的纹理与更准确的人脸细节。
- 尽管仅使用 800 张训练图像(其他方法为 2800 张),IDM 仍取得更优性能,展现出数据效率与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。