Skip to main content
QUICK REVIEW

[论文解读] Relay Diffusion: Unifying diffusion process across resolutions for image synthesis

Jiayan Teng, Wendi Zheng|arXiv (Cornell University)|Sep 4, 2023
Advancements in Photolithography Techniques被引用 5
一句话总结

本文提出了一种新型级联扩散框架——中继扩散模型(RDM),通过使用模糊扩散和块噪声,将低分辨率噪声或图像转换为等效的高分辨率表示,从而在不同分辨率间统一扩散过程。RDM 在 ImageNet 256×256 上实现了 SOTA 的 FID(1.87,使用分类器自由指导),在 CelebA-HQ 256×256 上实现了 sFID,优于先前方法如 ADM、LDM 和 DiT,通过消除分布不匹配并实现无需从纯噪声重新启动的无缝分辨率扩展。

ABSTRACT

Diffusion models achieved great success in image synthesis, but still face challenges in high-resolution generation. Through the lens of discrete cosine transformation, we find the main reason is that \emph{the same noise level on a higher resolution results in a higher Signal-to-Noise Ratio in the frequency domain}. In this work, we present Relay Diffusion Model (RDM), which transfers a low-resolution image or noise into an equivalent high-resolution one for diffusion model via blurring diffusion and block noise. Therefore, the diffusion process can continue seamlessly in any new resolution or model without restarting from pure noise or low-resolution conditioning. RDM achieves state-of-the-art FID on CelebA-HQ and sFID on ImageNet 256$ imes$256, surpassing previous works such as ADM, LDM and DiT by a large margin. All the codes and checkpoints are open-sourced at \url{https://github.com/THUDM/RelayDiffusion}.

研究动机与目标

  • 为解决扩散模型在高分辨率图像生成中的挑战,特别是标准噪声调度在更大分辨率下性能欠佳的问题。
  • 克服级联扩散模型的局限性,包括生成与真实低分辨率条件之间的分布不匹配,以及从纯噪声重复采样的冗余。
  • 统一不同分辨率和模型架构之间的扩散过程,实现在不从噪声重新启动的情况下无缝延续采样。
  • 通过减少采样步数并消除对低分辨率条件的依赖,提升训练与推理效率。

提出的方法

  • RDM 引入一种中继机制,其中每个阶段均从上一阶段的输出开始扩散,而非从纯噪声开始,从而实现在不同分辨率间的连续生成。
  • 采用模糊扩散将低分辨率噪声或图像转换为等效的高分辨率表示,同时保持结构和频域一致性。
  • 引入块噪声以建模高频噪声模式,提升在频域中对分辨率相关噪声效应的建模能力。
  • 该方法使用可调随机性尺度 η 的随机 SDE 采样器,其中 η = 0.2 在 ImageNet 和 CelebA-HQ 上均取得最优性能。
  • 该框架将扩散过程与底层神经网络解耦,允许在采样过程中灵活调整架构和分辨率。
  • FLOPs 按各阶段的计算成本分配,第一阶段分配更多步数可提升最终 FID。

实验结果

研究问题

  • RQ1为何标准噪声调度在高分辨率扩散模型中会失效?分辨率如何影响噪声的感知影响?
  • RQ2是否可以在不从纯噪声重新启动或依赖低分辨率条件的情况下,统一不同分辨率间的扩散过程?
  • RQ3块噪声的引入如何提升高分辨率扩散生成的性能?
  • RQ4在级联扩散流水线中,各阶段采样步数的最优平衡是什么,以实现最小 FID?
  • RQ5统一的扩散框架是否能在无条件与有条件高分辨率图像生成中均实现 SOTA 性能?

主要发现

  • 在 ImageNet 256×256 上,RDM 在使用分类器自由指导的情况下实现了 SOTA 的 FID 1.87,显著优于 ADM、LDM 和 DiT 等先前方法。
  • 在 CelebA-HQ 256×256 上,RDM 实现了最佳报告的 sFID,表明其图像质量和多样性更优。
  • 引入块噪声显著提升了 FID,最佳性能出现在 α = 0.15 且核大小 s = 4 时。
  • 在 SDE 采样器中,随机性尺度 η = 0.2 时在 ImageNet 和 CelebA-HQ 上均取得最优 FID,表明噪声覆盖与过度噪声之间的平衡最佳。
  • 即使采样步数少于 200 次 NFE(函数评估次数),RDM 仍保持高性能,优于 DiT-XL/2 和 MDT-XL/2 在低步数下的表现。
  • 将更多 FLOPs 分配给第一阶段可提升 FID,表明早期阶段的优化对高质量生成至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。