Skip to main content
QUICK REVIEW

[论文解读] Pyramidal Denoising Diffusion Probabilistic Models

Dohoon Ryu, Jong Chul Ye|arXiv (Cornell University)|Aug 3, 2022
Image and Signal Denoising Methods被引用 10
一句话总结

该论文提出了一种分层去噪扩散概率模型,通过使用基于位置嵌入的单一得分函数,从粗略输入生成高分辨率图像。通过利用带有位置编码的多尺度训练,该方法实现了高效、高保真度的图像生成与超分辨率,无需训练多个模型,以更低的计算成本实现了最先进性能。

ABSTRACT

Recently, diffusion model have demonstrated impressive image generation performances, and have been extensively studied in various computer vision tasks. Unfortunately, training and evaluating diffusion models consume a lot of time and computational resources. To address this problem, here we present a novel pyramidal diffusion model that can generate high resolution images starting from much coarser resolution images using a {\em single} score function trained with a positional embedding. This enables a neural network to be much lighter and also enables time-efficient image generation without compromising its performances. Furthermore, we show that the proposed approach can be also efficiently used for multi-scale super-resolution problem using a single score function.

研究动机与目标

  • 解决扩散模型在图像生成与超分辨率任务中计算成本高、推理速度慢的问题。
  • 通过单一轻量级得分网络实现从粗到精的高分辨率图像生成。
  • 通过引入位置条件化,消除为每种分辨率单独训练多个扩散模型的需求。
  • 通过在不同分辨率间统一使用得分函数,提升多尺度超分辨率性能。
  • 证明在低分辨率图像块上进行分块训练,可生成极高分辨率图像(如1024×1024),而无需全分辨率数据。

提出的方法

  • 模型使用单一得分网络,并以位置嵌入作为条件输入,以处理可变的输入与输出分辨率。
  • 位置编码应用于坐标位置,并通过正弦与余弦函数嵌入,扩展至多通道以实现多尺度条件化。
  • 训练期间,输入图像被随机调整为目标分辨率,对应的位置嵌入与潜在特征拼接。
  • 反向扩散过程采用从粗到精的优化策略,从噪声开始,逐步在更高分辨率下去噪。
  • 该方法支持在不同尺寸的图像块(如256×256、512×512)上进行端到端训练,从而在推理阶段泛化至更高分辨率。
  • 框架集成了CCDF加速方案,以实现所有分辨率阶段的高效采样。

实验结果

研究问题

  • RQ1单一得分函数是否可在不重新训练的情况下生成多分辨率图像?
  • RQ2基于位置嵌入的条件化是否能实现准确的多尺度图像生成与超分辨率?
  • RQ3在低分辨率图像块上进行分块训练,是否可实现高分辨率生成(如1024×1024)而无需全分辨率数据?
  • RQ4缺乏位置编码对不同分辨率下生成质量的影响如何?
  • RQ5与基于扩散模型的直接上采样相比,分层超分辨率的性能提升如何?

主要发现

  • 在FFHQ数据集×4超分辨率任务中,该方法取得66.80的FID分数,优于双三次插值与SR3,与ILVR、SRGAN等SOTA方法相当或更优。
  • 在AFHQ-Dog数据集×8超分辨率任务中,该方法取得33.14的FID分数,优于SR3(35.09)与ILVR(37.39)。
  • 消融实验表明,移除位置编码会导致严重伪影,如面部特征错位、多只眼睛等,证明其在空间一致性中的关键作用。
  • 包含所有中间步骤(32→64→128→256)的分层超分辨率取得最佳FID(FFHQ为66.80),优于直接上采样(32→256)的FID 72.78。
  • 该模型成功从仅在256×256与512×512图像块上训练的得分网络生成1024×1024图像,从未接触过全分辨率数据。
  • 该方法在感知质量(FFHQ的LPIPS为0.289)与结构保真度(AFHQ在×8时SSIM为0.725)方面均表现优异,证实其在多尺度下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。