Skip to main content
QUICK REVIEW

[论文解读] Denoising Diffusion Step-aware Models

Shuai Yang, Yukang Chen|arXiv (Cornell University)|Oct 5, 2023
Generative Adversarial Networks and Image SynthesisComputer Science被引用 3
一句话总结

本文提出去噪扩散步长感知模型(DDSM),一种通过进化搜索动态调整去噪过程中神经网络规模的框架,以降低计算成本。通过为关键性较低的步骤分配更小、剪枝后的网络,为关键阶段分配更大的网络,DDSM 在 ImageNet 和 CelebA-HQ 等数据集上实现了高达 76% 的 FLOPs 减少,且未牺牲生成样本质量。

ABSTRACT

Denoising Diffusion Probabilistic Models (DDPMs) have garnered popularity for data generation across various domains. However, a significant bottleneck is the necessity for whole-network computation during every step of the generative process, leading to high computational overheads. This paper presents a novel framework, Denoising Diffusion Step-aware Models (DDSM), to address this challenge. Unlike conventional approaches, DDSM employs a spectrum of neural networks whose sizes are adapted according to the importance of each generative step, as determined through evolutionary search. This step-wise network variation effectively circumvents redundant computational efforts, particularly in less critical steps, thereby enhancing the efficiency of the diffusion model. Furthermore, the step-aware design can be seamlessly integrated with other efficiency-geared diffusion models such as DDIMs and latent diffusion, thus broadening the scope of computational savings. Empirical evaluations demonstrate that DDSM achieves computational savings of 49% for CIFAR-10, 61% for CelebA-HQ, 59% for LSUN-bedroom, 71% for AFHQ, and 76% for ImageNet, all without compromising the generation quality.

研究动机与目标

  • 解决去噪扩散模型的高计算成本问题,这些模型在生成过程中每一步都需要完整的网络推理。
  • 探究所有去噪步骤是否都需要同等的计算资源,挑战每一步采用相同模型复杂度的假设。
  • 开发一种方法,根据每一步的重要性自适应地分配网络容量,以最小化冗余计算。
  • 确保与现有加速技术(如 DDIM 和潜在扩散)的兼容性,以扩大实际适用性。
  • 证明数据集特定的步长重要性分布显著影响模型效率与性能。

提出的方法

  • 提出一种步长感知架构,使神经网络容量在每个去噪步骤中可变,基于基础 U-Net 的剪枝版本实现。
  • 采用进化搜索,根据生成质量与计算成本,为每个步骤确定最优网络规模(从小型到大型)。
  • 将全精度 U-Net 剪枝为多个轻量化变体,与原始网络共享权重,避免重新训练。
  • 将步长感知设计与现有扩散加速方法(如 DDIM 和潜在扩散)集成,以进一步提升效率。
  • 使用平滑的颜色条和折线图可视化搜索结果,展示各步骤的模型规模分布。
  • 在五个多样化数据集上评估该方法,以验证其泛化能力及数据集依赖的优化策略。

实验结果

研究问题

  • RQ1扩散模型中的所有去噪步骤是否都需要相同的计算复杂度?
  • RQ2能否通过跨步骤的动态网络剪枝在不降低样本质量的前提下减少 FLOPs?
  • RQ3不同数据集(具有不同结构与内容特征)中每一步的重要性如何变化?
  • RQ4步长感知模型剪枝在多大程度上可与 DDIM 或潜在扩散等其他加速技术结合?
  • RQ5去噪步骤的重要性分布是否存在数据集特定的模式,且能否被用于提升效率?

主要发现

  • DDSM 在 ImageNet 生成中实现了 76% 的 FLOPs 减少,同时保持高质量样本,是所有评估数据集中效率提升最高的。
  • 该方法在 CelebA-HQ 上减少 61% 的计算成本,在 LSUN-bedroom 上减少 59%,在 CIFAR-10 上减少 49%,在 AFHQ 上减少 71%,在多种数据分布下均保持一致性能。
  • 搜索结果表明,CelebA-HQ 的早期步骤需要更大的模型,这是由于对结构约束(如面部对称性)要求严格;而 CIFAR-10 和 ImageNet 由于结构变异性更高,早期使用更小的模型。
  • 在不同数据集中互换最优策略会导致性能显著下降——例如,在 CelebA-HQ 上使用 CIFAR-10 的策略会使 FID 从 6.039 上升至 7.431,证实了数据集特定搜索的必要性。
  • 步长感知设计与现有加速方法正交,可无缝集成 DDIM 和潜在扩散,进一步提升效率。
  • 该方法揭示,在高分辨率人脸数据集(如 CelebA-HQ)中,细节生成对模型容量不敏感,而在结构多样的数据集(如 CIFAR-10 和 ImageNet)中,早期步骤对更高容量的需求更为关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。