Skip to main content
QUICK REVIEW

[论文解读] On Conditioning the Input Noise for Controlled Image Generation with Diffusion Models

Vedant Singh, Surgan Jandial|arXiv (Cornell University)|May 8, 2022
Generative Adversarial Networks and Image Synthesis被引用 5
一句话总结

本文通过构建专门的“物体显著性噪声”——一种非高斯、具备显著性感知能力的输入噪声,提出了一种用于可控图像生成的扩散模型条件化方法。该噪声通过反向梯度从预训练分类器中推导得出。与以往在去噪过程中应用引导的方法不同,该方法仅通过初始噪声实现条件化,从而实现了更优的定位与属性控制。实验表明,经过5000步反向梯度迭代生成的噪声,其生成保真度显著优于早期步骤的噪声。

ABSTRACT

Conditional image generation has paved the way for several breakthroughs in image editing, generating stock photos and 3-D object generation. This continues to be a significant area of interest with the rise of new state-of-the-art methods that are based on diffusion models. However, diffusion models provide very little control over the generated image, which led to subsequent works exploring techniques like classifier guidance, that provides a way to trade off diversity with fidelity. In this work, we explore techniques to condition diffusion models with carefully crafted input noise artifacts. This allows generation of images conditioned on semantic attributes. This is different from existing approaches that input Gaussian noise and further introduce conditioning at the diffusion model's inference step. Our experiments over several examples and conditional settings show the potential of our approach.

研究动机与目标

  • 为解决扩散模型在条件图像生成中缺乏控制的问题,特别是在定位和强调特定语义属性方面。
  • 探究是否可通过条件化输入噪声本身,而非在去噪过程中应用引导,来实现对生成图像中控制与定位的更好效果。
  • 开发一种利用反向梯度生成结构化、显著性感知噪声的方法,使其适合作为扩散模型的输入。
  • 评估噪声质量及其优化步数对最终图像生成质量与属性对齐的影响。

提出的方法

  • 该方法通过在预训练分类器(ResNet18)上运行反向梯度(IG)算法k步,从随机高斯噪声开始,生成物体显著性噪声。
  • IG过程通过梯度优化迭代更新噪声,以最大化目标类别的激活,同时与参考图像对齐,从而通过梯度优化突出显著区域。
  • 利用扩散模型训练数据分布中学习到的均值和标准差对优化后的噪声进行归一化,以确保兼容性。
  • 归一化后的噪声被用作预训练的类别条件DDPM的输入,通过其标准的迭代去噪过程生成图像。
  • 该方法利用IG过程中的中间输出(如1000、3000、5000步)作为输入噪声,避免了采样过程中额外的条件化需求。
  • 通过在多个类别和变换下进行定性对比与消融实验,评估了噪声质量与生成保真度的影响。

实验结果

研究问题

  • RQ1是否可以对输入噪声进行工程设计,使其编码语义属性(如物体位置与显著性),从而实现对扩散模型生成过程的直接控制?
  • RQ2输入噪声的质量与优化程度(例如1000步与5000步IG迭代后)如何影响生成图像的保真度与定位效果?
  • RQ3仅通过输入噪声进行条件化,是否能在控制力与多样性方面优于或补充现有的基于引导的方法?
  • RQ4同一种显著性结构化的噪声是否可跨多个类别与条件复用,以生成一致且属性对齐的图像?

主要发现

  • 经过5000步反向梯度迭代优化的噪声,其生成的图像在定位与质量方面显著优于1000步生成的噪声,证明了噪声优化的重要性。
  • 相同的物体显著性噪声可在多个类别间生成一致且属性对齐的图像,表明其具备良好的泛化性与控制潜力。
  • 对输入噪声进行旋转或翻转,会直接导致生成图像中相应方向的变化,证实噪声编码了空间结构信息。
  • 使用ResNet特征图中的显著性图或FGSM梯度作为输入噪声,生成结果的清晰度低于IG生成的噪声,表明IG产生的噪声分布更具兼容性。
  • 生成图像的背景通常被抑制,表明物体显著性噪声天然强调前景物体,这可能有利于生成无背景图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。