Skip to main content
QUICK REVIEW

[论文解读] The Stable Artist: Steering Semantics in Diffusion Latent Space

Manuel Brack, Patrick Schramowski|arXiv (Cornell University)|Dec 12, 2022
Generative Adversarial Networks and Image Synthesis被引用 10
一句话总结

Stable Artist 引入了语义引导(SEGA),一种通过在潜在空间中沿多个语义方向引导轨迹,实现对文本到图像扩散模型的细粒度、迭代式控制的方法,无需掩码或微调。该方法支持高质量图像编辑、风格迁移和构图控制,在多概念编辑和抽象概念的语义探测方面优于现有方法如 P2P 和 Composable Diffusion。

ABSTRACT

Large, text-conditioned generative diffusion models have recently gained a lot of attention for their impressive performance in generating high-fidelity images from text alone. However, achieving high-quality results is almost unfeasible in a one-shot fashion. On the contrary, text-guided image generation involves the user making many slight changes to inputs in order to iteratively carve out the envisioned image. However, slight changes to the input prompt often lead to entirely different images being generated, and thus the control of the artist is limited in its granularity. To provide flexibility, we present the Stable Artist, an image editing approach enabling fine-grained control of the image generation process. The main component is semantic guidance (SEGA) which steers the diffusion process along variable numbers of semantic directions. This allows for subtle edits to images, changes in composition and style, as well as optimization of the overall artistic conception. Furthermore, SEGA enables probing of latent spaces to gain insights into the representation of concepts learned by the model, even complex ones such as 'carbon emission'. We demonstrate the Stable Artist on several tasks, showcasing high-quality image editing and composition.

研究动机与目标

  • 为解决文本到图像扩散模型中缺乏细粒度、交互式控制的问题,即微小的提示变化会导致图像结果不可预测地变化。
  • 使艺术家能够无需依赖图像掩码或基于注意力的软掩码,迭代地沿多个语义方向引导图像生成。
  • 在单一统一框架中支持复杂编辑任务,如风格迁移、构图变化和纹理操作。
  • 实现对潜在空间表征的探测,以理解模型中抽象概念(如“碳排放”)的语义表示。
  • 提供一种通用的条件控制机制,可扩展至文本以外的输入形式,包括图像和文本反转生成的嵌入。

提出的方法

  • SEGA 使用潜在扩散模型从文本提示及其编辑版本中预测噪声,并通过预测噪声的差异在潜在空间中计算方向性引导。
  • 通过学习的缩放因子 sₑⁱ 和原始提示与编辑后提示噪声预测之间差异的阈值化处理,计算引导向量 μₜ。
  • 根据原始提示的噪声预测是否大于编辑后提示的预测结果,决定施加正向或负向引导,并使用可学习阈值 λ 进行控制。
  • 最终的引导信号 γₜ 是各概念引导向量的加权和,可选择性地通过 νₜ 注入残差噪声。
  • 通过基于动量的噪声校正迭代更新潜在代码,其中 βₘ 控制对历史引导的记忆程度。
  • 该方法完全在潜在空间中运行,无需模型微调,也无需显式掩码,从而支持对多样化输入的灵活条件控制。

实验结果

研究问题

  • RQ1潜在空间中的语义引导是否能够实现在无需图像掩码或基于注意力的软掩码情况下的细粒度、迭代式图像编辑?
  • RQ2在图像生成过程中,如何同时对多个语义概念进行条件控制,同时保持对各概念影响强度的精确控制?
  • RQ3潜在空间是否可被探测以理解抽象复杂概念(如“碳排放”)在扩散模型中的表征方式?
  • RQ4SEGA 在多大程度上能够支持类似自然语言嵌入中概念算术的高级操作?
  • RQ5与 P2P 和 Composable Diffusion 等现有方法相比,该方法在编辑质量与构图保真度方面表现如何?

主要发现

  • SEGA 实现了高质量的多概念图像编辑,可完全控制每个语义编辑的方向与强度,在构图融合与风格融合方面优于 P2P 和 Composable Diffusion。
  • 该方法成功实现了忠实的风格迁移,例如将城堡图像转换为梵高风格的绘画,同时保持原始构图不变。
  • SEGA 支持同时对多个概念进行编辑,避免了 P2P 在单个提示中组合多个编辑时出现的伪物重复等伪影问题。
  • 该方法允许对潜在空间中抽象概念的表征进行探测,证明即使像“碳排放”这类复杂且非视觉化的概念,也能实现语义引导。
  • SEGA 实现了图像生成中的概念算术,将此前仅在自然语言嵌入中观察到的能力扩展到了视觉领域。
  • 该方法具有通用性,适用于多种条件输入,包括文本嵌入、图像提示以及文本反转生成的嵌入,且无需模型微调。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。