[论文解读] Unsupervised Discovery of Semantic Latent Directions in Diffusion Models
该论文提出了一种无监督方法,利用潜在变量 $\mathbf{x}_t$ 与 U-Net 中间特征 $\mathcal{H}$ 之间的黎曼几何关系,在扩散模型的潜在空间中发现可解释的、全局一致的语义潜在方向。通过分解从 $\mathbf{x}_t$ 到 $\mathcal{H}$ 的编码器映射的雅可比矩阵,该方法识别出解耦的编辑方向,可在不同样本间一致地操控属性,即使在 Stable Diffusion 等复杂模型中亦然,揭示了早期时间步控制粗粒度特征、后期时间步细化高频细节的规律。
Despite the success of diffusion models (DMs), we still lack a thorough understanding of their latent space. While image editing with GANs builds upon latent space, DMs rely on editing the conditions such as text prompts. We present an unsupervised method to discover interpretable editing directions for the latent variables $\mathbf{x}_t \in \mathcal{X}$ of DMs. Our method adopts Riemannian geometry between $\mathcal{X}$ and the intermediate feature maps $\mathcal{H}$ of the U-Nets to provide a deep understanding over the geometrical structure of $\mathcal{X}$. The discovered semantic latent directions mostly yield disentangled attribute changes, and they are globally consistent across different samples. Furthermore, editing in earlier timesteps edits coarse attributes, while ones in later timesteps focus on high-frequency details. We define the curvedness of a line segment between samples to show that $\mathcal{X}$ is a curved manifold. Experiments on different baselines and datasets demonstrate the effectiveness of our method even on Stable Diffusion. Our source code will be publicly available for the future researchers.
研究动机与目标
- 为解决当前扩散模型潜在空间中可解释性与控制性不足的问题,该问题目前依赖于条件提示而非潜在空间编辑。
- 在无需属性标注或外部监督的情况下,发现扩散模型潜在空间 $\mathbf{x}_t$ 中全局一致且可解释的编辑方向。
- 理解潜在空间 $\mathcal{X}$ 的几何结构,特别是其曲率,及其与时间步上分层特征生成的关系。
- 通过识别 $\mathbf{x}_t$ 中有意义的方向,实现在预训练、冻结的扩散模型中进行语义图像编辑。
- 证明该方法可泛化至如 Stable Diffusion 等最先进模型,尽管其架构复杂且采用条件引导。
提出的方法
- 该方法利用黎曼几何将潜在变量 $\mathbf{x}_t$ 与 U-Net 的中间特征图 $\mathcal{H}$ 关联,将 $\mathcal{H}$ 视为黎曼流形。
- 计算从 $\mathbf{x}_t$ 到 $\mathcal{H}$ 的编码器映射的雅可比矩阵,并应用奇异值分解(SVD)以提取在 $\mathcal{H}$ 中引起最大变化的主方向。
- 通过在多个样本上对局部切空间方向进行平均,推导出全局语义方向,确保其一致性与泛化能力。
- 通过几何平均对方向向量进行归一化,以防止饱和并确保在极端扰动下编辑的稳定性。
- 在 $\mathbf{x}_t$ 空间中利用球面线性插值(slerp),其近似于 $\mathcal{H}$ 中的测地线,表明 $\mathcal{X}$ 是一个具有曲率的流形。
- 该方法端到端应用于多种扩散模型架构,包括 Stable Diffusion,无需微调或访问训练数据。

实验结果
研究问题
- RQ1我们能否在无任何监督或属性标注的情况下,发现扩散模型潜在空间 $\mathbf{x}_t$ 中全局一致且可解释的编辑方向?
- RQ2潜在空间 $\mathcal{X}$ 的几何结构,特别是其曲率,如何影响生成过程与编辑行为?
- RQ3扩散过程中的早期与晚期时间步是否分别对应于粗粒度与细粒度的属性操控?
- RQ4与 GANSpace 等现有方法相比,所发现的方向在解耦性与视觉质量方面表现如何?
- RQ5该方法在复杂且条件化的扩散模型(如 Stable Diffusion)上具有多大程度的泛化能力?
主要发现
- 该方法在 $\mathbf{x}_t$ 中发现了导致一致且解耦属性变化(如年龄、表情、发长)的语义潜在方向,且无需任何属性监督。
- 所发现的方向具有全局一致性:同一方向应用于不同样本时,均产生相似的语义编辑,支持通用图像编辑。
- 在早期时间步进行编辑主要影响低频分量(如整体形状、姿态),而后期时间步则细化高频细节(如纹理、面部特征)。
- 潜在空间 $\mathbf{x}_t$ 具有几何曲率,表现为样本间线段的非零曲率,且 $\mathbf{x}_t$ 中的球面插值近似于 $\mathcal{H}$ 中的测地线。
- 即使 GANSpace 专为 GAN 设计,该方法在 $\mathcal{H}$ 特征空间中仍优于 GANSpace,产生更少失真与更优的解耦性。
- 该方法在 Stable Diffusion 上表现良好,但发现的语义方向较少,且偶有突变现象,表明该模型的潜在流形更为复杂。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。