[论文解读] Concept Algebra for (Score-Based) Text-Controlled Generative Models
本文提出概念代数——一种数学框架,将文本到图像扩散模型的得分表示空间中的高层次概念(例如性别、艺术风格)识别为子空间。通过利用文本条件分布的Stein得分作为可算术组合的表示,该方法实现了通过投影和向量运算对概念进行精确的代数操作,在Stable Diffusion中展示了优于启发式方法的解缠程度。
This paper concerns the structure of learned representations in text-guided generative models, focusing on score-based models. A key property of such models is that they can compose disparate concepts in a `disentangled' manner. This suggests these models have internal representations that encode concepts in a `disentangled' manner. Here, we focus on the idea that concepts are encoded as subspaces of some representation space. We formalize what this means, show there's a natural choice for the representation, and develop a simple method for identifying the part of the representation corresponding to a given concept. In particular, this allows us to manipulate the concepts expressed by the model through algebraic manipulation of the representation. We demonstrate the idea with examples using Stable Diffusion. Code in https://github.com/zihao12/concept-algebra-code
研究动机与目标
- 形式化高阶概念(如性别或艺术风格)在文本控制生成模型表示空间中作为子空间的编码方式。
- 确立文本条件分布的Stein得分作为可算术组合的表示,支持对概念的代数操作。
- 开发一种系统化方法,用于识别和编辑基于得分的扩散模型潜在空间中的特定概念子空间。
- 证明概念代数在概念操作上比启发式得分编辑方法更有效且更独立。
- 提供一个统一的数学框架,以理解并控制文本到图像生成中的概念解缠。
提出的方法
- 通过建模数据生成过程中的潜在变量C(捕捉语义上有意义的属性),将概念形式化为表示空间中的子空间。
- 将得分表示定义为文本条件分布的Stein得分,证明其具有算术可组合性,适用于概念代数。
- 使用投影算子(如 projₜ)通过沿这些方向编辑表示向量,隔离并操作特定概念子空间。
- 利用参考提示(如“一位女护士”和“一位男护士”)构建概念子空间,以估计“性别”等概念对应的方向。
- 应用代数运算如 (I - projₜ) + projₜ·(α·s₁ + (1−α)·s₂),在提示之间插值或转移概念,同时保持其他属性不变。
- 在Stable Diffusion上验证该方法,通过定性和对比评估,生成可独立编辑特定概念的图像。
实验结果
研究问题
- RQ1高阶概念(如性别或艺术风格)能否在基于得分的文本到图像模型的表示空间中被正式建模为子空间?
- RQ2文本条件分布的Stein得分是否是一种算术可组合的表示,能够支持对概念的代数操作?
- RQ3是否仅通过少量参考提示即可可靠地识别和编辑概念子空间,而无需模型微调?
- RQ4与启发式得分编辑方法(如负向提示)相比,概念代数在解缠程度和控制保真度方面表现如何?
- RQ5在零样本设置下,该框架在抽象概念(如“主体”或“场景”)上的操作能力有多强?
主要发现
- 文本条件分布的Stein得分可作为算术可组合的表示,支持通过线性代数运算操作概念。
- “性别”和“艺术风格”等概念在表示空间中被编码为可识别的子空间,可通过投影操作实现精确编辑。
- 该方法成功实现了对图像生成中抽象概念(如“主体”)的编辑,例如将“玩具”替换为“sks玩具”时保持背景上下文不变。
- 概念代数在隔离和修改特定概念方面优于启发式方法(如负向提示),且无意外副作用。
- 即使对应提示未直接描述该概念,该框架仍能实现有效解缠,表现出对分布偏移的鲁棒性。
- 该方法在Stable Diffusion上得到验证,通过子空间编辑实现一致且可解释的图像编辑,结果在多种概念类型中可视化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。