QUICK REVIEW
[论文解读] Personalizing Text-to-Image Generation via Aesthetic Gradients
Víctor Gallego|arXiv (Cornell University)|Sep 25, 2022
Image Retrieval and Classification Techniques被引用 5
一句话总结
本文提出美学梯度(aesthetic gradients)方法,通过优化CLIP文本编码器的嵌入表示,使其与用户定义的美学偏好对齐,从而个性化文本到图像的扩散模型。该方法利用一组参考图像,基于提示嵌入与用户提供的美学嵌入之间的点积损失,对CLIP文本编码器权重进行少量梯度更新(5–20步,初始学习率ε = 1e−4),实现无需微调扩散模型即可提升图像生成质量与风格一致性,显著提高美学评分,并增强生成图像在风格偏好上的一致性。
ABSTRACT
This work proposes aesthetic gradients, a method to personalize a CLIP-conditioned diffusion model by guiding the generative process towards custom aesthetics defined by the user from a set of images. The approach is validated with qualitative and quantitative experiments, using the recent stable diffusion model and several aesthetically-filtered datasets. Code is released at https://github.com/vicgalle/stable-diffusion-aesthetic-gradients
研究动机与目标
- 解决现有文本到图像模型在捕捉用户特定美学偏好方面存在的局限,超越对象层面的个性化。
- 实现基于反映目标视觉风格或美学偏好的参考图像集合的扩散模型个性化。
- 开发一种轻量化、高效的个性化方法,避免微调扩散模型,同时保持原始提示的语义一致性。
- 通过将CLIP文本编码器的表征与用户定义的视觉偏好对齐,提升生成图像的美学质量。
提出的方法
- 该方法通过计算K个用户提供的参考图像的CLIP视觉嵌入的平均值,得到美学嵌入e,并将其归一化为单位长度。
- 定义损失函数为提示的CLIP文本嵌入c与美学嵌入e之间的点积,用于衡量提示与用户偏好的对齐程度。
- 对CLIP文本编码器权重θ使用损失∇θ(c eᵀ)进行梯度下降更新,使提示表征更符合期望的美学风格。
- 在5–20步的少量更新中,以学习率ε = 1e−4执行更新,生成个性化提示嵌入c′。
- 仅更新CLIP文本编码器;扩散模型与视觉编码器保持冻结,确保计算效率与模型稳定性。
- 随后使用个性化嵌入c′作为条件输入扩散模型,生成既符合原始提示又体现用户美学偏好的图像。
实验结果
研究问题
- RQ1能否使扩散模型不仅针对特定对象,而是基于一组参考图像定义的更广泛美学风格实现个性化?
- RQ2基于梯度的CLIP文本编码器优化在多大程度上能有效提升生成图像与用户定义视觉美学之间的对齐程度?
- RQ3与简单提示工程(如在提示中添加美学关键词)相比,该方法在捕捉复杂视觉风格方面是否更具优势?
- RQ4在不微调扩散模型的前提下,该方法在多大程度上能提升生成图像的美学质量?
- RQ5该方法对学习率和优化步数等超参数的敏感程度如何?
主要发现
- 与原始Stable Diffusion模型相比,美学梯度方法显著提升了生成图像的平均美学评分,该结果由开源美学评分模型验证。
- 基于SAC₈₊和LAION₇₊数据集生成的个性化嵌入,其生成图像在视觉风格上与目标美学(如幻想风或花卉风格)表现出更强的对齐性,经定性分析确认。
- 该方法优于简单的提示增强(如在提示中添加“gloomcore”或“glowwave”),后者因CLIP文本编码器的局限性而效果甚微。
- 该方法在多样化提示(包括复杂和长句描述)中均实现了稳定的风格迁移,展现出对提示变化的鲁棒性。
- 该方法计算效率高,仅需对CLIP文本编码器执行5–20步梯度更新,无需微调扩散模型,也无需存储模型权重。
- 每个美学偏好仅使用一个768维向量,实现紧凑、可共享且可扩展的个性化方案,适用于多用户场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。