QUICK REVIEW
[论文解读] Investigating Prompt Engineering in Diffusion Models
Sam Witteveen, Martin Andrews|arXiv (Cornell University)|Nov 21, 2022
Neuroscience and Music Perception被引用 15
一句话总结
本文研究了文本提示中不同语言成分对扩散模型(如 Stable Diffusion)图像生成的影响。通过使用 CLIP 测量语义相似性,以及使用 LPIPS 测量图像相似性,作者证明名词和艺术家姓名对图像内容的影响最强,而形容词(描述性词语)的影响最小,从而为文本到图像生成中的有效提示工程提供了可量化的框架。
ABSTRACT
With the spread of the use of Text2Img diffusion models such as DALL-E 2, Imagen, Mid Journey and Stable Diffusion, one challenge that artists face is selecting the right prompts to achieve the desired artistic output. We present techniques for measuring the effect that specific words and phrases in prompts have, and (in the Appendix) present guidance on the selection of prompts to produce desired effects.
研究动机与目标
- 量化不同语言类别在文本提示中对扩散模型图像生成的影响。
- 识别哪些提示组件(例如描述性词语、名词、艺术家)最显著地改变生成图像的内容。
- 开发一种系统化方法,用于测量和比较提示修改对图像输出的影响。
- 为艺术家和研究人员提供实证指导,以构建实现期望视觉效果的有效提示。
- 通过分析风格化和语义提示组件如何影响图像生成,揭示生成模型中的偏见。
提出的方法
- 作者将提示分解为两个部分:物理/事实性内容(例如 '一只跪着的缅因库恩猫')和风格描述(例如 光照、艺术风格)。
- 使用固定的随机种子和调度器,确保每个提示变体的图像生成具有确定性,从而实现受控比较。
- 图像相似性使用 LPIPS 和感知损失进行测量,文本相似性则通过 CLIP 嵌入余弦相似度和 Sentence Transformers 进行评估。
- 研究在 2,000 种提示变体上评估了超过 15,000 次图像生成,隔离了诸如描述性词语、名词、艺术家和光照短语等语言类别。
- 分析各类别下 LPIPS 分数的统计分布,以评估每次提示修改带来的视觉变化程度。
- 将 CLIP 与 LPIPS 进行相关性分析,以评估文本嵌入中的语义差异是否与生成图像的感知差异一致。
实验结果
研究问题
- RQ1不同语言类别(如形容词、名词和专有名词)如何影响文本到图像扩散模型的视觉输出?
- RQ2与改变内容的词语(如 '艺术家姓名')相比,风格描述(如 '体积光照')在多大程度上改变了图像内容?
- RQ3基于提示差异,CLIP 嵌入在在多大程度上能预测生成图像之间的视觉相似性?
- RQ4能否在多次模型生成中系统性地对提示组件的影响进行分类和量化?
- RQ5训练数据中的偏见如何通过提示工程显现,特别是在引用特定艺术家或风格时?
主要发现
- 描述性词语(例如形容词如 '美丽的' 或 '空灵的')对图像生成的影响相对较小,平均 LPIPS 相似度得分为 0.664。
- 名词导致图像内容发生显著变化,平均 LPIPS 相似度降至 0.512,表明视觉差异显著。
- 艺术家姓名(如 '以列奥纳多·达·芬奇的风格')导致最剧烈的变化,LPIPS 相似度得分低至 0.465,表明图像在结构和风格上发生重大改变。
- 光照修饰语表现出双峰行为:部分(如 '环境光照')表现如名词,显著改变图像;而另一些(如 '美丽的体积光照')则表现如描述性词语,影响微乎其微。
- 基于 CLIP 的文本相似度与基于 LPIPS 的图像相似度相关性更强,表明 CLIP 嵌入与扩散模型潜在空间更一致。
- 本研究证实,提示工程并非仅凭审美直觉,而是可系统化进行的,其中名词和艺术家姓名是控制图像构图的最有力杠杆。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。