Skip to main content
QUICK REVIEW

[论文解读] Multiresolution Textual Inversion

Giannis Daras, Alexandros G. Dimakis|arXiv (Cornell University)|Nov 30, 2022
Natural Language Processing Techniques被引用 7
一句话总结

本文提出多分辨率文本反演(Multiresolution Textual Inversion),一种将文本反演扩展至在不同扩散时间条件下学习多个表示同一概念的伪词的方法,从而在不同细节层次上表示该概念。该方法支持通过自然语言控制图像生成的细节程度,使用户能够使用如 'A photo of $S^{*}(0.8)$'(低细节)或 '$S^{*}(0.0)$'(高细节)等提示词,生成同一概念在不同分辨率下的图像。

ABSTRACT

We extend Textual Inversion to learn pseudo-words that represent a concept at different resolutions. This allows us to generate images that use the concept with different levels of detail and also to manipulate different resolutions using language. Once learned, the user can generate images at different levels of agreement to the original concept; "A photo of $S^*(0)$" produces the exact object while the prompt "A photo of $S^*(0.8)$" only matches the rough outlines and colors. Our framework allows us to generate images that use different resolutions of an image (e.g. details, textures, styles) as separate pseudo-words that can be composed in various ways. We open-soure our code in the following URL: https://github.com/giannisdaras/multires_textual_inversion

研究动机与目标

  • 将文本反演扩展至学习多个表示同一概念的伪词,以对应不同分辨率。
  • 使用户能够通过自然语言提示控制生成图像的细节程度。
  • 将图像生成分辨率与标准文本反演中固定的嵌入解耦。
  • 支持在不同概念之间灵活组合不同分辨率的组件,以实现创意图像合成。
  • 保持与预训练文本到图像扩散模型及现有方法(如DreamBooth)的兼容性。

提出的方法

  • 将文本嵌入条件化于扩散时间 $t$,使用 $\mathrm{emb}_{\lfloor t/T \rfloor}$ 表示输入概念在不同分辨率层级下的表示。
  • 通过依赖于扩散步骤的去噪目标,优化一组嵌入 $\mathrm{Emb}^{*} = \{\mathrm{emb}_0, \dots, \mathrm{emb}_{T-1}\}$。
  • 采用三种采样策略:固定分辨率、半分辨率依赖和完全分辨率依赖,以控制生成过程中分辨率的应用方式。
  • 通过线性插值实现学习到的嵌入之间的插值,以实现连续的分辨率控制。
  • 将条件网络分解为 $c_\theta(y) = \mathrm{enc}_\theta(\mathrm{emb}_\theta(y))$,并将嵌入层调整为支持时间依赖的分辨率索引。
  • 使用标准扩散目标进行训练:$\min_{\mathrm{emb}} \mathbb{E}_{t,x,z_t} \left|\left| \hat{\epsilon}_\theta(z_t(x), t, \mathrm{enc}_\theta(\mathrm{emb}_{\lfloor t/T \rfloor})) - \epsilon(z_0, z_t) \right|\right|^2$。

实验结果

研究问题

  • RQ1我们能否为单个概念学习多个表示不同细节层次的伪词?
  • RQ2语言提示是否可以通过选择不同的分辨率特定嵌入来控制生成图像的分辨率?
  • RQ3所提出的方法在不同分辨率层次上是否能保持高图像质量和语义一致性?
  • RQ4学习到的分辨率特定嵌入是否可以在不同概念和提示之间进行组合?
  • RQ5与标准文本反演相比,多分辨率文本反演在生成质量和灵活性方面表现如何?

主要发现

  • 该方法成功为单个概念学习了多个分辨率特定的嵌入,实现了通过语言控制图像细节的能力。
  • 固定分辨率采样策略可通过使用 $S^{*}|0.0|$ 选择性提取输入图像中的精细细节(如纽扣)。
  • 半分辨率依赖采样策略在高噪声水平下实现高层级变化,例如 $S^{*}(0.8)$ 生成的图像仅大致匹配输入的颜色与姿态,但具有照片级真实感。
  • 完全分辨率依赖采样策略在所有扩散步骤中均保持与输入概念的强一致性,有效维持结构稳定性。
  • 该方法支持跨概念任意组合分辨率组件,例如可将塑料物体的精细结构用于生成形状全新的狗或猫。
  • 在个性化图像生成任务中,多分辨率文本反演在生成质量上与标准文本反演相当或更优,如与原始方法的定性比较所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。