Skip to main content
QUICK REVIEW

[论文解读] Generate Anything Anywhere in Any Scene

Yuheng Li, Haotian Liu|arXiv (Cornell University)|Jun 29, 2023
Generative Adversarial Networks and Image Synthesis被引用 4
一句话总结

PACGen 提出了一种新颖的文本到图像扩散模型,通过在微调过程中通过数据增强将对象身份与空间属性解耦,实现了高保真度的个性化对象生成和精确的定位控制。通过在推理时集成 GLIGEN 的适配器层并采用区域引导采样策略,PACGen 使用户能够在各种场景中以任意期望的位置和大小生成个性化对象,其图像质量与可控性均优于现有方法。

ABSTRACT

Text-to-image diffusion models have attracted considerable interest due to their wide applicability across diverse fields. However, challenges persist in creating controllable models for personalized object generation. In this paper, we first identify the entanglement issues in existing personalized generative models, and then propose a straightforward and efficient data augmentation training strategy that guides the diffusion model to focus solely on object identity. By inserting the plug-and-play adapter layers from a pre-trained controllable diffusion model, our model obtains the ability to control the location and size of each generated personalized object. During inference, we propose a regionally-guided sampling technique to maintain the quality and fidelity of the generated images. Our method achieves comparable or superior fidelity for personalized objects, yielding a robust, versatile, and controllable text-to-image diffusion model that is capable of generating realistic and personalized images. Our approach demonstrates significant potential for various applications, such as those in art, entertainment, and advertising design.

研究动机与目标

  • 解决个性化文本到图像扩散模型中对象身份与位置、尺寸之间的耦合问题。
  • 实现在生成场景中对个性化对象位置和尺度的细粒度控制。
  • 在实现个性化与定位可控性的同时,保持高图像保真度。
  • 开发一种方法,使个性化后无需额外微调即可实现定位控制。
  • 减轻训练期间数据增强引入的伪影(如拼接效应)。

提出的方法

  • 在 DreamBooth 风格的微调过程中,对用户提供的图像应用随机缩放和重新定位,以实现对象身份与空间属性的解耦。
  • 在推理时将预训练的 GLIGEN 适配器层集成到微调后的扩散模型中,以实现对位置和尺寸的控制。
  • 采用区域引导采样策略,使用三种专用提示:负面提示、多样性提示和抑制提示。
  • 利用无分类器引导(scale = 5)和调度采样(τ = 0.3),在图像质量和布局准确性之间取得平衡。
  • 使用 CLIP 特征训练拼接分类器,以定量评估并消融数据增强引入的伪影。
  • 使用批量大小为 2 对 Stable Diffusion v1.4 进行 1000 次迭代微调,随机缩放系数 s = 0.3。

实验结果

研究问题

  • RQ1在微调过程中,数据增强是否能有效实现个性化扩散模型中对象身份与空间属性的解耦?
  • RQ2集成 GLIGEN 适配器在不重新训练的情况下,能在多大程度上实现定位控制?
  • RQ3区域引导采样在多大程度上提升了图像质量并减少了拼接效应等伪影?
  • RQ4多概念个性化对属性一致性和生成保真度有何影响?
  • RQ5区域引导采样提示中的各个组件对整体性能有何贡献?

主要发现

  • 所提出的数据增强策略将生成图像之间的 LPIPS 距离从 0.6583 降低至 0.5489,表明解耦后图像一致性提高,多样性降低。
  • 消融研究证实,若移除任意一种区域引导提示,均会导致显著伪影:缺失负面提示时尤其在小对象上出现拼接效应。
  • 若无抑制提示,模型会在错误位置生成不必要的重复实例,表明其在保持布局保真度方面具有关键作用。
  • 定性结果表明,PACGen 能够在复杂场景中以高保真度将个性化对象精准放置于任意位置。
  • 该模型支持多种应用,如多对象组合、艺术风格迁移和属性编辑,同时保持定位控制能力。
  • 由于增加了提示,单张图像的推理时间从 5 秒增至 8 秒(A6000 GPU),但其鲁棒性与可控性优势可有效弥补该开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。