[论文解读] HiCo: Hierarchical Controllable Diffusion Model for Layout-to-image Generation
HiCo 提出了一种用于布局到图像生成的层次化可控扩散模型,采用多分支、参数共享的条件结构实现空间解耦,提升了复杂布局中物体的一致性和图像质量。该模型在新的 HiCo-7K 基准和 COCO-3K 上均达到最先进性能,通过 FuseNet 融合机制实现更快推理速度,并支持 LoRA/LCM 集成,显著增强可控性。
The task of layout-to-image generation involves synthesizing images based on the captions of objects and their spatial positions. Existing methods still struggle in complex layout generation, where common bad cases include object missing, inconsistent lighting, conflicting view angles, etc. To effectively address these issues, we propose a extbf{Hi}erarchical extbf{Co}ntrollable (HiCo) diffusion model for layout-to-image generation, featuring object seperable conditioning branch structure. Our key insight is to achieve spatial disentanglement through hierarchical modeling of layouts. We use a multi branch structure to represent hierarchy and aggregate them in fusion module. To evaluate the performance of multi-objective controllable layout generation in natural scenes, we introduce the HiCo-7K benchmark, derived from the GRIT-20M dataset and manually cleaned. https://github.com/360CVGroup/HiCo_T2I.
研究动机与目标
- 为解决布局到图像生成中长期存在的问题,如物体缺失、光照不一致以及复杂场景中的视角冲突。
- 通过多层次建模布局,实现多条件分支,提升空间解耦与构图和谐性。
- 提出一个新的高质量基准 HiCo-7K,用于评估自然场景中多目标、可控布局生成的性能。
- 通过 LoRA、LCM 集成和模型检查点切换,实现灵活的可扩展性。
- 在封闭集和开放集布局生成任务中均展示出卓越性能。
提出的方法
- 模型采用多分支、参数共享的架构,分别提取每个物体的层次化布局特征,实现局部化控制。
- FuseNet 模块通过求和、平均或基于注意力的掩码方式,非参数化地聚合来自单个物体分支和全局背景分支的特征。
- 全局背景分支使用全局提示,以引导整体场景的一致性和遮挡顺序。
- 通过类似于 ControlNet 或 IP-Adapter 的条件分支结构,与预训练的文本到图像扩散模型(如 Stable Diffusion)集成。
- 推理支持并行与串行两种模式,其中并行模式可在物体分支间批量处理,实现加速。
- 模型兼容 LoRA 微调和 LCM(潜在一致性模型),实现快速、高质量的推理。
实验结果
研究问题
- RQ1对布局特征进行层次化建模是否能提升复杂布局到图像生成中物体的一致性和空间连贯性?
- RQ2所提出的多分支融合条件结构相较于现有无训练和有训练方法,在处理复杂布局时表现如何?
- RQ3HiCo 模型在支持快速推理和模型灵活性的同时,能在多大程度上保持高图像质量和可控性?
- RQ4新提出的 HiCo-7K 基准在客观评估自然场景中布局到图像生成方面是否有效?
- RQ5该模型能否通过 LoRA 有效处理开放式的细粒度文本描述和多概念生成?
主要发现
- HiCo 在开放集的 HiCo-7K 基准上达到最先进性能,Fréchet Inception Distance (FID) 为 15.26,Average Recall (AR) 为 39.51。
- 在封闭集的 COCO-3K 数据集上,HiCo 的 FID 为 18.78,AR 为 36.30,优于现有方法如 CAG 和 GLIGEN。
- 采用基于掩码的 FuseNet 融合机制效果最佳,使 HiCo-7K 上的 FID 降低至 15.26,LocalIoU Score 提升至 59.07。
- 在 24GB V100 GPU 上,HiCo 的推理速度最快,GPU 显存占用为第二低,512×512 图像生成时间低于 1 秒。
- 通过 LCM 和 Lightning 推理模式,模型支持快速推理,实现实时高质量生成。
- 主观评估表明,与基线模型相比,HiCo 生成的图像更具和谐感和真实感,尤其在重叠物体的复杂布局中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。