[论文解读] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
本文提出 RPG(Recaption, Plan, and Generate)——一种无需训练的文本到图像扩散框架,利用多模态大语言模型(MLLM)提升组合式生成效果。通过 MLLM 对提示进行重述、规划区域化图像构图,并实现互补的区域扩散,RPG 在复杂提示对齐与多对象组合性方面优于 SOTA 模型(如 DALL-E 3 和 SDXL)。
Diffusion models have exhibit exceptional performance in text-to-image generation and editing. However, existing methods often face challenges when handling complex text prompts that involve multiple objects with multiple attributes and relationships. In this paper, we propose a brand new training-free text-to-image generation/editing framework, namely Recaption, Plan and Generate (RPG), harnessing the powerful chain-of-thought reasoning ability of multimodal LLMs to enhance the compositionality of text-to-image diffusion models. Our approach employs the MLLM as a global planner to decompose the process of generating complex images into multiple simpler generation tasks within subregions. We propose complementary regional diffusion to enable region-wise compositional generation. Furthermore, we integrate text-guided image generation and editing within the proposed RPG in a closed-loop fashion, thereby enhancing generalization ability. Extensive experiments demonstrate our RPG outperforms state-of-the-art text-to-image diffusion models, including DALL-E 3 and SDXL, particularly in multi-category object composition and text-image semantic alignment. Notably, our RPG framework exhibits wide compatibility with various MLLM architectures (e.g., MiniGPT-4) and diffusion backbones (e.g., ControlNet). Our code is available at: https://github.com/YangLing0818/RPG-DiffusionMaster
研究动机与目标
- 解决从涉及多个对象、属性与关系的复杂文本提示中准确生成组合式图像的挑战。
- 克服现有基于布局或反馈的方法在空间控制上仅提供粗粒度控制,或需昂贵训练与反馈收集的局限。
- 通过利用多模态大语言模型的推理与规划能力,实现无需训练、可控且组合式的图像生成。
- 在闭环系统中统一文本引导的图像生成与编辑,以提升不同提示下的语义对齐与泛化能力。
- 确保与多种 MLLM 架构及扩散主干网络(如 ControlNet 和 Stable Diffusion XL)的广泛兼容性。
提出的方法
- 利用多模态大语言模型实现多模态重述:将模糊或复杂的提示转化为详细、语义丰富的子提示,以提升提示理解能力。
- 通过 MLLM 实现思维链规划,将图像生成任务分解为子区域,并为每个区域分配独立的子提示,实现结构化构图。
- 设计互补的区域扩散机制:利用区域特定的子提示,在非重叠子区域内独立生成图像内容,提升空间精度与组合控制能力。
- 集成闭环反馈机制,利用基于 MLLM 的图像字幕生成技术检测生成图像与目标图像之间的语义差异,实现迭代优化。
- 利用基于 MLLM 的推理生成详细推理过程与精确指令,用于区域划分与子提示分配,提升规划准确性。
- 通过解耦规划与生成阶段,确保与多种扩散主干网络(如 ControlNet)和 MLLM 架构(如 MiniGPT-4)的兼容性。
实验结果
研究问题
- RQ1多模态大语言模型能否有效将复杂文本提示分解为语义连贯、区域特定的子提示,以提升图像构图质量?
- RQ2MLLM 中的思维链推理在文本到图像生成中的空间布局规划与子区域分配方面有何增强作用?
- RQ3互补的区域扩散是否在生成包含多个重叠或交互对象及属性的图像时优于全局扩散?
- RQ4闭环集成的重述与反馈机制在多大程度上提升了文本提示与生成图像之间的语义对齐?
- RQ5RPG 框架在无需微调的情况下,对不同 MLLM 架构与扩散模型主干网络的泛化能力如何?
主要发现
- RPG 在生成准确反映复杂组合式提示的图像方面优于 SOTA 模型(如 DALL-E 3 和 SDXL),尤其在多类别对象组合方面表现更优。
- 框架在文本-图像语义对齐方面表现卓越,这在衡量组合准确性和提示遵循度的基准数据集上得到验证。
- 互补的区域扩散实现了对图像生成的精确局部控制,显著减少了基线扩散模型中常见的空间错位与对象重叠问题。
- 闭环重述与反馈机制能有效识别并纠正生成图像与输入提示之间的语义差异,从而提升最终图像质量。
- RPG 展现出与多种 MLLM 架构(如 MiniGPT-4)和扩散主干网络(如 ControlNet)的强兼容性,支持在不同模型间灵活部署。
- 该方法完全无需训练,仅在推理阶段运行,避免了微调或奖励模型预训练的需求,从而降低了计算与数据开销。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。