[论文解读] Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors
本文提出了 Make-A-Scene,一种文本到图像生成模型,通过利用分割标记引入场景先验,应用面向人类感知的损失函数以优化人脸和显著物体,同时将无分类器指导适配至 Transformer 模型,从而提升控制力与图像质量。该方法在 512×512 分辨率下实现了最先进水平的 FID(4.69)与人类偏好得分,支持高级功能如场景编辑、基于锚定场景的文本编辑以及故事插图生成。
Recent text-to-image generation methods provide a simple yet exciting conversion capability between text and image domains. While these methods have incrementally improved the generated image fidelity and text relevancy, several pivotal gaps remain unanswered, limiting applicability and quality. We propose a novel text-to-image method that addresses these gaps by (i) enabling a simple control mechanism complementary to text in the form of a scene, (ii) introducing elements that substantially improve the tokenization process by employing domain-specific knowledge over key image regions (faces and salient objects), and (iii) adapting classifier-free guidance for the transformer use case. Our model achieves state-of-the-art FID and human evaluation results, unlocking the ability to generate high fidelity images in a resolution of 512x512 pixels, significantly improving visual quality. Through scene controllability, we introduce several new capabilities: (i) Scene editing, (ii) text editing with anchor scenes, (iii) overcoming out-of-distribution text prompts, and (iv) story illustration generation, as demonstrated in the story we wrote.
研究动机与目标
- 为解决文本到图像生成中仅使用文本作为输入导致的可控性不足问题,限制用户对图像结构与布局的控制。
- 通过引入人类感知先验,特别是针对人脸和显著物体,提升图像质量与分辨率,超越 256×256 分辨率。
- 通过基于场景的条件控制,实现如场景编辑、基于锚定场景的文本编辑以及故事插图生成等新型创意能力。
- 通过将无分类器指导直接集成到基于 Transformer 的自回归模型中,减少对生成后过滤的依赖。
提出的方法
- 该模型采用自回归 Transformer 架构,联合生成文本、图像与场景标记,其中场景标记源自分割图,提供隐式条件控制。
- 场景标记可由模型生成,也可从输入草图中提取,实现灵活控制,且无需强制分割与图像生成之间严格对齐。
- 采用两个改进的向量量化变分自编码器(VQ-VAEs)对图像与场景标记进行编码与解码,损失函数特别针对人脸与显著物体设计,以匹配人类感知。
- 提出面向对象与人脸的损失函数,利用特征匹配强调感知上重要的区域,提升视觉保真度。
- 将无分类器指导适配至基于 Transformer 的模型,消除对生成后图像排序的需求,提升生成质量。
- 该模型支持多种可控模式:仅文本生成、基于场景的条件生成、场景编辑以及基于锚定场景的文本编辑。
实验结果
研究问题
- RQ1基于场景的条件控制是否能超越仅使用文本输入,在文本到图像生成中提升结构一致性和可控性?
- RQ2将人类感知先验(特别是针对人脸与显著物体)引入后,对图像质量与人类偏好有何影响?
- RQ3基于 Transformer 的自回归模型是否能在 512×512 分辨率下实现最先进性能,同时提升保真度并减少伪影?
- RQ4场景控制在多大程度上能实现新功能,如场景编辑、分布外生成与故事插图生成?
- RQ5将无分类器指导适配至 Transformer 模型是否能提升生成质量,且无需后续处理?
主要发现
- 在使用场景输入与无分类器指导时,该模型实现了最先进水平的 FID(4.69),显著优于先前方法。
- 人类偏好评估显示,采用对象感知训练的 512×512 模型在图像质量上的偏好得分为 76.8%,优于低分辨率与非感知模型。
- 引入场景标记后,图像真实感(65.3%)与文本对齐度(58.3%)相比基线模型均有提升。
- 人脸感知训练使 FID 从 18.01 降低至 14.45,图像质量的人类偏好得分提升至 63.6%。
- 仅使用无分类器指导即可使 FID 降低至 7.55,同时提升真实感与对齐度的偏好得分至 66.8%。
- 该模型实现了新型功能,如场景编辑(例如将天空改为海洋)与基于锚定场景的文本编辑,展现出更高的连贯性与创意控制力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。