Skip to main content
QUICK REVIEW

[论文解读] Grounded Text-to-Image Synthesis with Attention Refocusing

Quynh Phung, Songwei Ge|arXiv (Cornell University)|Jun 8, 2023
Generative Adversarial Networks and Image Synthesis被引用 7
一句话总结

本文提出一种无需训练的注意力重聚焦方法,通过使用布局引导损失对交叉注意力和自注意力层进行正则化,以提升文本到图像生成的可控性。通过利用GPT-4生成空间布局,并应用新颖的SAR和R or SAR损失,该方法显著增强了对复杂提示的对齐能力——在空间关系和物体计数等基准任务上,准确率最高提升10%。

ABSTRACT

Driven by the scalable diffusion models trained on large-scale datasets, text-to-image synthesis methods have shown compelling results. However, these models still fail to precisely follow the text prompt involving multiple objects, attributes, or spatial compositions. In this paper, we reveal the potential causes in the diffusion model's cross-attention and self-attention layers. We propose two novel losses to refocus attention maps according to a given spatial layout during sampling. Creating the layouts manually requires additional effort and can be tedious. Therefore, we explore using large language models (LLM) to produce these layouts for our method. We conduct extensive experiments on the DrawBench, HRS, and TIFA benchmarks to evaluate our proposed method. We show that our proposed attention refocusing effectively improves the controllability of existing approaches.

研究动机与目标

  • 为解决在生成包含多个对象、属性和空间关系的复杂提示时,文本到图像扩散模型中持续存在的对齐不良问题。
  • 识别交叉注意力和自注意力层中的注意力错位是导致对象混淆、实体缺失和属性混淆的根本原因。
  • 开发一种与模型无关、无需训练的方法,通过显式的空间布局重聚焦注意力图,以提升可控性。
  • 探索使用GPT-4等大语言模型从自然语言提示中生成准确、结构化空间布局的可行性。
  • 通过结合大语言模型与基于视觉的文本到图像生成,实现基于语言的迭代式图像精修。

提出的方法

  • 提出两种新颖损失——SAR(空间注意力正则化)和R or SAR(基于对象级别的重聚焦正则化)——在采样过程中对交叉注意力和自注意力层的注意力图进行优化。
  • 使用空间布局(如带标签的边界框)作为监督信号,引导注意力聚焦于正确区域,减少外观相似对象之间的混淆。
  • 通过上下文学习和提示工程,将GPT-4与结构化、有效的布局表示生成相结合,从文本提示中提取布局。
  • 采用两阶段流程:首先通过大语言模型生成布局,然后使用基于视觉的扩散模型(如GLIGEN或ControlNet)生成图像。
  • 通过推理阶段应用损失,不微调基础文本到图像模型,确保与模型无关的兼容性。
  • 通过提示大语言模型修改布局,实现迭代式图像编辑,新布局用于生成更新后的图像。

实验结果

研究问题

  • RQ1交叉注意力和自注意力层中的注意力错位是否能解释多对象、属性丰富的文本到图像生成中的失败?
  • RQ2基于布局的损失是否能有效重聚焦注意力,减少对象混淆并提升提示对齐?
  • RQ3像GPT-4这样的大语言模型能否从自然语言提示中生成准确且有效的空间布局,以用于基于视觉的图像生成?
  • RQ4将大语言模型生成的布局与注意力重聚焦损失结合,是否在复杂基准测试中优于基线方法?
  • RQ5该框架是否能通过迭代式布局优化,支持交互式、基于语言的图像编辑?

主要发现

  • 将SAR和R or SAR损失应用于GLIGEN,在TIFA基准测试中性能最高提升10%,空间关系准确率提升6%。
  • 该方法在DrawBench、HRS和TIFA基准测试中均持续优于强基线模型,展现出对复杂提示的鲁棒性。
  • GPT-4在HRS基准测试中生成的布局格式准确率达98.5%,有效性达98.5%,正确率达88.5%,优于Llama 1、Llama 2和GPT-3。
  • 结合GPT-4与注意力重聚焦的两阶段流程,在提示理解力和对象关系对齐方面优于单阶段的Stable Diffusion。
  • 失败案例主要出现在提示涉及大量对象,或由于分布偏移导致布局到图像对齐失败时,尤其在物体计数和尺寸估计任务中。
  • 该框架通过大语言模型提示实现交互式图像编辑,用户可基于自然语言指令迭代优化图像。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。