[论文解读] Shape-Guided Diffusion with Inside-Outside Attention
本文提出Shape-Guided Diffusion,一种无需训练的方法,通过在反演和生成过程中引入Inside-Outside Attention机制,增强文本到图像扩散模型在形状感知图像编辑方面的能力。该方法在不损害文本对齐或图像真实感的前提下,提升了对象编辑中的形状保真度,在基于MS-COCO的新基准上实现了最先进性能,标注者偏好度比次佳基线高出2.7倍。
We introduce precise object silhouette as a new form of user control in text-to-image diffusion models, which we dub Shape-Guided Diffusion. Our training-free method uses an Inside-Outside Attention mechanism during the inversion and generation process to apply a shape constraint to the cross- and self-attention maps. Our mechanism designates which spatial region is the object (inside) vs. background (outside) then associates edits to the correct region. We demonstrate the efficacy of our method on the shape-guided editing task, where the model must replace an object according to a text prompt and object mask. We curate a new ShapePrompts benchmark derived from MS-COCO and achieve SOTA results in shape faithfulness without a degradation in text alignment or image realism according to both automatic metrics and annotator ratings. Our data and code will be made available at https://shape-guided-diffusion.github.io.
研究动机与目标
- 为解决现有文本到图像扩散模型在编辑过程中无法保持对象形状的问题,特别是在替换或修改对象时。
- 开发一种无需训练的方法,通过注意力机制在反演和生成过程中施加形状约束。
- 评估在必须保持对象轮廓和空间结构的任务中形状保真度的表现。
- 在手动提供和自动推断的对象掩码(包括反射和重叠实例等复杂情况)上展示方法的有效性。
- 建立一个新的基准ShapePrompts,用于在MS-COCO上评估形状引导编辑。
提出的方法
- 提出Inside-Outside Attention机制,通过修改交叉注意力和自注意力图,使对象令牌仅关注对象掩码内的像素(内部),背景令牌仅关注外部。
- 在DDIM反演和图像生成过程中均应用注意力约束,从而在潜在噪声中更好地保留形状信息。
- 使用冻结的预训练文本到图像扩散模型,避免微调或重新训练。
- 在注意力图上施加软形状约束,消融实验表明其性能优于硬约束。
- 利用DDIM反演恢复能更好保留源图像形状的噪声,随后通过注意力约束进行优化。
- 支持对象级和背景级编辑,包括使用独立文本提示的同步内外编辑。
实验结果
研究问题
- RQ1为何现有文本到图像扩散模型在编辑过程中(尤其是替换或修改对象时)无法保持对象形状?
- RQ2能否通过在反演和生成过程中约束注意力图,实现无需训练的方法来提升图像编辑中的形状保真度?
- RQ3Inside-Outside Attention与基线方法(如“复制背景”或微调)相比,在保持对象形状和真实感方面表现如何?
- RQ4该方法在自动推断的掩码(如来自文本提示或复杂场景结构的掩码)上的泛化能力如何?
- RQ5该方法能否在保持空间一致性和对象-背景关系的前提下,支持同步的内部和外部编辑?
主要发现
- 我们的方法在MS-COCO ShapePrompts基准上实现了最先进的形状保真度,相比未使用Inside-Outside Attention的消融版本,KW-mIoU提升9.5分。
- 标注者在43%的时间内选择我们的方法为最佳编辑,是次佳基线P2P + Shape的2.7倍。
- 该方法保持了高图像真实感和文本对齐度,48%的标注者认为其在这两方面表现更优——分别比最具有竞争力的基线高出1.3倍和1.9倍。
- 即使仅在生成的前半段应用形状引导,Inside-Outside Attention提供的形状信号也强于依赖早期时间步弱形状信号的“复制背景”方法。
- 未使用Inside-Outside Attention的消融实验仍优于除P2P + Shape外的所有基线,证实了DDIM反演和注意力机制的关键作用。
- 该方法成功实现了多样化编辑,包括同类和跨类对象变换、背景编辑以及同步的内外编辑,保持了源图像中的空间和结构关系。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。