[论文解读] Modeling Image Composition for Complex Scene Generation
本文提出了一种带有焦点注意力机制的Transformer(TwFA),通过利用空间布局先验,将复杂场景生成中的对象级关系与图像块级实例结构解耦。通过仅关注相关标记——对象标记用于建模全局关系,对象边界框内的图像块标记用于建模局部结构——TwFA在COCO-stuff数据集上实现了22.15的SOTA FID分数,在Visual Genome数据集上实现了17.74的SOTA FID分数,同时在极少量数据下实现了高效的 few-shot 生成。
We present a method that achieves state-of-the-art results on challenging (few-shot) layout-to-image generation tasks by accurately modeling textures, structures and relationships contained in a complex scene. After compressing RGB images into patch tokens, we propose the Transformer with Focal Attention (TwFA) for exploring dependencies of object-to-object, object-to-patch and patch-to-patch. Compared to existing CNN-based and Transformer-based generation models that entangled modeling on pixel-level&patch-level and object-level&patch-level respectively, the proposed focal attention predicts the current patch token by only focusing on its highly-related tokens that specified by the spatial layout, thereby achieving disambiguation during training. Furthermore, the proposed TwFA largely increases the data efficiency during training, therefore we propose the first few-shot complex scene generation strategy based on the well-trained TwFA. Comprehensive experiments show the superiority of our method, which significantly increases both quantitative metrics and qualitative visual realism with respect to state-of-the-art CNN-based and transformer-based methods. Code is available at https://github.com/JohnDreamer/TwFA.
研究动机与目标
- 解决生成包含多个对象、准确关系和精细纹理的逼真复杂场景的挑战。
- 克服基于CNN和基于Transformer的方法中同时学习图像块级与对象级表征所导致的表征纠缠问题。
- 通过解耦对象级与图像块级构图建模,提升few-shot学习中的数据效率。
- 在仅需极少监督的情况下,实现高保真度、可控的图像生成,输入条件为布局信息(边界框与类别)。
提出的方法
- 使用预训练的压缩模型将输入的RGB图像压缩为离散的图像块标记。
- 引入一种带有焦点注意力机制的Transformer(TwFA),以区分对象标记与图像块标记,分别进行建模。
- 在对象级注意力中,每个对象标记关注所有其他对象标记,以捕捉全局空间关系。
- 在图像块级注意力中,每个图像块标记仅关注其所属的对象以及同一对象边界框内的其他图像块。
- 通过布局引导的连通性矩阵施加注意力约束,确保仅关注相关标记,从而减少噪声并提升表征清晰度。
- 在少量新对象类别的图像上微调预训练的TwFA模型,以实现few-shot复杂场景生成。
实验结果
研究问题
- RQ1能否重构自注意力机制,以在图像生成中解耦对象级关系与图像块级实例结构?
- RQ2将空间布局先验融入注意力机制是否能提升生成质量与数据效率?
- RQ3解耦的注意力机制是否能实现仅用极少训练数据对新对象类别进行有效few-shot图像生成?
- RQ4与标准自注意力和基于网格的注意力相比,焦点注意力在建模复杂场景构图方面表现如何?
主要发现
- TwFA在COCO-stuff数据集上实现了22.15的新SOTA FID分数,相比之前的SOTA(29.56)提升了25.1%。
- 在Visual Genome数据集上,TwFA将FID从19.14降低至17.74,相对提升7.3%。
- 在few-shot L2I生成中,TwFA使用50张支持样本时,FID为31.53,对象特定FID(Obj-FID)为26.73,优于基线Grid16*(FID: 37.47,Obj-FID: 32.81)。
- 消融实验表明,对象与对象之间的交互对全局结构推理至关重要,而对象-图像块及图像块-图像块之间的交互显著提升了图像的真实感。
- 所提出的焦点注意力机制优于基于网格的注意力(Grid4、Grid16),并实现了更优的视觉质量,尤其在保留细节与对象完整性方面表现更优。
- 可视化结果表明,即使仅使用2至50张新对象的数据,TwFA也能生成更清晰、更结构化的对象(如人脸、斑马、企鹅),优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。