[论文解读] Image Synthesis From Reconfigurable Layout and Style
该论文提出LostGAN,一种生成对抗网络,能够从可重构布局(带类别标签的边界框)和解耦风格潜在码生成高分辨率(最高128×128)图像。该方法引入弱监督掩码学习与实例特定布局感知归一化(ISLA-Norm),实现在布局扰动与风格变化下的一致性、多样性与自适应图像生成,在COCO-Stuff与Visual Genome数据集上达到最先进性能。
Despite remarkable recent progress on both unconditional and conditional image synthesis, it remains a long-standing problem to learn generative models that are capable of synthesizing realistic and sharp images from reconfigurable spatial layout (i.e., bounding boxes + class labels in an image lattice) and style (i.e., structural and appearance variations encoded by latent vectors), especially at high resolution. By reconfigurable, it means that a model can preserve the intrinsic one-to-many mapping from a given layout to multiple plausible images with different styles, and is adaptive with respect to perturbations of a layout and style latent code. In this paper, we present a layout- and style-based architecture for generative adversarial networks (termed LostGANs) that can be trained end-to-end to generate images from reconfigurable layout and style. Inspired by the vanilla StyleGAN, the proposed LostGAN consists of two new components: (i) learning fine-grained mask maps in a weakly-supervised manner to bridge the gap between layouts and images, and (ii) learning object instance-specific layout-aware feature normalization (ISLA-Norm) in the generator to realize multi-object style generation. In experiments, the proposed method is tested on the COCO-Stuff dataset and the Visual Genome dataset with state-of-the-art performance obtained. The code and pretrained models are available at \url{https://github.com/iVMCL/LostGANs}.
研究动机与目标
- 为解决从可重构布局与风格生成逼真高分辨率图像的挑战,保持一对一多映射关系,并具备对布局/风格扰动的适应能力。
- 改进现有布局到图像生成模型在分辨率(如64×64)上的局限性,并提升风格多样性。
- 在保持空间一致性与对象身份的前提下,实现细粒度的实例级风格控制。
- 在无需真实分割掩码的情况下,以弱监督方式学习语义掩码图。
- 实现端到端的生成对抗网络训练,联合优化图像质量、多样性与布局一致性。
提出的方法
- 提出一种基于ResNets的新型生成器架构,引入对象实例特定的布局感知特征归一化(ISLA-Norm),以实现逐对象风格控制。
- 采用基于注意力的掩码权重进行弱监督学习,以细粒度掩码图桥接布局输入与图像输出,无需真实掩码。
- 采用基于ResNet的条件生成对抗网络框架,端到端训练判别器以增强真实感与布局一致性。
- 利用潜在风格码控制外观与结构,实现从同一布局生成多样化图像。
- 采用多尺度训练策略以稳定训练过程,并提升128×128分辨率下的图像生成质量。
- 结合对抗损失、感知损失与L1损失,以优化图像保真度与细节。
实验结果
研究问题
- RQ1基于GAN的模型能否从可重构布局与解耦风格码生成高分辨率(128×128)图像,同时保持一对一多映射关系?
- RQ2模型如何在无需真实分割掩码的情况下,从边界框布局学习有意义的语义掩码图?
- RQ3当布局发生扰动(如增加或移动边界框)时,模型能否维持对象身份与空间一致性?
- RQ4模型在多大程度上能实现实例级风格控制,实现对对象外观的独立操控?
- RQ5所提出的ISLA-Norm层是否能有效实现多对象风格生成,并提升视觉质量与多样性?
主要发现
- 在64×64分辨率下,LostGAN在COCO-Stuff数据集上取得28.81的Inception分数与15.6的FID,优于先前最先进方法Layout2Im。
- 在128×128分辨率下,LostGAN保持强劲性能,Inception分数为28.70,FID为16.2,证明其在更高分辨率下的可扩展性。
- 与Layout2Im相比,多样性分数显著提升,表明风格多样性增强,且有效实现了一对多映射。
- 在COCO-Stuff数据集上分类准确率分数(CAS)达到28.70,在Visual Genome数据集上达到25.89,表明对目标识别具有更好的泛化能力。
- 定性结果表明,LostGAN生成的图像在视觉真实感与语义一致性方面优于先前方法,尤其在布局扰动下表现更优。
- 消融实验验证ISLA-Norm与弱监督掩码学习显著提升了布局一致性与风格控制能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。