Skip to main content
QUICK REVIEW

[论文解读] Semantically Multi-modal Image Synthesis

Zhen Zhu, Zhiliang Xu|arXiv (Cornell University)|Mar 28, 2020
Generative Adversarial Networks and Image Synthesis参考文献 59被引用 4
一句话总结

本文提出GroupDNet,一种用于语义多模态图像合成(SMIS)的新颖生成器架构,通过在解码器中使用组卷积并逐步减少组数,实现从语义标签生成多样化、可控制图像的细粒度控制。该方法在DeepFashion和Cityscapes数据集上实现了最先进图像质量,在ADE20K等大类数据集上尤其保持高保真度的同时展现出优越的语义部分可控性。

ABSTRACT

In this paper, we focus on semantically multi-modal image synthesis (SMIS) task, namely, generating multi-modal images at the semantic level. Previous work seeks to use multiple class-specific generators, constraining its usage in datasets with a small number of classes. We instead propose a novel Group Decreasing Network (GroupDNet) that leverages group convolutions in the generator and progressively decreases the group numbers of the convolutions in the decoder. Consequently, GroupDNet is armed with much more controllability on translating semantic labels to natural images and has plausible high-quality yields for datasets with many classes. Experiments on several challenging datasets demonstrate the superiority of GroupDNet on performing the SMIS task. We also show that GroupDNet is capable of performing a wide range of interesting synthesis applications. Codes and models are available at: https://github.com/Seanseattle/SMIS.

研究动机与目标

  • 为解决现有方法在生成多样化、可控制图像方面,特别是在涉及多个类别时的局限性。
  • 克服多模态图像合成中多个类别专用生成器带来的效率低下与可扩展性问题。
  • 实现在保持图像质量和一致性的同时,用户可控制的语义级编辑——仅改变一个部分而不影响其他部分。
  • 提升在包含大量语义类别的数据集(如ADE20K)上的模型效率与可扩展性。
  • 开发统一的生成模型,支持多样化应用,如外观混合、语义操控和风格变形。

提出的方法

  • 将生成器中的所有标准卷积替换为组卷积,以实现类别特定的特征学习与控制。
  • 在解码器卷积中逐步减少组数,以建模类别间相关性(例如草与树叶之间的颜色一致性)。
  • 使用统一的生成器,结合组卷积层,实现在推理过程中对不同语义部分的独立控制。
  • 利用编码器从真实图像中提取风格码,以支持风格迁移与变形应用。
  • 采用基于GAN的训练框架,结合对抗损失、L1损失与感知损失,以确保图像的真实感与保真度。
  • 将GroupDNet生成器集成至类似SPADE的条件图像合成流程中,以实现一致的训练与评估。

实验结果

研究问题

  • RQ1与多个类别专用生成器相比,采用组卷积并逐步减少组数的统一生成器是否能在多模态图像合成中实现更优的可控性?
  • RQ2解码器中组数的渐进减少如何影响类别间相关性的建模与图像质量?
  • RQ3GroupDNet在实现对图像各部分的细粒度语义级控制的同时,能在多大程度上保持高图像质量?
  • RQ4GroupDNet能否泛化至多样化应用,如外观混合、语义操控与风格变形?
  • RQ5在如ADE20K等大规模数据集上,GroupDNet在FID、mIoU与准确率方面与最先进方法相比表现如何?

主要发现

  • GroupDNet在DeepFashion(FID 9.50)和Cityscapes(FID 49.81)上达到最先进FID分数,与SPADE及其他SOTA方法相当或更优。
  • 在ADE20K数据集上,GroupDNet取得mIoU 30.4与准确率77.1,尽管类别数量极高,仍优于所有基线方法。
  • 该模型展现出优越的可控性:改变一个语义部分(如衣物)不会影响其他部分,经定性结果验证。
  • GroupDNet支持新型应用,如外观混合(从单一掩码生成数千张独特人物图像)、语义操控(如插入一张床)与风格变形。
  • 与多生成器方法相比,该方法降低了训练与推理成本,推理速度接近多生成器基线的两倍。
  • 所提出的mCSD与mOCD度量表明,GroupDNet在目标类别中生成了高多样性,同时在其他类别中保持低多样性,表明其具备精确控制能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。