[论文解读] Diverse Semantic Image Synthesis via Probability Distribution Modeling
本文提出 INADE,一种用于多样化语义图像生成的新框架,通过将类别相关的调制参数建模为连续概率分布,实现实例级和语义级的多样性。通过使用实例自适应的随机采样和先验噪声重映射,INADE 在保持或提升图像质量的同时实现了最先进水平的多样性,在多个数据集上的定量指标和定性结果上均优于现有方法。
Semantic image synthesis, translating semantic layouts to photo-realistic images, is a one-to-many mapping problem. Though impressive progress has been recently made, diverse semantic synthesis that can efficiently produce semantic-level multimodal results, still remains a challenge. In this paper, we propose a novel diverse semantic image synthesis framework from the perspective of semantic class distributions, which naturally supports diverse generation at semantic or even instance level. We achieve this by modeling class-level conditional modulation parameters as continuous probability distributions instead of discrete values, and sampling per-instance modulation parameters through instance-adaptive stochastic sampling that is consistent across the network. Moreover, we propose prior noise remapping, through linear perturbation parameters encoded from paired references, to facilitate supervised training and exemplar-based instance style control at test time. Extensive experiments on multiple datasets show that our method can achieve superior diversity and comparable quality compared to state-of-the-art methods. Code will be available at \url{https://github.com/tzt101/INADE.git}
研究动机与目标
- 为解决从语义布局生成多样化、高保真、逼真图像的挑战,尤其是在实例级别上。
- 克服现有方法仅支持全局或语义级多样性,或计算成本过高的局限性。
- 通过调制参数的连续概率分布,实现细粒度、可控的多样性。
- 通过先验噪声重映射支持推理时基于参考图像的风格控制,实现实例级编辑。
提出的方法
- 提出变分调制模型,将类别相关的条件归一化参数表示为连续概率分布,而非固定值。
- 引入实例自适应的调制参数随机采样,通过一致的随机性和可学习的变换保持网络内的一致性。
- 使用从成对参考图像编码的线性扰动参数进行先验噪声重映射,以增强监督训练,并在推理时实现基于参考的风格控制。
- 将该方法集成到带有实例感知归一化的条件 GAN 框架中,命名为 INADE(实例自适应 DE 归一化)。
- 为每个归一化层使用可学习变换,以对齐网络内的随机采样,确保生成的稳定性。
- 利用成对参考图像编码扰动参数,对噪声样本进行重映射,实现在推理阶段的示例式风格迁移。
实验结果
研究问题
- RQ1将调制参数建模为连续概率分布是否能实现更灵活、更具多样性的实例级图像生成?
- RQ2如何在深层网络中实现一致且连贯的随机采样,以在保持图像质量的同时实现多样性?
- RQ3从参考图像进行先验噪声重映射是否能提高训练效率,并在不增加额外推理分支的情况下实现实时风格控制?
- RQ4在复杂数据集上,该方法与现有最先进方法相比,在多样性、质量及计算效率方面表现如何?
- RQ5该方法在复杂场景中支持语义级和实例级多模态生成的程度如何?
主要发现
- INEA 在 Cityscapes、ADE20K、CelebAMask-HQ 和 DeepFashion 数据集上整体性能最佳,所有指标均优于最先进方法。
- 在 Cityscapes 和 ADE20K 上,INADE 显著优于 GroupDNet,FID 和 LPIPS 指标更优,推理时间减少 59% 至 79%,FLOPs 减少 82% 至 89%。
- 消融研究证实,若移除实例级采样(US),方法性能会完全失效;若移除先验噪声重映射(PNR),图像质量将显著下降。
- 定性结果表明,INADE 生成的图像比 BicycleGAN、DSCGAN、VSPADE 和 GroupDNet 更为真实且更具多样性,尤其在包含多个交互实例的复杂场景中表现更优。
- 该方法支持语义级和实例级编辑,可实现对特定对象(如发型、上衣、长裤)的基于参考的外观迁移。
- INEA 在保持高生成质量的同时实现细粒度控制,FID 分数与或优于最先进方法,即使后者使用额外的参考输入。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。