[论文解读] Semantic Bottleneck Scene Generation
本文提出语义瓶颈生成对抗网络(SB-GAN),一种新型生成模型,首先从随机噪声合成逼真的语义分割图,然后基于这些图生成高保真图像。通过端到端联合训练分割网络与图像生成网络,SB-GAN 在 Cityscapes 和 ADE-Indoor 数据集上的无条件复杂场景生成任务中达到最先进性能,FID 指标与用户评测均优于先前方法。
Coupling the high-fidelity generation capabilities of label-conditional image synthesis methods with the flexibility of unconditional generative models, we propose a semantic bottleneck GAN model for unconditional synthesis of complex scenes. We assume pixel-wise segmentation labels are available during training and use them to learn the scene structure. During inference, our model first synthesizes a realistic segmentation layout from scratch, then synthesizes a realistic scene conditioned on that layout. For the former, we use an unconditional progressive segmentation generation network that captures the distribution of realistic semantic scene layouts. For the latter, we use a conditional segmentation-to-image synthesis network that captures the distribution of photo-realistic images conditioned on the semantic layout. When trained end-to-end, the resulting model outperforms state-of-the-art generative models in unsupervised image synthesis on two challenging domains in terms of the Frechet Inception Distance and user-study evaluations. Moreover, we demonstrate the generated segmentation maps can be used as additional training data to strongly improve recent segmentation-to-image synthesis networks.
研究动机与目标
- 为解决条件 GAN 模型依赖真实分割图作为输入所带来的灵活性限制,以提升无条件场景生成的灵活性。
- 结合标签条件模型的高保真图像生成能力与基于噪声的 GAN 模型的无条件生成灵活性。
- 学习一种解耦表征,其中全局场景结构通过语义布局生成建模,局部细节通过条件图像生成建模。
- 通过使用合成分割图作为额外训练数据,提升现有语义图像生成模型的性能。
提出的方法
- 模型采用两阶段流程:首先,一个无条件渐进式分割生成网络从随机噪声中合成逼真的像素级语义标签图。
- 其次,一个条件式分割到图像生成网络基于合成的语义布局生成照片级真实感图像。
- 分割生成器通过对抗判别器进行训练,以生成外观逼真的布局;图像生成器则同时使用条件与无条件判别器进行训练,以确保图像的真实感与一致性。
- 端到端训练联合优化两个组件,使分割生成器能够生成语义一致且有利于高质量图像生成的布局。
- 模型采用渐进式训练与多判别器对抗训练策略,以稳定学习过程并提升生成样本质量。
- 训练过程中生成的合成分割图被重新用于微调当前最先进条件模型(如 SPADE),从而提升其在真实标注数据上的性能。
实验结果
研究问题
- RQ1生成模型能否在保持全局结构一致性与局部真实感的前提下,无条件地合成复杂且高分辨率的场景?
- RQ2由 GAN 生成的语义布局能否作为高保真图像生成的有意义且真实的瓶颈?
- RQ3端到端联合训练分割生成器与图像生成器是否优于分别独立训练?
- RQ4模型生成的合成分割图能否作为训练数据提升现有语义图像生成网络的性能?
主要发现
- SB-GAN 在 Cityscapes-5k(FID 58.67)与 Cityscapes-25k(FID 54.13)数据集上达到最先进 FID 分数,优于 ProGAN 与 BigGAN 的无条件图像生成性能。
- 在 ADE-Indoor 数据集上,SB-GAN 的 FID 达到 48.15,显著优于基线模型 SPADE。
- 在 Mechanical Turk 上的用户评测显示,SB-GAN 在 Cityscapes-25k 上的平均质量得分为 2.61,在 ADE-Indoor 上为 2.49,优于 ProGAN 与 BigGAN。
- 将 SB-GAN 的条件图像生成子网络在合成标签上进行微调,相比从零开始训练,Cityscapes-5k 上 FID 提升 5.0%。
- 消融实验表明,完整端到端微调性能最佳(FID 58.67),联合微调优于逐组件微调。
- 将 SB-GAN 生成的合成分割图用于微调当前最先进模型 SPADE,可显著提升其性能,证明其在语义图像生成任务中作为数据增强的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。